统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
机器学习社区是否在滥用“以……为条件”和“以……为参数”?
假设取决于。严格来说,αXXXαα\alpha 如果和都是随机变量,我们可以写 ;α p (X | α )XXXαα\alphap (X| α )p(X∣α)p(X\mid\alpha) 但是,如果是一个随机变量,是一个参数,我们必须编写。α p (X ; α )XXXαα\alphap (X; α )p(X;α)p(X; \alpha) 我几次注意到机器学习社区似乎忽略了差异并滥用了这些术语。 例如,在著名的LDA模型中,是Dirichlet参数而不是随机变量。αα\alpha 它不应该是吗?我看到很多人,包括LDA论文的原始作者,都将其写为。p (θ | α )p (θ ; α )p(θ;α)p(\theta;\alpha)p (θ | α )p(θ∣α)p(\theta\mid\alpha)

3
最大可能性或边际可能性哪一个更好,为什么?
在执行回归时,如果我们遵循以下定义:部分可能性,轮廓可能性和边际可能性之间的区别是什么? 即,最大似然 找到使L(β,θ| data)最大化的β和θ。 同时,边际似然 我们利用可以识别以β为条件的θ的概率分布这一事实,将θ从似然方程中积分出来。 哪种方法可以最大化最大化?为什么?

1
使用Engle–Granger两步法测试两个时间序列之间的协整
我正在尝试测试两个时间序列之间的协整关系。这两个系列的每周数据跨度约为3年。 我正在尝试做Engle-Granger两步法。我的操作顺序如下。 通过增强Dickey-Fuller测试每个时间序列的单位根。 假设两者都有单位根,则通过OLS找到关系的线性近似。然后创建一系列残差。 通过增强Dickey-Fuller测试单位根的残差。 根据3的结果得出(或不)协整。 问题: 这种方法看起来还好吗?(我是一名本科生,我希望以一种合法的方式来分析我的数据,而不必以最严格的已知方法来对其进行分析。) 如果在第1步中一个序列不能用ADF拒绝零假设(因此没有单位根),是否可以合理地得出结论,因为一个数据集是非平稳的,所以两个序列未进行协整?我不这么认为,但我想确定。 两个数据集看起来都是“随机的”,所以我想知道使用OLS来测量关系以获得残差是否合适。

4
在业务环境中进行统计分析的良好做法
(虽然我意识到这不完全是统计信息,而是有关在业务环境中分发统计信息,所以我认为统计信息仍在CV的主题范围内) 简要背景: 我们的业务环境(我怀疑其他环境)具有支持功能,专门从事统计分析和研究。我们与商业情报部门紧密合作,并受其他部门的委托进行工作。实际上,数据,分析和结论不属于我们:我们收集数据,进行分析并得出结论,以供专员在其工作中使用。 我想做的事: 目前,我们采用放任自流的方式。在调试工作时,将分配支持功能中的个人,由商务智能收集(或提取数据,如果有的话),进行分析,并将最终结论发送给专员。松散的理由是,通读分析不是专员的职责;确保支持我们对专员要探讨的问题/主题提供正确的分析是我们的支持职能。 我想在制作方法上调用更多的结构 a)我们对更高质量的分析; b)当我们的分析可能导致错误的决定时提供辩护;和做 c)我们的分析更加透明,因此我们不会被视为收集数据并吐出结果的“黑匣子”。 我最初的想法是: 制作包含每项工作的技术文档,以证明所采用的方法,所作的假设,发现的问题,存在的不确定性等。尽管不一定所有人都可以理解,但应将其用作解释以下内容的方法:专员使用得出的结论的后果。这会将一些风险转移到感觉应该属于的地方:委托人。 将所有分析限制在一个软件包中,例如Stata,SPSS或R,并要求在技术文档的旁边生成一整套代码。我们所有人都有使用Microsoft Excel进行某些类型的分析的习惯(坏习惯比什么都重要)。但是,Excel不能促进分析的简单可重复性。这有助于在质疑我们的分析时捍卫支持职能,在我们的方法中建立透明性,而且使(3)的角色更加容易: 为每件必须分配“签核”工作的作品分配一位审稿人,然后再将其发送给专员。通过加签,它将分析的完整性分配给2个人,并鼓励他们共同努力(2个负责人比1个负责任)。这将提高分析质量,并提供一定的辩护性。 在这种商业环境中是否还有其他可以应用的良好实践方面?

3
为什么对于正态分布数据,Wilcoxon检验的渐进相对效率与Student的t检验相比?
众所周知,如果数据来自正态分布总体,则Wilcoxon符号秩检验的渐近相对效率(ARE)与Student t检验相比为。基本的一样本测试和两个独立样本的变体(Wilcoxon-Mann-Whitney U)都是如此。对于正常数据,与ANOVA F检验相比,它也是Kruskal-Wallis检验的ARE 。3π≈0.9553π≈0.955\frac{3}{\pi} \approx 0.955 这个显着的结果(对我来说,是ππ\pi的“ 最意外的外观之一 ”)和非常简单的结果是否有深刻的,显着的或简单的证明?

2
曼惠特尼U检验:效应大小的置信区间
根据弗里茨,莫里斯和Richler(2011;见下文),可被计算为使用下式的曼-惠特尼U检验的效果大小 - [R = ž[Rrr 这是方便我,我报告[R在其他场合也。除了效果量度,我还要报告r的置信区间。[R = žñ--√r=zN r = \frac{z}{\sqrt N} [Rrr[Rrr 这是我的问题: 我可以像皮尔逊的r一样计算r的置信区间,尽管它被用作非参数检验的效应量度? 一尾测试与二尾测试必须报告什么置信区间? 编辑有关第二个问题的内容:“单尾测试与两尾测试必须报告什么置信区间?” 我发现了一些其他信息,恕我直言可能会回答这个问题。“虽然两边的置信限形成一个置信区间,但它们的单边对应物被称为上下置信界限。” (http://en.wikipedia.org/wiki/Confidence_interval)。从这些信息中,我得出结论,重要性检验(例如检验)是一尾还是二尾不是主要问题,而是关于效应大小的CI感兴趣的信息是什么。我的结论(如果您不同意,请纠正我):Ťtt 两侧CI 对上限和下限感兴趣(因此,尽管单尾显着性检验为p <.05,尤其是在值接近的情况下,两侧CI可能为0。 05.)→→\rightarrow 一侧的“ CI” 仅对上限或下限感兴趣(由于理论推理);然而,在检验了有针对性的假设之后,这并不一定是主要关注的问题。如果将焦点放在效果大小的可能范围上,则双面CI则非常合适。对?→→\rightarrow 弗里兹,莫里斯和里奇勒(Fritz,Morris,&Richler(2011))的文字段落见下文,内容涉及我在上文中提到的曼·惠特尼检验的效应大小估计。 “我们在此描述的大多数效应量估计值都假设数据具有正态分布。但是,某些数据不满足参数检验的要求,例如,按序数而不是区间标度的数据。对于此类数据,研究人员通常使用非参数统计检验,例如曼恩·惠特尼检验和Wilcoxon检验,这些检验的重要性通常通过在样本量不太小的情况下将检验统计量的分布近似于分布来评估,而统计学包,如SPSS,运行这些测试报告适当ž除了为值值û或Ť ; žžzzžzzüUUŤTTžzz也可以手工计算(例如,Siegel&Castellan,1988)。所述值可以用于计算作用大小,如ř由科恩(1988)提出; Cohen的r准则是:大影响为0.5,中影响为0.3,小影响为0.1(Coolican,2009,第395页)。这是很容易计算- [R ,- [R 2,或η 2从这些Ž值,因为 - [R = žžzz[Rrr[Rrr[R2r2r^2η2η2\eta^2žzz 和 r2r=zN−−√r=zN r = \frac{z}{\sqrt N} 尽管公式中存在N,但这些效应大小的估计仍独立于样本大小。这是因为z对样本大小敏感。除以N的函数会从结果效应量估计中消除样本量的影响。”(第12页)r2orη2=z2Nr2orη2=z2N r^2\quad{\rm or}\quad \eta^2 …

5
如何降低时间序列的趋势?
如何降低时间序列的趋势?可以先采取区别对待并进行Dickey Fuller测试,如果它静止不动,那么我们还好吗? 我还在网上发现,可以通过在Stata中进行以下操作来消除时间序列的趋势: reg lncredit time predict u_lncredit, residuals twoway line u_lncredit time dfuller u_lncredit, drift regress lags(0) 降低时间序列的最佳方法是什么?

5
在给学生评分时,如何最好地应对慷慨程度不同的标记的影响?
大约600名学生在广泛的评估中获得了分数,可以认为它具有良好的信度/效度。评估得分为100分,这是计算机标记的多项选择题。 这600名学生在第二次较小的评估中也得到了分数。在第二项评估中,他们被分为11个小组,分别由11个不同的评分者组成,并且就评分的“慷慨性”或不存在评分者而言,评分者之间存在很大的差异。第二项评估也得分为100分。 没有将学生随机分配给同类群组,并且有充分的理由期望各个群组之间的技能水平有所不同。 我的任务是确保第二项作业的同类标记之间的差异不会对每个学生产生实质性的优势/劣势。 我的想法是在第二次评估中获得同类群组分数,以在第一个评估中与同类群组分数保持一致,同时保持同类群组中的个体差异。我们应该假设我有充分的理由相信,两项任务的执行情况将高度相关,但是标记的慷慨程度相差很大。 这是最好的方法吗?如果没有,那是什么? 如果回答者可以给出一些有关如何实施好的解决方案的实用技巧,例如R或SPSS或Excel,将不胜感激。

1
R:检验线性模型残差的正态性-使用哪些残差
我想对线性模型的残差进行Shapiro Wilk的W检验和Kolmogorov-Smirnov检验,以检查正态性。我只是想知道应该使用什么残差-原始残差,Pearson残差,学生化残差或标准化残差?对于Shapiro-Wilk的W检验,原始和Pearson残差的结果似乎相同,而其他残差的结果则不同。 fit=lm(mpg ~ 1 + hp + wt, data=mtcars) res1=residuals(fit,type="response") res2=residuals(fit,type="pearson") res3=rstudent(fit) res4=rstandard(fit) shapiro.test(res1) # W = 0.9279, p-value = 0.03427 shapiro.test(res2) # W = 0.9279, p-value = 0.03427 shapiro.test(res3) # W = 0.9058, p-value = 0.008722 shapiro.test(res4) # W = 0.9205, p-value = 0.02143 关于KS的同样问题,以及是否应按照以下方法针对正态分布(范数)测试残差 ks.test(res1, "pnorm") # …

1
观测值不独立时的无效推论
我在基本统计中了解到,对于一般的线性模型而言,要使推论有效,观察必须是独立的。发生聚类时,除非考虑到这一点,否则独立性不再可能导致无效的推理。解决这种聚类的一种方法是使用混合模型。我想找到一个示例数据集,无论是否模拟,都可以清楚地说明这一点。我尝试使用UCLA网站上的示例数据集之一来分析聚类数据 > require(foreign) > require(lme4) > dt <- read.dta("http://www.ats.ucla.edu/stat/stata/seminars/svy_stata_intro/srs.dta") > m1 <- lm(api00~growth+emer+yr_rnd, data=dt) > summary(m1) Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 740.3981 11.5522 64.092 <2e-16 *** growth -0.1027 0.2112 -0.486 0.6271 emer -5.4449 0.5395 -10.092 <2e-16 *** yr_rnd -51.0757 19.9136 -2.565 0.0108 * > m2 <- lmer(api00~growth+emer+yr_rnd+(1|dnum), …



1
为什么不总是使用集成学习?
在我看来,集成学习将始终比仅使用单个学习假设提供更好的预测性能。 那么,为什么我们不一直使用它们呢? 我的猜测可能是因为计算方面的限制?(即使那样,我们也使用弱预测变量,所以我也不知道)。

1
如何测试分配是否遵循幂定律?
我有关于多少用户发布多少问题的数据。例如, [UserCount, QuestionCount] [2, 100] [9, 10] [3, 80] ... ... 这意味着2个用户每个发布了100个问题,9个用户每个发布了10个问题,依此类推。那么,如何确定UserCount, QuestionCount分布是否遵循幂律? 我找到了poweRlaw软件包。但是,我只能传递一组数字来进行评估。(此软件包中提供的示例是单词频率。)那么,如何使用此软件包?还是我有什么问题?我也有每个用户的问题计数的数据,即[100, 100, 10, 10, 10 ... ]。如果我将此数据传递给程序包,我将得到什么?

1
为什么R的lm()返回的系数估算值与我的教科书不同?
背景 我正在尝试了解拟合模型课程中的第一个示例(因此,这似乎很简单)。我已经手工完成了计算,并且它们与示例匹配,但是当我在R中重复计算时,模型系数不可用。我认为差异可能是由于总体方差使用教科书(),而R可以是使用样本方差(小号2),但我不能看到这些在计算中使用。例如,如果在 某处使用,请注意以下帮助部分:σ2σ2\sigma^2小号2S2S^2lm()var()var() 分母n-1用于给出iid观测的(协)方差的无偏估计。 我已经看过了两者的代码lm(),lm.fit()并且都没有使用var(),但是lm.fit()将数据传递给了z <- .Call(C_Cdqrls, x, y, tol, FALSE)我无法访问的已编译C代码()。 题 谁能解释R为什么给出不同的结果?即使样本方差与总体方差的使用有所不同,为什么系数估计也不同? 数据 设置一条线以根据学校年级预测鞋子的大小。 # model data mod.dat <- read.table( text = 'grade shoe 1 1 2 5 4 9' , header = T); # mean mod.mu <- mean(mod.dat$shoe); # variability mod.var <- sum((mod.dat$shoe - mod.mu)^2) # model coefficients …
13 r  regression  self-study  lm 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.