统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
当所有可能性都包含在混合效应模型中时,固定效应与随机效应
在混合效应模型中,建议包括所有可能的水平(例如,男性和女性)时,使用固定效应来估计参数。如果所包含的水平只是人群中的随机样本(可能的患者中已入组的患者),并且您想估算人群的均值和方差而不是均值,则建议使用随机效应来解释变量各个因素水平。 我想知道您是否在逻辑上总是以这种方式使用固定效果。考虑一项关于脚/鞋的尺寸如何随着发育而变化并与身高,体重和年龄相关的研究。 Side小号一世dË{\rm Side}很显然,必须以某种方式将模型包括在模型中,以说明以下事实:多年来的测量值嵌套在给定的脚内并且不是独立的。此外,左右都是可能存在的所有可能性。另外,对于给定的参与者,他们的右脚大于(或小于)他们的左脚可能是非常正确的。但是,尽管所有人的脚之间的脚大小确实有所不同,但没有理由相信右脚平均会比左脚大。如果他们在您的样本中,那可能是由于您样本中的人的遗传因素所致,而不是右脚固有的原因。最后,sides一世dË{\rm side}似乎是多余参数,不是你真正关心的。 让我注意,我编造了这个示例。可能没有什么好处。只是为了传达想法。就我所知,要在古石器中生存,必须有一个大右脚和一个小左脚。 在这样的情况下,它将使(更多/更少/任何)感纳入sides一世dË{\rm side}模型作为随机效应?在这里使用固定效果与随机效果的利弊是什么?

11
在图形上显示三条信息
注意:现在已附加50点原始数据。 我想显示我已经完成了多少研究,一周中完成了多少页,并按天细分,并且如下所示: 我曾有人告诉我他们不懂这些图,但是我不知道该如何显示它们。因为我本质上需要三个维度而无需进行累积描述。我要避免使用大量折线图,因为几周后这些图将变得难以辨认。我无能为力吗? 如何更清楚地显示这些内容? Date Total Total pages 21/11/2014 2.4166 0 22/11/2014 0 0 23/11/2014 1.5833 4 24/11/2014 3.0166 13 25/11/2014 2.4999 6 26/11/2014 1.4833 3 27/11/2014 3.0499 6 28/11/2014 0 0 29/11/2014 2.4499 5 30/11/2014 2.8833 2 1/12/2014 0 0 2/12/2014 4.1166 8 3/12/2014 1.3333 5 4/12/2014 1.2499 3 …

3
在Kneser-Ney平滑中,如何处理看不见的单词?
从我所看到的,(二阶)Kneser-Ney平滑公式在某种程度上给定为 P2KN(wn|wn−1)=max{C(wn−1,wn)−D,0}∑w′C(wn−1,w′)+λ(wn−1)×Pcont(wn)PKN2(wn|wn−1)=max{C(wn−1,wn)−D,0}∑w′C(wn−1,w′)+λ(wn−1)×Pcont(wn) \begin{align} P^2_{KN}(w_n|w_{n-1}) &= \frac{\max \left\{ C\left(w_{n-1}, w_n\right) - D, 0\right\}}{\sum_{w'} C\left(w_{n-1}, w'\right)} + \lambda(w_{n-1}) \times P_{cont}(w_n) \end{align} 归一化因子为λ(wn−1)λ(wn−1)\lambda(w_{n-1}) λ(wn−1)=D∑w′C(wn−1,w′)×N1+(wn−1∙)λ(wn−1)=D∑w′C(wn−1,w′)×N1+(wn−1∙) \begin{align} \lambda(w_{n-1}) &= \frac{D}{\sum_{w'} C\left(w_{n-1}, w'\right)} \times N_{1+}\left(w_{n-1}\bullet\right) \end{align} 和单词w_n的延续概率Pcont(wn)Pcont(wn)P_{cont}(w_n)wnwnw_n Pcont(wn)=N1+(∙wn)∑w′N1+(∙w′)Pcont(wn)=N1+(∙wn)∑w′N1+(∙w′) \begin{align} P_{cont}(w_n) &= \frac{N_{1+}\left(\bullet w_{n}\right)}{\sum_{w'} N_{1+}\left(\bullet w'\right)} \end{align} 其中N1+(∙w)N1+(∙w)N_{1+}\left(\bullet w\right)是在以下单词中看到的上下文数www,或更简单地,是在给定单词w之前的不同单词\ bullet的数量。据我了解,该公式可以递归应用。∙∙\bulletwww 现在,对于不同的n-gram长度,此方法可以很好地处理未知上下文中的已知单词,但是无法解释的是当词典单词超出单词时该怎么办。我尝试按照此示例进行说明,该示例指出在unigram的递归步骤中,Pcont(/)=P0KN(/)=1VPcont(/)=PKN0(/)=1VP_{cont}(/) = P^0_{KN}(/) = \frac{1}{V}。然后,文档使用这两个引号Chen和Goodman来证明上述公式为P1KN(w)=Pcont(w)PKN1(w)=Pcont(w)P^1_{KN}(w) = P_{cont}(w)。 …

4
如何发展条件概率的直觉?
在可以在iTunes和YouTube上找到的哈佛大学统计110:概率课程的视频讲座中,我遇到了这个问题。 我试图在这里总结一下: 假设我们从标准牌组中随机获得两张牌。 如果我们至少有一张王牌,那么两张牌都是王牌的概率是多少? P(both aces|have ace)=P(both aces,have ace)P(have ace)P(both aces|have ace)=P(both aces,have ace)P(have ace) P(both\ aces | have\ ace) = \frac{P(both\ aces, have\ ace)}{P(have\ ace)} 由于如果您同时拥有两个A,则意味着至少要有一个A,因此可以将交集减少为P(both aces)P(both aces)P(both\ aces) P(both aces|have ace)=P(both aces)P(have ace)P(both aces|have ace)=P(both aces)P(have ace) P(both\ aces | have\ ace) = \frac{P(both\ aces)}{P(have\ ace)} 这就是 P(both …

2
GLM的归一化变换的推导
\newcommand{\E}{\mathbb{E}}如何是A(⋅)=∫duV1/3(μ)A(⋅)=∫duV1/3(μ)A(\cdot) = \displaystyle\int\frac{du}{V^{1/3}(\mu)}正火变换为指数族衍生? XXXh(X)h(X)h(X)κiκi\kappa _iithithi^{th}κ3(h(X¯))≈h′(μ)3κ3(X¯)N2+3h′(μ)2h′′(μ)σ4N+O(N−3),κ3(h(X¯))≈h′(μ)3κ3(X¯)N2+3h′(μ)2h″(μ)σ4N+O(N−3), \kappa _3(h(\bar{X})) \approx h'(\mu)^3\frac{\kappa _3(\bar{X})}{N^2} + 3h'(\mu)^2h''(\mu)\frac{\sigma^4}{N} + O(N^{-3}), h(X)h(X)h(X) 我的第一个问题是关于算术的:我的泰勒展开式具有不同的系数,我不能证明他们放弃了许多项。 Since h(x)h(X¯)−h(u)E(h(X¯)−h(u))3≈h(μ)+h′(μ)(x−μ)+h′′(x)2(x−μ)2, we have:≈h′(u))(X¯−μ)+h′′(x)2(X¯−μ)2≈h′(μ)3E(X¯−μ)3+32h′(μ)2h′′(μ)E(X¯−μ)4+34h′(μ)h′′(μ)2E(X¯−μ)5+18h′′(μ)3E(X¯−μ)6.Since h(x)≈h(μ)+h′(μ)(x−μ)+h″(x)2(x−μ)2, we have:h(X¯)−h(u)≈h′(u))(X¯−μ)+h″(x)2(X¯−μ)2E(h(X¯)−h(u))3≈h′(μ)3E(X¯−μ)3+32h′(μ)2h″(μ)E(X¯−μ)4+34h′(μ)h″(μ)2E(X¯−μ)5+18h″(μ)3E(X¯−μ)6.\begin{align} \text{Since }h(x) &\approx h(\mu) + h'(\mu)(x - \mu) + \frac{h''(x)}{2}(x - \mu)^2\text{, we have:} \\ h(\bar{X}) - h(u) &\approx h'(u))(\bar{X} - \mu) + \frac{h''(x)}{2}(\bar{X} - \mu)^2 \\ …

2
如何拟合混合模型以进行聚类
我有两个变量-X和Y,我需要使簇最大(最优)=5。让我们理想的变量图如下所示: 我想做5个这样的集群。像这样: 因此,我认为这是具有5个群集的混合模型。每个聚类都有中心点和围绕它的置信度。 这些簇并不总是这样,它们看起来如下所示,其中有时两个簇靠在一起,或者一个或两个簇完全缺失。 在这种情况下如何有效地拟合混合模型并进行分类(聚类)? 例: set.seed(1234) X <- c(rnorm(200, 10, 3), rnorm(200, 25,3), rnorm(200,35,3), rnorm(200,65, 3), rnorm(200,80,5)) Y <- c(rnorm(1000, 30, 2)) plot(X,Y, ylim = c(10, 60), pch = 19, col = "gray40")

1
我应该对高度偏斜的数据使用t检验吗?请科学证明吗?
我有一个高度偏斜的(看起来像指数分布)数据集有关用户参与的样本(例如,帖子数),样本大小不同(但不少于200个),我想比较它们的平均值。为此,我使用了两个样本的不成对t检验(以及当样本具有不同的方差时,使用带有Welch因子的t检验)。据我所知,对于非常大的样本,样本不是正态分布的都没关系。 有人回顾了我所做的事情后说,我使用的测试不适合我的数据。他们建议在使用t检验之前对样本进行对数转换。 我是一个初学者,因此使用“参与度指标的对数”回答我的研究问题确实让我感到困惑。 他们错了吗?我错了吗?如果它们是错误的,是否有我可以引用/展示的书籍或科学论文?如果我错了,应该使用哪个测试?

4
一堆飞机事故有多奇怪?
原始问题(14/7/25):新闻媒体的这句话是否有意义,或者是否有更好的统计方法来查看最近发生的飞机意外事件? 但是,巴内特(Barnett)也提请注意泊松分布的理论,这意味着两次碰撞之间的短暂间隔实际上比长时间碰撞更可能发生。 巴内特说:“假设每年平均发生一次致命事故,这意味着在任何一天发生车祸的可能性是365分之一。” “如果8月1日发生崩溃,则下次崩溃发生在8月2日一天之后的机会是1/365。但是下次崩溃发生在8月3日发生的机会是(364/365)x(1/365) ,因为只有在8月2日没有崩溃的情况下,下一次崩溃才会在8月3日发生。” 巴内特说:“这似乎是违反直觉的,但结论是无条件地根据概率定律得出的。” 资料来源:http : //www.bbc.com/news/magazine-28481060 说明性(14/7/27):(对我而言)反直觉的是,罕见事件往往会在很短的时间内发生。凭直觉,我认为罕见事件不会及时发生。有人能指出泊松分布假设下事件之间时间的理论或经验预期分布吗?(即,直方图,其中y轴是频率或概率,x轴是两次连续出现之间的时间,分为2天,数周,数月或数年等。)谢谢。 澄清(7/28/14):标题暗示比起广泛分布的事故,它更有可能发生事故簇。让我们对其进行操作。假设一个集群是3起飞机事故,短时间是3个月,长时间是3年。认为在3个月内发生3次事故的可能性比3年内发生事故的可能性更高,这似乎是不合逻辑的。即使我们将第一起事故定为自然事件,但认为未来3个月内与未来3年内还会再发生2起事故是不合逻辑的。如果这是真的,那么新闻媒体的标题就是误导和不正确的。我想念什么吗?

2
在置换测试中P值等于0
我有两个数据集,我想知道它们是否存在显着差异(这来自“ 两组显着不同?请测试使用 ”)。 我决定使用置换测试,在R中执行以下操作: permutation.test <- function(coding, lncrna) { coding <- coding[,1] # dataset1 lncrna <- lncrna[,1] # dataset2 ### Under null hyphotesis, both datasets would be the same. So: d <- c(coding, lncrna) # Observed difference diff.observed = mean(coding) - mean(lncrna) number_of_permutations = 5000 diff.random = NULL for (i …

1
设置中的回归:如何选择正则化方法(套索,PLS,PCR,山脊)?
我想查看是否去岭回归,LASSO,主成分回归(PCR),或偏最小二乘(PLS)中的情况下有大量的变量/特征()和样品的较小数量(Ñ < p),而我的目标是预测。pppn < pn<pn np > 10 np>10np>10n 变量(和Y)以不同程度相互关联。XXXÿYY 我的问题是哪种策略最适合这种情况?为什么?

1
进行单尾Kolmogorov-Smirnov测试是否有意义?
进行单尾KS测试是否有意义并且可行?这样的检验的原假设是什么?还是KS测试天生就是两尾测试? 我将从一个有助于理解D分布的答案中受益(我正在研究Massey于1951年发表的论文,并发现描述具有挑战性,例如和是差异的最小和最小) CDF的差异的非绝对值是多少?)。 d -d+D+D^{+}d-D−D^{-} 跟进问题:如何获得和?我遇到的许多出版物都是表值,而不是,和 CDF 。D + D − D n D + D −pppd+D+D^{+}d-D−D^{-}dñDnD_{n}d+D+D^{+}d-D−D^{-} 更新:我刚刚发现了相关的问题单边Kolmogorov-Smirnov检验中的原假设是什么?,在撰写此文章之前,我在初次扫描时就错过了。


3
预测异方差数据的方差
我正在尝试对异方差数据进行回归分析,以预测线性模型中的误差方差和均值。像这样: ÿ(x ,t )ξ(x ,t )ÿ¯(x ,t )σ(x ,t )= y¯(x ,t ) + ξ(x ,t ),〜ñ(0 ,σ(x ,t )),= y0+ a x + b t ,= σ0+ c x + dŤ 。y(x,t)=y¯(x,t)+ξ(x,t),ξ(x,t)∼N(0,σ(x,t)),y¯(x,t)=y0+ax+bt,σ(x,t)=σ0+cx+dt.\begin{align}\\ y\left(x,t\right) &= \bar{y}\left(x,t\right)+\xi\left(x,t\right),\\ \xi\left(x,t\right) &\sim N\left(0,\sigma\left(x,t\right)\right),\\ \bar{y}\left(x,t\right) &= y_{0}+ax+bt,\\ \sigma\left(x,t\right) &= \sigma_{0}+cx+dt. \end{align} 换句话说,数据包括在和各种值下重复测量。我假设这些测量值是“真实”平均值,它是和的线性函数,加性高斯噪声的标准偏差(或方差,我还没有决定)也线性地取决于。(我可以允许对和进行更复杂的依赖-线性形式没有很强的理论动机-但我不希望在现阶段使事情复杂化。)X 吨ˉ Ý(X ,吨)X …

1
统计和机器学习术语词典
是否存在统计和机器学习术语的参考词库?我知道Wikipedia文章通常包含同义词,但是我只想有一个同义词库,我可以轻松地通过它(相对于完整的百科全书)来确保我知道所有的术语。

3
在高度不平衡的环境中进行成本敏感型学习的建议
我有一个包含几百万行和约100列的数据集。我想检测数据集中大约1%的示例,它们属于一个普通类。我有一个最低限度的精度约束,但是由于成本非常不对称,所以我对任何特定的召回都不太热衷(只要我没有剩下10个正匹配项!) 在这种情况下,您会推荐哪些方法?(欢迎链接到论文,赞赏实现的链接)

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.