统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
分位数归一化如何工作?
在使用微阵列的基因表达研究中,必须对强度数据进行标准化,以便可以比较个体之间,基因之间的强度。从概念上和算法上,“分位数规范化”如何工作,您将如何向非统计学家解释?



2
两个伽马分布之间的Kullback–Leibler散度
选择通过pdf g (x ; b ,c )= 1参数化伽马分布Γ(b,c)Γ(b,c)\Gamma(b,c)g(x;b,c)=1Γ(c)xc−1bce−x/bg(x;b,c)=1Γ(c)xc−1bce−x/bg(x;b,c) = \frac{1}{\Gamma(c)}\frac{x^{c-1}}{b^c}e^{-x/b} 之间的相对熵Γ(bq,cq)Γ(bq,cq)\Gamma(b_q,c_q)和Γ(bp,cp)Γ(bp,cp)\Gamma(b_p,c_p)是由为[1]中给出 KLGa(bq,cq;bp,cp)=(cq−1)Ψ(cq)−logbq−cq−logΓ(cq)+logΓ(cp)+cplogbp−(cp−1)(Ψ(cq)+logbq)+bqcqbpKLGa(bq,cq;bp,cp)=(cq−1)Ψ(cq)−log⁡bq−cq−log⁡Γ(cq)+log⁡Γ(cp)+cplog⁡bp−(cp−1)(Ψ(cq)+log⁡bq)+bqcqbp\begin{align} KL_{Ga}(b_q,c_q;b_p,c_p) &= (c_q-1)\Psi(c_q) - \log b_q - c_q - \log\Gamma(c_q) + \log\Gamma(c_p)\\ &\qquad+ c_p\log b_p - (c_p-1)(\Psi(c_q) + \log b_q) + \frac{b_qc_q}{b_p} \end{align} 我猜Ψ(x):=Γ′(x)/Γ(x)Ψ(x):=Γ′(x)/Γ(x)\Psi(x):= \Gamma'(x)/\Gamma(x)是digamma函数。 这是没有派生的。我找不到任何可以得出这一点的参考。有什么帮助吗?一个好的参考就足够了。困难的部分是将与gamma pdf 集成。logxlog⁡x\log x [1] WD Penny,法线,伽马,狄利克雷和Wishart密度的KL散度,请访问:www.fil.ion.ucl.ac.uk/~wpenny/publications/densities.ps

8
如何不使用统计
这是一个开放式问题,但我想明确。给定足够的人口,您也许可以学习一些东西(这是开放部分),但是无论您对人口有什么了解,什么时候才适用于人口中的某个成员? 根据我对统计数据的了解,它永远不适用于一个人口中的任何一个成员,但是,我经常在讨论中发现另一个人去了:“我读到世界人口的10%患有这种疾病”,并且继续结论是房间里每十分之一的人都有这种疾病。 我知道这个房间里的十个人不足以使统计数据有意义,但显然没有。 然后是关于足够大的样本的事情。您只需要探查足够多的人口即可获得可靠的统计信息。但是,这是否与统计的复杂性成比例?如果我要测量的东西非常稀有,这是否意味着我需要一个更大的样本才能确定此类统计数据的相关性? 问题是,当涉及到统计数据时,我真的质疑任何报纸或文章的有效性,它们会以此方式建立信心。 有点背景。 回到问题,您可以采用哪种方式或不可以使用统计方式来形成论点。我否定了这个问题,因为我想更多地了解有关统计的常见误解。

2
“混合效应模型”和“潜在增长模型”之间有什么区别?
我对混合效应模型(MEM)非常熟悉,但是一位同事最近问我如何将其与潜在增长模型(LGM)进行比较。我做了一些谷歌搜索,看来LGM是结构方程模型的一种变体,适用于在至少一个随机效应的每个级别内获得重复测量的情况,从而使时间成为模型中的固定效应。否则,MEM和LGM看起来很相似(例如,它们都允许探索不同的协方差结构等)。 我是否认为LGM在概念上是MEM的特例,还是两种方法在其假设或评估不同类型理论的能力方面存在差异?

1
GSVD是否实施所有线性多元技术?
我碰到了HervéAbdi关于广义SVD 的文章。作者提到: 广义SVD(GSVD)分解矩形矩阵,并考虑了施加在矩阵的行和列上的约束。GSVD通过较低的秩矩阵给出给定矩阵的加权广义最小二乘估计,因此,在适当选择约束的情况下,GSVD实施了所有线性多元技术(例如规范相关,线性判别分析,对应分析,PLS -回归)。 我想知道GSVD与所有线性多元技术(例如典范相关,线性判别分析,对应分析,PLS回归)如何相关。

2
如何从R中的特征值和特征向量绘制椭圆?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 2年前关闭。 有人可以拿出R代码从下面矩阵A = (2.2 0.4 0.4 2.8)的特征值和特征向量绘制椭圆 A =(2.20.40.42.8)一种=(2.20.40.42.8) \mathbf{A} = \left( \begin{array} {cc} 2.2 & 0.4\\ 0.4 & 2.8 \end{array} \right)

1
如何检查状态空间时间序列分析中哪个模型更好?
我正在通过状态空间方法进行时间序列数据分析。根据我的数据,随机局部模型完全优于确定性模型。但是确定性水平和斜率模型给出的结果要好于随机水平和随机/确定性斜率。这是平常的吗?R中的所有方法都需要初始值,我在某处读到,首先拟合ARIMA模型,然后从那里取值作为状态空间分析的初始值是一种方法。可能?或任何其他主张?我应该在这里承认,我是状态空间分析的新手。

3
将曼哈顿距离与Ward的集群间链接一起使用可以进行分层集群吗?
我正在使用层次聚类分析时间序列数据。我的代码是使用Mathematica实现的函数DirectAgglomerate[...],该函数根据以下输入生成层次聚类: 距离矩阵D 用于确定集群间链接的方法的名称。 我已经使用曼哈顿距离计算了距离矩阵D: d(x,y)=∑i|xi−yi|d(x,y)=∑i|xi−yi|d(x,y) = \sum_i|x_i - y_i| 其中和Ñ ≈ 150是数据点在我的时间序列数。i=1,⋯,ni=1,⋯,ni = 1,\cdots, nn≈150n≈150n \approx 150 我的问题是,可以将Ward的集群间链接与曼哈顿距离矩阵一起使用吗?一些资料表明,沃德的连接只能与欧几里得距离一起使用。 请注意,DirectAgglomerate[...]仅使用距离矩阵而不是原始观测值来计算Ward的链接。不幸的是,我不确定Mathematica是如何修改Ward的原始算法的(根据我的理解),该算法通过最小化相对于聚类均值计算的观测值平方误差之和而起作用。例如,对于由单变量观测值向量组成的聚类,Ward将平方的误差平方和表示为:ccc (∑j||cj−mean(c)||2)2(∑j||cj−mean(c)||2)2(\sum_j||c_j - mean(c)||_2)^2 (其他软件工具(例如Matlab和R)也仅使用距离矩阵来实现Ward的聚类,因此问题并非特定于Mathematica。)



2
贝叶斯统计与生成建模之间的联系
有人可以推荐我一个很好的参考资料来解释贝叶斯统计与生成建模技术之间的联系吗?为什么我们通常将生成模型与贝叶斯技术一起使用? 为什么在根本没有完整数据的情况下使用贝叶斯统计量尤其吸引人? 请注意,我来自一个面向机器学习的观点,并且我有兴趣从统计界阅读更多有关它的内容。 任何很好的参考资料,讨论这些要点将不胜感激。谢谢。


3
如何将一周的分钟数据汇总为小时数?
您将如何获得每日多个时段的每小时数据,并在同一图中显示12个“主机”的结果?也就是说,我想绘制一个24小时周期的样子,以获取一周的数据。最终目标是在采样之前和之后比较两组该数据。 dates Host CPUIOWait CPUUser CPUSys 1 2011-02-11 23:55:12 db 0 14 8 2 2011-02-11 23:55:10 app1 0 6 1 3 2011-02-11 23:55:09 app2 0 4 1 我已经能够很好地运行xyplot(CPUUser〜date | Host)。但是,我不想显示一周中的每个日期,而是希望将X轴作为一天中的小时数。 尝试将这些数据放入xts对象会导致错误,例如“ order.by需要适当的基于时间的对象” 这是数据帧的str(): 'data.frame': 19720 obs. of 5 variables: $ dates : POSIXct, format: "2011-02-11 23:55:12" "2011-02-11 23:55:10" ... $ …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.