统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
分配百分比数据
我有一个关于使用我的数据创建模型的正确分布的问题。我用50个地块进行了森林清查,每个地块的尺寸为20m×50m。对于每个图,我估计了遮蔽地面的树冠的百分比。每个地块都有一个以百分比表示的顶盖覆盖率值。百分比范围从0到0.95。我正在建立一个树冠覆盖率百分比模型(Y变量),并具有一个基于卫星图像和环境数据的独立X变量的矩阵。 我不确定是否应该使用二项式分布,因为二项式随机变量是n个独立试验的总和(即,伯努利随机变量)。百分比值不是试验的总和;它们是实际百分比。即使没有上限,我也应该使用伽玛吗?我应该将百分比转换为整数并使用泊松作为计数吗?我应该坚持使用高斯吗?我没有在文献或教科书中找到许多尝试以这种方式模拟百分比的示例。任何提示或见解表示赞赏。 谢谢您的回答。实际上,正是我需要的beta发行版,并在本文中进行了详细讨论: Eskelson,BN,Madsen,L.,Hagar,JC和Temesgen,H.(2011)。使用Beta回归和copula模型估算河岸底层植被覆盖度。森林科学,57(3),212-221。 这些作者使用Cribari-Neto和Zeileis的R中的betareg软件包。 下面的文章讨论了转换包含百分比范围内的真0和/或1的beta分布响应变量的好方法: Smithson,M.和J. Verkuilen,2006年。更好的柠檬榨汁器?具有β分布因变量的最大似然回归,《心理方法》,11(1):54–71。

3
为什么我得到的信息熵大于1?
我实现了以下函数来计算熵: from math import log def calc_entropy(probs): my_sum = 0 for p in probs: if p > 0: my_sum += p * log(p, 2) return - my_sum 结果: >>> calc_entropy([1/7.0, 1/7.0, 5/7.0]) 1.1488348542809168 >>> from scipy.stats import entropy # using a built-in package # give the same answer >>> entropy([1/7.0, …

1
非中心性参数-它是什么,它起什么作用,建议值是多少?
我一直在努力提高自己的统计知识,尤其是在样本量确定和统计功效分析方面。但是似乎我读的越多,我需要阅读的越多。 无论如何,我找到了一个名为G * Power的工具,该工具似乎可以满足我的所有需求,但是我在理解非中心性参数时遇到了问题,它是什么,它是做什么的,建议值是什么? 维基百科等上的信息不完整,或者我在理解它方面做得不好。 如果有帮助,我将进行一系列的两个尾部z检验。 ps有人可以为此问题添加更好的标签吗?

1
线性回归中的正态性假设
作为线性回归的假设,误差分布的正态性有时被错误地“扩展”或解释为需要y或x的正态性。 是否可以构造一个场景/数据集,其中X和Y是非正态的,但误差项是,因此获得的线性回归估计值是有效的?

3
可以使用线性判别分析(LDA)中的标定值在线性判别式上绘制解释变量吗?
使用通过主成分分析获得的值的双图,可以探索构成每个主成分的解释变量。 使用线性判别分析是否也有可能? 提供的示例使用。数据为“埃德加·安德森的虹膜数据”(http://en.wikipedia.org/wiki/Iris_flower_data_set)。这是虹膜数据: id SLength SWidth PLength PWidth species 1 5.1 3.5 1.4 .2 setosa 2 4.9 3.0 1.4 .2 setosa 3 4.7 3.2 1.3 .2 setosa 4 4.6 3.1 1.5 .2 setosa 5 5.0 3.6 1.4 .2 setosa 6 5.4 3.9 1.7 .4 setosa 7 4.6 3.4 1.4 .3 …

2
两个卡片组之间的相关性?
我编写了一个程序来模拟手牌洗牌。 每张卡都有编号,西装CLUBS, DIAMONDS, HEARTS, SPADES的等级从2到10,然后是Jack,Queen,King和Ace。因此,两家具乐部的个数为1,三家具乐部的个数为2 .... A俱乐部数为13,黑桃A为52。 确定卡片混洗程度的方法之一是将其与未混洗的卡片进行比较,并查看卡片的顺序是否相关。 也就是说,我可能拥有这些卡,并使用未洗牌的卡进行比较: Unshuffled Shuffled Unshuffled number Shuffled number Two of Clubs Three of Clubs 1 2 Three of Clubs Two of Clubs 2 1 Four of Clubs Five of Clubs 3 4 Five of Clubs Four of Clubs 4 3 皮尔森法的相关性为:0.6 使用大量的卡片(共52张),您可能会看到图案出现。我的假设是,经过更多的改组,您将获得更少的相关性。 但是,有很多方法可以测量相关性。 …

3
弗里德曼测验后如何正确应用Nemenyi事后测验
我正在比较多种数据集上多种算法的性能。由于不能保证这些性能指标呈正态分布,因此我选择了基于Demšar(2006)的Friedman检验和Nemenyi事后检验。 然后,我发现另一篇论文,除了建议其他方法(例如Quade测试和随后的Shaffer post-hoc测试)之外,它们以不同的方式应用Nemenyi测试。 如何正确应用Nemenyi事后测试? 1.使用学生化范围统计信息吗? 在Demšar的论文中,它表示如果平均秩差大于的临界距离CD,则拒绝零假设(两种算法没有性能差异 CD=qαk(k+1)6N−−−−−−−√CD=qαk(k+1)6N CD = q_{\alpha}\sqrt{{k(k+1)}\over{6N}} “临界值qα基于学生化范围统计量除以 ”2–√.2.\sqrt{2}. 经过一番挖掘后,我发现可以为某些alpha查找“临界值”,例如在的表中α=0.05α=0.05\alpha = 0.05查找无限的自由度(在每个表的底部)。 2.还是使用正态分布? 就在我以为自己知道该怎么做的时候,我发现另一篇论文再次让我感到困惑,因为它们仅使用正态分布。Demšar在第12页指出了类似的事情: 使用这些方法比较第i和第j分类器的测试统计量为 z值用于从正态分布表中找到相应的概率,然后将其与适当的。这些测试在调整值以补偿多次比较的方式上有所不同。z=(Ri−Rj)k(k+1)6N−−−−−√z=(Ri−Rj)k(k+1)6N z = {{(R_i − R_j)}\over{\sqrt{{k(k +1)}\over{6N}}}} αα\alphaαα\alpha 在此段落中,他正在谈论将所有算法与控制算法进行比较,但是这句话“它们调整方式的不同……以补偿多次比较”表明,这也应适用于Nemenyi检验。 因此,对我而言,合乎逻辑的是,根据正态分布的检验统计量计算p值,然后除以来校正该值。zzzk(k−1)/2k(k−1)/2k(k-1)/2 但是,这会产生完全不同的等级差异,从而拒绝原假设。现在,我陷入了困境,不知道该采用哪种方法。我强烈倾向于使用正态分布的方法,因为它对我来说更简单,更合乎逻辑。我也不需要查找表中的值,也不必绑定到某些重要值。 再说一次,我从未使用过学生化的距离统计数据,而且我也不了解。

1
自举重要性测试的两种方法
使用引导程序,我使用两种方法计算重要性测试的p值: 在原假设下重新采样并计算结果至少与原始数据得出的结果一样极端 在替代假设下进行重采样,并计算结果与原始结果的距离至少与与原假设对应的值一样远 我相信第一种方法完全正确,因为它遵循ap值的定义。我对第二个不太确定,但是它通常会给出非常相似的结果,并让我想起Wald测试。 我对吗?两种方法都正确吗?它们是否相同(对于大样本)? 两种方法的示例(在DWin的问题和Erik的回答后进行编辑): 示例1.让我们构造一个类似于两个样本T检验的自举测试。方法1将从一个样本中重新采样(通过合并原始两个样本获得)。方法2将分别从两个样本中重新采样。 示例2.让我们构造一个x₁…xₐ和y₁…yₐ之间的相关性的自举测试。方法1将假定没有相关性,并重新采样允许(xₑ,yₔ)对,其中e≠ə。方法2将编译原始(x,y)对的引导程序样本。 示例3.让我们构造一个引导测试来检查硬币是否公平。方法1将创建随机样本,设置Pr(head)= Pr(tail)= 1/2。方法2将重新采样实验头/尾值的样本,并将比例与½进行比较。

4
有关因果推理的因果哲学的在线资源
您能推荐一些流行病学家/生物统计学家学习因果关系/因果推理原理的有趣且有用的书籍,文章,论文,在线教程/课程等吗? 我对从Epi和Biostats框架实际进行因果推理非常了解,但是我想了解一些基础知识并推动这项工作。例如,据我了解,休ume首先谈到了可以被解释为反事实的想法。 我基本上没有任何哲学方面的培训或经验,因此我需要相对入门的内容,但是我也对更复杂但重要/基础的文本/作者的建议感兴趣(但请指出它们不是入门性的)。 我希望对于交叉验证而言,这不是太题外话,但我希望你们中的某些人和我以前一样在同一条船上,并且能够共享自己喜欢的资源。

2
如何对每日时间序列数据中的月度效果建模?
我有两个时间序列的每日数据。一个是订阅sign-ups,另一个terminations是订阅。我想使用两个变量中包含的信息来预测后者。 从这些系列的图表来看,很明显终止与前几个月的签约倍数相关。也就是说,5月10日的注册人数激增,将导致6月10日,7月10日和8月10日的终止人数增加,依此类推,尽管这种影响逐渐减弱。 我希望获得有关我可以采用哪种模型来建模此特定问题的提示。任何建议将不胜感激。 到目前为止,我一直在考虑一个VAR模型,但是我不确定如何包括月度影响-使用非常高的滞后量或以某种方式添加季节性成分?

3
危险率,概率密度,生存函数之间的关系证明
我读了一些关于生存分析的文章,大多数教科书都指出 h (t )=林Δ 吨→ 0P(吨&lt; Ť≤ 吨+ Δ 吨| Ť≥ 吨)Δ Ť=F(吨)1 − F(吨)(1 )h(t)=limΔt→0P(t&lt;T≤t+Δt|T≥t)Δt=f(t)1−F(t)(1)h(t)= \lim_{ \Delta t \rightarrow 0} \frac{P(t < T \leq t+\Delta t |T \geq t )}{ \Delta t} =\frac{f(t)}{1-F(t)} (1) 其中是危险率,h (t )h(t)h(t) F(t )=林Δ 吨→ 0P(吨&lt; Ť≤ 吨+ Δ 吨)Δ Ť(2 )f(t)=limΔt→0P(t&lt;T≤t+Δt)Δt(2)f(t)=\lim_{\Delta t \rightarrow …
11 survival 

1
核岭回归效率
岭回归可以表示为,其中是预测标签,的识别矩阵,我们试图找到一个标签的对象,而的的矩阵对象使得:ÿ^= (X′X +a一世d)− 1X Xy^=(X′X+aId)−1Xx\hat{y} = (\mathbf{X'X} + a\mathbf{I}_d)^{-1}\mathbf{X}xÿ^y^\hat{y}一世dId\mathbf{I}_dd× dd×dd \times dXx\mathbf{x}XX\mathbf{X}n × dn×dn \times dñnnX一世= (X我,1,。。。,X我,d)∈[Rdxi=(xi,1,...,xi,d)∈Rd\mathbf{x}_i = (x_{i,1}, ..., x_{i,d})\in \mathbb{R}^d X =⎛⎝⎜⎜⎜⎜⎜X1 ,1X2 ,1⋮XÑ ,1X1 ,2X2 ,2⋮X1 ,2……⋱…X1 ,dX2 ,d⋮Xñ ,d⎞⎠⎟⎟⎟⎟⎟X=(x1,1x1,2…x1,dx2,1x2,2…x2,d⋮⋮⋱⋮xn,1x1,2…xn,d) \mathbf{X} = \begin{pmatrix} x_{1,1} & x_{1,2} & \ldots & x_{1,d}\\ x_{2,1} & x_{2,2} & \ldots & x_{2,d}\\ …

3
PCA,ICA和Laplacian特征图
题 我对拉普拉斯特征图方法非常感兴趣。目前,我正在使用它来缩小我的医疗数据集的尺寸。 但是,使用该方法遇到了问题。 例如,我有一些数据(光谱信号),并且可以使用PCA(或ICA)来获取一些PC(或IC)。问题是如何使用LE获得原始数据的类似降维分量? 根据拉普拉斯特征图方法,我们需要解决广义特征值问题,即 Ly=λDyLy=λDyL y = \lambda D y 此处yyy是特征向量。如果我绘制例如前3个特征向量(根据3个特征值的解),结果将无法解释。 但是,当我绘制前3个PC和前3个IC时,结果似乎总是(直观地)代表原始数据xxx。 我认为原因是因为矩阵LLL由权重矩阵(邻接矩阵WWW)定义,并且数据xxx已与热核拟合以创建WWW,这是使用指数函数。我的问题是如何检索xxx的简化分量(而不是矩阵L的特征向量yyy)?LLL 数据 我的数据集受到限制,并且不容易演示该问题。在这里,我创建了一个玩具问题,以显示我的意思和想要问的问题。 请看图片 首先,我创建了一些以红色曲线显示的正弦波A,B,C(图的第一列)。A,B和C具有1000个样本,换句话说,保存在1x1000向量中。 其次,我使用随机创建的线性组合(例如混合源A,B,,其中是随机值。混合信号处于非常高的维空间中,例如,,1517是随机选择的高维空间。我仅以绿色曲线显示信号M的前三行(该图的第二列)。M=r1∗A+r2∗B+r3∗CM=r1∗A+r2∗B+r3∗CM = r_1*A + r_2*B + r_3*Cr1,r2,r3r1,r2,r3r_1, r_2, r_3MMMM∈R1517×1000M∈R1517×1000M \in R^{1517\times1000} 接下来,我运行PCA,ICA和Laplacian特征图以获取降维结果。我选择使用3台PC,3个IC和3个LE进行公平比较(蓝色曲线分别显示为该图的第3列,第4列和最后一列)。 从PCA和ICA的结果(图的第3列,第4列),我们可以将结果解释为某种尺寸的减小,即,对于ICA结果,我们可以通过恢复混合信号(我不确定我们是否也可以通过PCA结果获得,但结果对我来说似乎很合适)。M=b1∗IC1+b2∗IC2+b3∗IC3M=b1∗IC1+b2∗IC2+b3∗IC3M = b_1*IC1 + b_2*IC2 + b_3*IC3M=a1∗PC1+a2∗PC2+a3∗PC3M=a1∗PC1+a2∗PC2+a3∗PC3M = a_1*PC1 + a_2*PC2 + a_3*PC3 但是,请查看LE的结果,我几乎无法解释结果(该图的最后一列)。减少的组件似乎有些“错误”。另外,我想提一提的是,最后一列的最后情节的特征向量式yyyLy=λDyLy=λDyL y = \lambda D y 你们有更多的想法吗? …
11 pca  ica 

4
您如何找到数据中的因果关系?
可以说我有一个带有列“ A”,“ B”的表 是否有统计方法确定“ A”是否导致“ B”发生?一个人不能真正使用Pearson的r,因为: 它仅测试值之间的相关性 相关不是因果关系 皮尔森的r只能使线性关系相关 那么我在这里还有其他选择吗?

3
在R中创建自相关随机值
我们正在尝试创建自动相关的随机值,将其用作时间序列。我们没有引用的现有数据,仅想从头开始创建向量。 一方面,我们当然需要具有分布及其SD的随机过程。 另一方面,必须描述影响随机过程的自相关。该向量的值与在几个时间间隔内强度的降低自相关。例如lag1有0.5,lag2 0.3,lag1 0.1等。 所以最后向量应该看起来像这样:2、4、7、11、10、8、5、4、2,-1、2、5、9、12、13、10、8、4、3, 1,-2,-5 等等。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.