统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
对两个正态分布随机变量之和的贡献的直观解释
如果我有两个正态分布的独立随机变量和,均值和,标准差为和并且发现,则条件分布(假设我没有犯任何错误)给定的和正态分布也以均值 和标准差 XXXYYYμXμX\mu_XμYμY\mu_YσXσX\sigma_XσYσY\sigma_YX+Y=cX+Y=cX+Y=cXXXYYYcccμX|c=μX+(c−μX−μY)σ2Xσ2X+σ2YμX|c=μX+(c−μX−μY)σX2σX2+σY2\mu_{X|c} = \mu_X + (c - \mu_X - \mu_Y)\frac{ \sigma_X^2}{\sigma_X^2+\sigma_Y^2} σX| Ç=σÿ| c=√μY|c=μY+(c−μX−μY)σ2Yσ2X+σ2YμY|c=μY+(c−μX−μY)σY2σX2+σY2\mu_{Y|c} = \mu_Y + (c - \mu_X - \mu_Y)\frac{ \sigma_Y^2}{\sigma_X^2+\sigma_Y^2}σX|c=σY|c=σ2Xσ2Yσ2X+σ2Y−−−−−−−−√.σX|c=σY|c=σX2σY2σX2+σY2.\sigma_{X|c} = \sigma_{Y|c} = \sqrt{ \frac{\sigma_X^2 \sigma_Y^2}{\sigma_X^2 + \sigma_Y^2}}. 条件标准偏差与给定相同是不足为奇的,如果一个上升,另一个必须下降相同的量。有趣的是,条件标准偏差不取决于。çcccccc 我无法确定的是条件均值,即它们按照与原始方差成比例而不是与原始标准差成比例的方式来分配超出部分(c-\ mu_X-\ mu_Y)(c−μX−μY)(c−μX−μY)(c - \mu_X - \mu_Y)。 例如,如果它们的均值为零,μX=μY=0μX=μY=0\mu_X=\mu_Y=0,并且标准差σX=3σX=3\sigma_X =3和\ sigma_Y = 1,则以c = 4为σY=1σY=1\sigma_Y=1条件,我们将得到E [X | c …

4
确定计数数据合适模型的策略
决定对计数数据使用哪种模型的合适策略是什么?我已经计算了需要建模为多级模型的数据,并建议我(在此站点上)做到这一点的最佳方法是通过错误或MCMCglmm。但是,我仍在尝试了解贝叶斯统计,并且我认为我应该首先尝试将我的数据拟合为广义线性模型,而忽略数据的嵌套结构(只是这样我才能对预期的结果有一个模糊的想法)。 大约70%的数据为0,方差与平均值的比率为33。因此,数据过于分散。 在尝试了许多不同的选择(包括泊松,负二项式,拟和零膨胀模型)之后,我发现结果的一致性非常差(从所有重要变量变为没有重要变量)。 我该如何基于0通货膨胀和过度分散做出明智的决定,以选择哪种类型的模型?例如,我怎么能推断准泊松比负二项式更合适(反之亦然),又怎会知道使用其中一个已经充分(或没有)处理了多余的零?同样,如果使用零膨胀模型,我如何评估不再有过度分散?还是应该在零膨胀的泊松和零膨胀的负二项式之间做出选择?


1
对数正态随机变量的相关性
给定和具有相关系数正常随机变量,我如何找到以下对数正态随机变量和之间的相关性?X 2 ρ ý 1 ÿ 2X1X1X_1X2X2X_2ρρ\rhoY1Y1Y_1Y2Y2Y_2 Y1=a1exp(μ1T+T−−√X1)Y1=a1exp⁡(μ1T+TX1)Y_1 = a_1 \exp(\mu_1 T + \sqrt{T}X_1) Y2=a2exp(μ2T+T−−√X2)Y2=a2exp⁡(μ2T+TX2)Y_2 = a_2 \exp(\mu_2 T + \sqrt{T}X_2) 现在,如果X1=σ1Z1X1=σ1Z1X_1 = \sigma_1 Z_1和X2=σ1Z2X2=σ1Z2X_2 = \sigma_1 Z_2,其中Z1Z1Z_1和Z2Z2Z_2是标准法线,则从线性变换属性中,我们得到: Y1=a1exp(μ1T+T−−√σ1Z1)Y1=a1exp⁡(μ1T+Tσ1Z1)Y_1 = a_1 \exp(\mu_1 T + \sqrt{T}\sigma_1 Z_1) Y2=a2exp(μ2T+T−−√σ2(ρZ1+1−ρ2−−−−−√Z2)Y2=a2exp⁡(μ2T+Tσ2(ρZ1+1−ρ2Z2)Y_2 = a_2 \exp(\mu_2 T + \sqrt{T}\sigma_2 (\rho Z_1 + \sqrt{1-\rho^2}Z_2) 现在,如何从此处计算Y1Y1Y_1和Y_2之间的相关性Y2Y2Y_2?


2
汇总线性模型运行的结果R
由于回归建模通常比科学更“艺术”,因此我经常发现自己正在测试回归结构的许多迭代。有什么有效的方法可以汇总这些多个模型运行中的信息,从而找到“最佳”模型?我使用的一种方法是将所有模型放入列表并summary()在该列表中运行,但是我想有更有效的比较方法吗? 示例代码和模型: ctl <- c(4.17,5.58,5.18,6.11,4.50,4.61,5.17,4.53,5.33,5.14) trt <- c(4.81,4.17,4.41,3.59,5.87,3.83,6.03,4.89,4.32,4.69) group <- gl(2,10,20, labels=c("Ctl","Trt")) weight <- c(ctl, trt) lm1 <- lm(weight ~ group) lm2 <- lm(weight ~ group - 1) lm3 <- lm(log(weight) ~ group - 1) #Draw comparisions between models 1 - 3? models <- list(lm1, lm2, lm3) lapply(models, summary)
16 r  regression 

1
Logistic回归-多共线性问题/陷阱
在Logistic回归中,是否需要像在直接进行OLS回归中一样关注多重共线性? 例如,对于存在多重共线性的逻辑回归,是否需要谨慎(就像在OLS回归中一样),要从Beta系数中得出推断? 对于OLS回归,高多重共线性的一个“解决方案”是岭回归,是否有类似的逻辑回归?另外,删除变量或组合变量。 在逻辑回归中减少多重共线性影响的合理方法是什么?它们与OLS本质上相同吗? (注意:这并非旨在进行设计的实验)

2
命中并运行MCMC
我正在尝试实现即插即用的MCMC算法,但是在理解如何进行操作时遇到了一些麻烦。总体思路如下: 为了在MH中产生提案跳跃,我们: 根据单位球表面上的分布生成方向dddOO\mathcal{O} 沿约束空间生成有符号距离。λλ\lambda 但是,我不知道应该如何用R(或任何其他语言)实现这一点。 有没有人会向我指出正确方向的一小段代码? 顺便说一句,我对执行此方法的库没什么兴趣,我想尝试自己编写代码。 非常感谢。
16 r  bayesian  mcmc 

4
根据统计信息做出错误决策的战争故事?
我认为可以说统计学是一门应用科学,因此在计算平均值和标准差时,是因为有人希望根据这些数字做出一些决策。 作为一名出色的统计学家,我希望能够“感知”何时可以信任样本数据,以及何时某些统计测试完全歪曲了我们感兴趣的真实数据。成为对分析感兴趣的程序员大数据集我正在学习一些统计数据和概率论,但我无法摆脱这种this的感觉,即我看过的所有书都像是政客,登上舞台,讲了很多话,然后追加演讲结束时的以下免责声明: 现在,我并不是说这是好事还是坏事,但是数字表明这很好,所以无论如何您都应该投票支持我。 也许您明白了,但您可能没有,这是一个问题。我该去哪里找统计学家的战争故事,而他们的决策是基于某些统计信息的,后来又证明是完全错误的?

4
我是否应该在ezANOVA中包含一个参数以请求III型平方和?
我为R开发了ez软件包,以帮助人们从SPSS之类的统计软件包过渡到R。(希望)通过简化各种ANOVA的规格并提供类似于SPSS的输出(包括效果大小和假设)来实现测试),以及其他功能。该ezANOVA()函数主要用作的包装car::Anova(),但是当前版本的ezANOVA()实现仅实现II型平方和,而car::Anova()允许指定II型或-III平方和。正如我可能期望的那样,一些用户要求我在ezANOVA()允许用户请求II型或III型。我一直不愿这样做,并在下面概述了我的推理,但是我希望社区对我或与该问题有关的其他推理提供意见。 原因不包括在“SS_type”的说法ezANOVA(): I,II和III型和平方之间的差异仅在数据不平衡时才会出现,在这种情况下,我想说,通过进一步收集数据来改善不平衡比使用ANOVA计算可带来更多的收益。 II型和III型之间的差异适用于由高阶效应限定的低阶效应,在这种情况下,我认为低阶效应在科学上没有意义。(但请参阅下文了解参数的可能复杂之处) 对于那些不适用(1)和(2)的罕见情况(当无法进行进一步的数据收集并且研究人员对我目前无法想象的合格主效应具有有效的科学兴趣时),可以相对轻松地进行修改的ezANOVA()源或采用car::Anova()本身就实现III型试验。通过这种方式,我将获得III型测试所需的额外工作/理解视为确保只有那些真正了解自己在做什么的人才能走这条路。 现在,最新的III类请求者指出,考虑到以下情况会破坏论点(2),在这种情况下,存在但不重要的高阶效应可能会使平方和的计算偏向于低阶效应。在这种情况下,可以想象的是,研究人员将寻求更高阶的效果,而发现它是“不重要的”,而转向尝试解释对研究人员而言并不为人所折衷的较低阶效果。我最初的反应是,这不是平方和的问题,而是p值和原假设检验的传统。我怀疑,更明确的证据度量(例如,似然比)可能更可能产生与数据一致的支持模型的模棱两可图像。但是,我还没有

3
如何在R的barplot中的条上放置值
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 6年前关闭。 这个问题与我以前的问题有关。我想将值放在条形图中的条上。我是R中绘图的初学者。


4
谁将R与多核,SNOW或CUDA软件包一起用于资源密集型计算?
在本论坛中,谁愿意将“> R与多核,snow软件包或CUDA一起使用,因此对于需要比工作站CPU更大功率的高级计算?您在哪个硬件上计算这些脚本?数据中心访问某处? 这些问题的背景如下:我目前正在写我的硕士学位。关于R和高性能计算的论文,需要对谁真正使用R有深入的了解。我读到R在2008年拥有100万用户,但这几乎是我可以找到的关于该主题的唯一用户统计信息-所以我希望您能答案! 真诚的海因里希

3
解释PCA分数
有人可以帮助我解释PCA分数吗?我的数据来自关于熊的态度的问卷。根据负载,我将主要成分之一解释为“恐惧熊”。该主要成分的分数是否与每个受访者对该主要成分的衡量方式(他/她在该分数上是正面/负面得分)相关?
16 pca 

5
检查方差分析假设
几个月前,我在SO上的R中发布了一个有关均方差测试的问题,Ian Fellows回答说(我将他的回答解释得很宽松): 在测试模型拟合优度时,同方差测试不是一个好的工具。对于小样本,您没有足够的能力来检测偏离同方差,而对于大样本,您具有“足够的权力”,因此,您更有可能筛选甚至是琐碎的均等偏离。 他的好回答是我的耳光。每次运行ANOVA时,我都会检查正态性和均方差性假设。 您认为检查ANOVA假设时的最佳做法是什么?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.