统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
JAGS中的响应变量中缺少值
Gelman&Hill(2006)说: 在Bug中,只需包含数据向量,NA和所有元素,就可以轻松处理回归中的缺失结果。Bug显式地对结果变量进行建模,因此使用此模型来在每次迭代中估算缺失值是很简单的。 这听起来像是使用JAGS进行预测的简单方法。但是,结果缺失的观察结果也会影响参数估计吗?如果是这样,是否有一种简单的方法将这些观测值保留在JAGS看到的数据集中,但又不影响参数估计呢?我当时在考虑cut函数,但这仅在BUGS中可用,而在JAGS中不可用。

1
反对随机化
史蒂文·皮安塔多西(Steven Piantadosi)在临床试验-方法论观点中写道(第13章,第334页): 在第二章中,我注意到了Abel和Koch(1997)和Urbach(1993)对随机化的反对,并指出了研究他们的担忧和可能的错误的价值。他们拒绝将随机化视为 验证某些统计测试的方法, 因果推理的基础, 便于掩盖,以及 平衡比较组的方法。 据我说,(1)-(4)是随机化的好处。那么,为什么亚伯(Abel),科赫(Koch)和乌尔巴赫(Urbach)基于这些论点拒绝随机化呢?

1
证明序列减少(通过绘制大量点来支持)
上个月我在SE上发布的许多问题都是为了帮助我解决这一特定问题。问题均已回答,但我仍然无法提出解决方案。因此,我认为我应该直接问我要解决的问题。 让 Xn∼FnXn∼FnX_n \sim F_n,在哪里 Fn= (1 − (1 −Fn − 1)C)CFn=(1−(1−Fn−1)c)cF_n = (1-(1-F_{n-1})^c)^c, F0= xF0=xF_0 = x, Ç ≥ 2c≥2c\geq 2 (整数),以及每个 FñFnF_n 超过CDF (0 ,1 )(0,1)(0,1)。 我想证明 EXnEXn\mathbb{E}X_n 减少 nnn 对所有人 ccc (甚至对于任何特定 ccc)!我可以证明FnFnF_n 以独特的解收敛到狄拉克质量 xc=(1−(1−x)c)c)xc=(1−(1−x)c)c)x_c = (1-(1-x)^c)^c) 对于 c=2c=2c=2, x2=(3−5–√)/2≈.38x2=(3−5)/2≈.38x_2 = (3-\sqrt{5})/2 \approx .38。当看CDFS增加时nnn都是一样的 ccc,所有cdf交叉在 xnxnx_n。的价值F(x)F(x)F(x) 减少值 …

1
vcovHC,vcovHAC,NeweyWest –使用哪个功能?
我正在尝试更新基于lm()的模型,以获取正确的标准错误和测试。我真的很困惑要使用哪个VC矩阵。该sandwich软件包提供vcovHC,vcovHAC和NeweyWest。前者仅说明异方差性,而后两者仅说明序列相关性和异方差性。但是,文档并没有太多介绍后两者之间的区别(至少我不明白)。通过查看函数本身,我意识到NeweyWest实际上调用了vcovHAC。 根据经验,coeftest(mymodel, vcov. = vcovHAC)和的结果是coeftest(mymodel, vcov. = NeweyWest)完全不同的。虽然vcovHAC与天真的lm结果有些接近,但使用NeweyWest时,所有系数都变得微不足道了(测试甚至接近1)。

1
卡尔曼滤波器与平滑样条曲线
问:使用状态空间建模和卡尔曼滤波而不是平滑样条曲线适合哪些数据,反之亦然?两者之间是否存在等价关系? 我试图对这些方法如何组合在一起有一个高层次的了解。我浏览了约翰斯顿的新高斯估计:序列和多分辨率模型。令人惊讶的是,没有提到状态空间模型和卡尔曼滤波。为什么不在那里?那不是解决这类问题的最标准工具吗?相反,重点是平滑样条和小波阈值处理。我现在很困惑。

3
如何使用R检验相关性等于给定值的假设?
是否有一个函数可以检验两个向量的相关性等于给定数字(例如0.75)的假设?使用cor.test可以测试cor = 0,可以看到0.75是否在置信区间内。但是是否有一个函数可以计算cor = 0.75的p值? x <- rnorm(10) y <- x+rnorm(10) cor.test(x, y)
10 r  correlation 

3
R中具有因子的线性回归
我试图了解因素在R中的确切作用。假设我想使用R中的一些样本数据进行回归: > data(CO2) > colnames(CO2) [1] "Plant" "Type" "Treatment" "conc" "uptake" > levels(CO2$Type) [1] "Quebec" "Mississippi" > levels(CO2$Treatment) [1] "nonchilled" "chilled" > lm(uptake ~ Type + Treatment, data = CO2) Call: lm(formula = uptake ~ Type + Treatment, data = CO2) Coefficients: (Intercept) TypeMississippi Treatmentchilled 36.97 -12.66 -6.86 我了解这一点,TypeMississippi并将Treatmentchilled其视为布尔值:对于每一行,初始摄取为36.97,12.66如果它是密西西比州的类型并且6.86是冷藏的,我们就减去它。我在理解以下内容时遇到了麻烦: > …

1
我们可以通过比较回归斜率来比较组之间的相关性吗?
在这个问题中,他们询问如何比较两个独立群体(例如男性与女性)的Pearson r。回复和评论建议两种方式: 使用费舍尔的著名公式,即r的“ z变换”; 使用斜率比较(回归系数)。 只需通过饱和线性模型即可轻松完成后者: ,其中和是相关变量,而是表示两组的虚拟变量(0对1)。的大小(交互作用项系数)恰好是分别在两组中进行模型之后的系数的差,因此,其( s)的意义就是对两组之间斜率差的检验。Y=a+bX+cG+dXGY=a+bX+cG+dXGY = a + bX + cG + dXGXXXYYYGGGdddbbbY=a+bXY=a+bXY = a + bXddd 现在,倾斜或回归系数。还不是相关系数。但是,如果我们规范和 - 分别在两个组-然后会等于差在第1组减去R R组0中,因此其意义将要测试的这两个相关的区别是:我们要测试的斜坡,但似乎[好像-?]我们正在测试相关性。XXXYYYddd 我写的正确吗? 如果是,那么剩下的问题是更好的相关性检验-是描述的还是费舍尔的?因为它们将产生不同的结果。你怎么看? 后来的编辑:感谢@Wolfgang的答复,我仍然感到怀念,我不明白为什么 Fisher的测试比上述的标准化不佳的坡度比较方法对r的测试更正确。因此,欢迎提供更多答案。谢谢。



1
您如何生成ROC曲线以进行留一法交叉验证?
例如,当执行5倍交叉验证时,通常针对5倍的每一个都计算一条单独的ROC曲线,通常乘以带有std的平均ROC曲线。开发。显示为曲线厚度。 但是,对于LOO交叉验证,每个折叠中只有一个测试数据点,为该单个数据点计算ROC“曲线”似乎并不明智。 我一直在获取所有测试数据点(连同它们单独计算的p值)并将它们汇总到一个大集合中,以计算单个ROC曲线,但这在统计学上是洁行的吗? 当每个折叠中的数据点数为1时(如LOO交叉验证的情况),采用ROC分析的正确方法是什么?

4
关于统计理论方法的好书
10年前,当我读本科的理论统计课程时,我们使用了Dudewicz和Mishra撰写的《现代数学统计学》。我发现自己现在回头看这本书,并被提醒一些代码示例正在为IBM 370汇编。 存在哪些较新年份的高质量书籍?
10 references 

2
在预测冰球运动员的职业生涯总目标时是否在Poisson回归中使用偏移
我有一个关于不愿使用补偿的问题。假设一个非常简单的模型,您要在其中描述曲棍球的(全部)目标数。因此,您有目标,打的游戏次数和虚拟变量“ strike”(如果玩家是前锋,则等于1,否则等于0)。那么正确指定了以下哪个模型? 目标=游戏+前锋,或 目标=偏移量(游戏)+前锋 同样,目标是整体目标,游戏数量是单个玩家的整体游戏。例如,可能有一个玩家在100场比赛中有50个进球,而另一个在50场比赛中有20个进球的玩家,依此类推。 我想估算目标数时应该怎么做?是否真的需要在此处使用偏移量? 参考文献: 参见前面的问题,讨论一般在Poisson回归中何时使用偏移量。

2
观察到左偏斜与对称分布
这对我来说很难描述,但我会尽力使我的问题易于理解。因此,首先您必须知道,到目前为止,我已经完成了非常简单的线性回归。在估算系数之前,我先观察了的分布。左偏斜很重。在估算了模型之后,我非常确定会在QQ图中观察到左偏残差,但我绝对没有。此解决方案可能是什么原因?错误在哪里?还是分布与误差项的分布无关?ÿÿyÿÿy

1
回归均值差的置信区间
假设我有一个二次回归模型 ,且误差满足通常的假设(独立,正常,独立于值)。令为最小二乘估计。Y=β0+β1X+β2X2+ϵY=β0+β1X+β2X2+ϵ Y = \beta_0 + \beta_1 X + \beta_2 X^2 + \epsilon ϵϵ\epsilonXXXb0,b1,b2b0,b1,b2b_0, b_1, b_2 我有两个新的值和,我有兴趣获得的置信区间。XXXx1x1x_1x2x2x_2v=E(Y|X=x2)−E(Y|X=x1)=β1(x2−x1)+β2(x22−x21)v=E(Y|X=x2)−E(Y|X=x1)=β1(x2−x1)+β2(x22−x12)v = E(Y|X = x_2) - E(Y|X=x_1) = \beta_1 (x_2 - x_1) + \beta_2 (x_2^2 - x_1^2) 点估计为,并且(如果我错了,请纠正我)我可以通过估计方差使用软件提供的系数的方差和协方差估计。v^=b1(x2−x1)+b2(x22−x21)v^=b1(x2−x1)+b2(x22−x12)\hat{v} = b_1 (x_2 - x_1) + b_2 (x_2^2 - x_1^2)s^2=(x2−x1)2Var(b1)+(x22−x21)2Var(b2)+2(x2−x1)(x2−x21)Cov(b1,b2)s^2=(x2−x1)2Var(b1)+(x22−x12)2Var(b2)+2(x2−x1)(x2−x12)Cov(b1,b2)\hat{s}^2 = (x_2 - x_1)^2 \text{Var}(b_1) + …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.