统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
联立方程模型与结构方程模型之间的差异
有人可以帮我理解同时方程模型和结构方程模型(SEM)之间的区别吗?如果有人可以向我提供一些有关它的文献,那就太好了。 另外,是否有文献在时间序列环境中使用过SEM?我得到的文献大部分是在横截面数据上下文中解释的SEM。 谢谢!

2
多元线性回归的最少观察数
我正在做多元线性回归。我有21个观察值和5个变量。我的目的只是找到变量之间的关系 我的数据是否足以进行多元回归? t检验结果显示我的3个变量不显着。我是否需要对重要变量再次进行回归(或者我的第一次回归足以得出结论)?我的相关矩阵如下 var 1 var 2 var 3 var 4 var 5 Y var 1 1.0 0.0 0.0 -0.1 -0.3 -0.2 var 2 0.0 1.0 0.4 0.3 -0.4 -0.4 var 3 0.0 0.4 1.0 0.7 -0.7 -0.6 var 4 -0.1 0.3 0.7 1.0 -0.7 -0.9 var 5 -0.3 -0.4 …

2
按年龄段划分的大师级头衔资格的平均年龄偏倚?
众所周知,自1950年代以来,国际象棋棋手成功获得大师级头衔的最年轻年龄已大大降低,目前有近30位棋手在15岁生日之前成为大师级棋手。但是,Chess Stack Exchange上有一个问题,询问成为大师的平均年龄是多少?。 有人发布了一个答案,他(我假设是他)查看了六个大师的子集,并得出以下结果: 对于1945年以后出生的球员,平均年龄略高于26岁。 对于1970年以后出生的球员,平均年龄略高于23岁。 对于1975年以后出生的球员,平均年龄略高于22岁。 对于1980年以后出生的玩家,平均年龄为21岁。 对于1985年以后出生的球员,平均年龄不到20岁。 对于1990年以后出生的球员,平均年龄为18.5岁。 (对我来说,尚不完全清楚,例如第一组是否包含1945年以后出生的所有大师(这使它成为下一组的超集)还是仅包含1945年至1970年之间(年龄段)的大师。我认为是前者和我的问题在两种情况下都适用。) 问题在于,在1990年之后出生的玩家在答案发布时(2015年7月)还不到26岁,因此平均“ GM年龄”为26岁是不可能的。答案中最年轻的子集自然会切断任何超过25,而“较旧”的子集则没有。这不歪曲或偏向结果吗?(这是一种选择偏见吗?我没有统计学背景,阅读一些相关的Wikipedia条目也无济于事。)如果是,应该(或可以)减轻这种情况?在“较老的”组中,是否应仅以GM头衔资格的平均计算来考虑在26岁之前获得该头衔的球员?


3
如何讨论多条新兴线的散布图?
我们已经测量了两个变量,散点图似乎暗示了多个“线性”模型。有没有办法尝试提炼那些模型?事实证明,确定其他自变量是困难的。 这两个变量都向左偏斜(偏小),这是我们域中的预期分布。点的强度表示此处的数据点数量(以比例)。 &lt; x ,y &gt;日志10log10\log_{10}&lt; x ,y&gt;&lt;x,y&gt; 或者,是否有办法将这些点聚类? 在我们的领域中,声称这两个变量线性相关。我们正在尝试了解/解释为什么我们的数据不是这种情况。 (注意,我们有1700万个数据点) 更新:感谢您提供所有答案,以下是一些要求的说明: 这两个变量都是整数,这解释了对数散点图中的某些模式。 幸运的是,根据定义,两个变量的最小值均为1。 7M点位于(由数据的左偏度“解释”)&lt; 3 ,1 &gt;&lt;3,1&gt;<3,1> 以下是要求的地块: log-log散点图: (空格由整数值引起) 对数对数极坐标: θ = yθ=y\theta = y 比例直方图: 频率以对数刻度表示,因为条为7M点,并且会隐藏其他条。1 / 31/31/3

1
R中的AIC()和extractAIC()有什么区别?
两者的R文档并没有太多说明。我从此链接可以得到的所有信息是,使用其中任何一个都可以。我不明白的是为什么他们不平等。 事实:R中的逐步回归函数step()使用extractAIC()。 有趣的是,在R的“ mtcars”数据集上运行lm()模型和glm()“空”模型(仅截距)会得出AIC和的不同结果extractAIC()。 &gt; null.glm = glm(mtcars$mpg~1) &gt; null.lm = lm(mtcars$mpg~1) &gt; AIC(null.glm) [1] 208.7555 &gt; AIC(null.lm) [1] 208.7555 &gt; extractAIC(null.glm) [1] 1.0000 208.7555 &gt; extractAIC(null.lm) [1] 1.0000 115.9434 鉴于上述两个模型相同,并且AIC()两者给出的结果相同,这很奇怪。 谁能在这个问题上有所启发?

2
在R中拟合多元线性回归:自相关残差
我正在尝试使用以下方程式估算R中的多元线性回归: regr &lt;- lm(rate ~ constant + askings + questions + 0) 问和问题是按季度构建的季度数据时间序列askings &lt;- ts(...)。 现在的问题是我得到了自相关残差。我知道可以使用gls函数拟合回归,但是我不知道如何识别必须在gls函数中实现的正确的AR或ARMA错误结构。 我现在尝试再次估算, gls(rate ~ constant + askings + questions + 0, correlation=corARMA(p=?,q=?)) 但是很遗憾,我既不是R专家也不是统计学专家来确定p和q。 如果有人可以给我一个有用的提示,我将很高兴。提前非常感谢您! 乔


2
“百分位数”的定义
我现在正在阅读PMT Education撰写的有关生物统计学的注释,请注意第2.7节中的以下句子: 以质量计第50个百分点出生的婴儿比50%的婴儿重。 以质量计在第25个百分点出生的婴儿比75%的婴儿重。 以质量计在第75个百分点出生的婴儿比25%的婴儿重。 但据我所知,按质量计算在第25个百分点出生的婴儿应该比25%的婴儿重。在此领域中,“百分位数”是否有特殊定义,或者我误以为是非母语使用者的句子?

1
损失函数的二阶近似(深度学习书,7.33)
在Goodfellow(2016)的一本关于深度学习的书中,他谈到了尽早停止与L2正则化的等效性(https://www.deeplearningbook.org/contents/regularization.html第247页)。 成本函数二次逼近由下式给出:jjj J^(θ)=J(w∗)+12(w−w∗)TH(w−w∗)J^(θ)=J(w∗)+12(w−w∗)TH(w−w∗)\hat{J}(\theta)=J(w^*)+\frac{1}{2}(w-w^*)^TH(w-w^*) 其中是Hessian矩阵(方程7.33)。这是缺少中期吗?泰勒展开应该是: HHHf(w+ϵ)=f(w)+f′(w)⋅ϵ+12f′′(w)⋅ϵ2f(w+ϵ)=f(w)+f′(w)⋅ϵ+12f″(w)⋅ϵ2f(w+\epsilon)=f(w)+f'(w)\cdot\epsilon+\frac{1}{2}f''(w)\cdot\epsilon^2

2
为什么“ X中的错误”模型没有得到更广泛的使用?
当我们计算回归系数的标准误差时,我们没有考虑设计矩阵的随机性。例如,在OLS中,我们将为XXXVAR (β^)变种(β^)\text{var}(\hat{\beta})var ((XŤX)− 1XŤÿ)= σ2(XŤX)− 1变种((XŤX)-1个XŤÿ)=σ2(XŤX)-1个\text{var}((X^TX)^{-1}X^TY) = \sigma^2(X^TX)^{-1} 如果将视为随机数,则总方差定律在某种意义上也将要求的方差也有其他贡献。即XXXXXX VAR (β^)= var (E(β^| X))+ E(var (β^| X))。变种(β^)=变种(Ë(β^|X))+Ë(变种(β^|X))。\text{var}(\hat{\beta}) = \text{var}(E(\hat{\beta}|X)) + E(\text{var}(\hat{\beta}|X)). 如果OLS估计量确实是无偏的,则第一项就消失了,因为期望是一个常数。第二项实际上变为:。σ2COV (X)− 1σ2冠状病毒(X)-1个\sigma^2 \text{cov}(X)^{-1} 如果已知的参数模型,为什么不用实际的协方差估计替换。例如,如果是随机治疗分配,则二项式方差应该是更有效的估计?XXXXŤXXŤXX^TXXXXË(X)(1 − E(X))Ë(X)(1个-Ë(X))E(X)(1-E(X)) 我们为什么不考虑使用灵活的非参数模型来估计OLS估计中可能的偏差来源,并适当考虑第一个总定律方差项设计敏感性(即的分布)”吗?XXXVAR (è(β^| X))变种(Ë(β^|X))\text{var}(E(\hat{\beta}|X))

2
最大似然参数偏离后验分布
我有一个似然函数大号(d| θ)L(d|θ)\mathcal{L}(d | \theta)为我的数据的概率ddd给出一些模型参数θ∈RNθ∈RN\theta \in \mathbf{R}^N,我想估计。假设先验参数平坦,则似然度与后验概率成正比。我使用MCMC方法来采样这种可能性。 查看生成的收敛链,我发现最大似然参数与后验分布不一致。例如,对于一个参数的边缘化后验概率分布可能是θ0∼N(μ=0,σ2=1)θ0∼N(μ=0,σ2=1)\theta_0 \sim N(\mu=0, \sigma^2=1),而值θ0θ0\theta_0在最大似然点是θML0≈4θ0ML≈4\theta_0^{ML} \approx 4,基本上是几乎最大值θ0θ0\theta_0通过MCMC采样器遍历。 这是一个说明性的例子,不是我的实际结果。实际分布要复杂得多,但是某些ML参数在其各自的后验分布中具有类似的不太可能具有p值。注意,我的一些参数的有界(例如0≤θ1≤10≤θ1≤10 \leq \theta_1 \leq 1); 在范围内,先验总是一致的。 我的问题是: 这样的偏差本身就是问题吗?显然,我不希望ML参数与它们的每个边缘化后验分布的最大值完全一致,但是从直觉上来说,感觉它们也不应该在尾部深处发现。这种偏离会自动使我的结果无效吗? 这是否一定有问题,在数据分析的某个阶段是否可能是特定病理的症状?例如,是否有可能做出一般性的陈述,说明这种偏差是由不正确的收敛链,不正确的模型还是对参数的过度约束引起的?

3
为什么用于贝叶斯因子和p值的临界值如此不同?
我想了解贝叶斯因子(BF)。我相信它们就像两个假设的似然比。因此,如果BF为5,则意味着H1的可能性是H0的5倍。值3-10表示中度证据,而值&gt; 10表示有力证据。 但是,对于P值,传统上将0.05作为截止值。在此P值下,H1 / H0似然比应约为95/5或19。 那么,为什么BF的截止值&gt; 3,而P值的截止值&gt; 19?这些值也不是很接近。


2
贝叶斯主义者如何使用蒙特卡洛模拟方法验证其方法?
背景:我拥有社会心理学博士学位,在我的定量课程中几乎没有涉及理论统计和数学。通过本科和研究生学校,我通过“经典”常客制框架得到了教育(可能与社会科学中的许多人一样)。现在,我也很喜欢R和使用模拟方法来验证方法,使工作方式对我来说,比数学上的证明更有意义(再次:定量社会科学的背景,而不是理论统计)。惯常方法和模拟方法对我来说意义非凡。因为常客将概率视为长期可能性(例如,如果我执行任意多次,并且这种情况发生在50%的时间中,那么就有50%的概率)。我们可以使用蒙特卡洛方法来模拟这种长期运行! 并发症:由于大学阶段,我已经很清楚的贝叶斯方法,并一直存在的人在我的生命给我打电话贝叶斯一边,说,结果更容易解释,我们得到概率的一个假设,而不是数据我真的很喜欢这个,参加了贝叶斯课程,阅读了一些贝叶斯书籍和论文,现在对Stan及其相关的R包非常熟悉。 输入Mayo:在思考了一段时间的“贝叶斯可能是未来之路”之后,我读了Deborah Mayo的“ 统计推断”作为“严格测试”。她说,她在书的开头并没有选择任何一方,但她这样做:她是一名常客,许多书都在捍卫常客的方法论。我不想讨论我们是否认为她认为证据有效的方式,但这让我思考:贝叶斯真的是广告宣传的全部吗?我的意思是,贝叶斯人群是如此分散,以至于我什至不知道经常在贝叶斯框架中分析数据的“正确”方法。通常我会用rstanarm现在的点估计值和可信区间...这通常与常客的估计和置信区间非常接近。我可能会进行模型比较,但是我总是害怕将贝叶斯因素描述为后验概率比较等。 更多思考:在梅奥的书中,我一直在思考:有一种方法可以使用计算机来确保我们的常客方法有效,因为从长远来看,概率是可以看到的,并且可以模拟。看来,贝叶斯人甚至不能就概率的确切性达成共识,这取决于贝叶斯学派(默认,主观等)。这引出我的问题: 问题:如果长期未将概率定义为费率,贝叶斯主义者如何使用蒙特卡罗模拟方法验证他们的方法是否正确定义了不确定性(即,计算有效的可信区间和后验分布)? 示例:我创建一个数据生成器。这只是从伯努利分布中以0.​​5的概率进行模拟: set.seed(1839) p &lt;- .50 n &lt;- 100 gen_dat &lt;- function(n, p) { rbinom(n, 1, p) } 现在,假设我要确保逻辑回归中的置信区间实际上是有效的。我可以多次模拟回归,并确保实际总体值在95%的时间内处于95%的置信区间内。这是一个仅拦截的模型,所以我只想确保自己估计p正确: set.seed(1839) iter &lt;- 10000 results &lt;- sapply(seq_len(iter), function(zzz) { mod &lt;- glm(gen_dat(n, p) ~ 1, binomial) conf &lt;- suppressMessages(confint(mod)) log(p / (1 - p)) &lt; …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.