统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
使用神经网络,auto.arima和ets进行R时间序列预测
我听说过一些有关使用神经网络预测时间序列的信息。 如何比较哪种预测时间序列(每日零售数据)的方法更好:auto.arima(x),ets(x)或nnetar(x)。 我可以通过AIC或BIC将auto.arima与ets进行比较。但是如何将它们与神经网络进行比较? 例如: > dput(x) c(1774, 1706, 1288, 1276, 2350, 1821, 1712, 1654, 1680, 1451, 1275, 2140, 1747, 1749, 1770, 1797, 1485, 1299, 2330, 1822, 1627, 1847, 1797, 1452, 1328, 2363, 1998, 1864, 2088, 2084, 594, 884, 1968, 1858, 1640, 1823, 1938, 1490, 1312, 2312, 1937, 1617, 1643, 1468, …

2
为什么在Holm-Bonferroni上使用Bonferroni?
我明白了为什么您可能不对Bonferroni校正使用更强大的方法(例如Hochberg方法),因为它们可能具有额外的假设,例如在这种情况下的假设独立性,但是我不明白为什么您会这样做永远不要对Holm的顺序拒绝修改使用Bonferroni校正,因为后者比Bonferroni更强大并且没有更多假设。我错过了什么吗?

1
您如何报告曼惠特尼检验?
我正在做我的论文,并且正在进行一些测试。使用Kruskal–Wallis检验后,我通常会报告如下结果: 有一个显著差异的平均值之间...(χ2(2)=7.448,p=.024)(χ(2)2=7.448,p=.024)(\chi^2_{(2)}=7.448, p=.024) 但是现在我进行了一次Mann-Whitney测验,我不确定要显示哪些值。SPSS为我提供了Mann–Whitney ,Wilcoxon W,Z和P值。我是否要提供所有这四个值?还是无关紧要的?UUUWWWZZZPPP


1
为什么(对进行审查)
在一个问题集中,我证明了这个“引理”,其结果对我而言并不直观。是审查模型中的标准正态分布。ZZZ 形式上, 和。然后, 因此,截断域上的期望公式与截断点处的密度之间存在某种联系。谁能解释这背后的直觉?Z∗∼Norm(0,σ2)Z∗∼Norm(0,σ2)Z^* \sim Norm(0, \sigma^2)Z=max(Z∗,c)Z=max(Z∗,c)Z = max(Z^*, c)E[Z|Z>c]=∫∞cziϕ(zi)dzi=12π−−√∫∞cziexp(−12z2i)dzi=12π−−√exp(−12c2) (Integration by substitution)=ϕ(c)E[Z|Z>c]=∫c∞ziϕ(zi)dzi=12π∫c∞ziexp(−12zi2)dzi=12πexp(−12c2) (Integration by substitution)=ϕ(c)\begin{align} E[Z|Z>c] &= \int_c^\infty z_i \phi({z_i})\mathrm{d}z_i \\ &= \frac{1}{\sqrt{2\pi}}\int_c^\infty z_i \exp\!\bigg(\frac{-1}{2}z_i^2\bigg)\mathrm{d}z_i \\ &= \frac{1}{\sqrt{2\pi}} \exp\!\bigg(\frac{-1}{2}c^2\bigg) \quad\quad\quad\quad\text{ (Integration by substitution)}\\ &= \phi(c) \end{align}(c)(c)(c)

1
使分布适合空间数据
从mathoverflow交叉发布我的问题,以找到一些特定于统计信息的帮助。 我正在研究一个物理过程,该过程生成的数据可以很好地投影到具有非负值的两个维度中。每个过程都有 -点的(投影)轨迹-参见下图。xxxyyy 样本轨道为蓝色,麻烦的轨道类型以绿色绘制,而关注区域则以红色绘制: 每个轨道都是独立实验的结果。几年来已经进行了2000万次实验,但是从那开始只有2000项实验展现了我们绘制的轨迹特征。我们只关心产生轨迹的实验,因此我们的数据集是(大约)两千条轨迹。 这是可能的轨道,进入关注的区域,我们期望的顺序在曲目这样做。估算这个数字是眼前的问题:11110410410^4 我们如何计算一条任意轨道进入关注区域的可能性? 不可能足够快地进行实验,以查看进入关注区域的跟踪的产生频率,因此我们需要从可用数据中推断出结果。 例如,我们已经拟合了给定值,但这并不能充分处理绿色轨迹之类的数据-似乎需要一个包含两个维度的模型。xxxy≥200y≥200y\ge200 我们已经确定了从每个轨道到关注区域的最小距离,但是我们不相信这会产生合理的结果。 1)是否有已知的方法可以使分布适合此类数据进行外推? -要么- 2)是否有明显的方法使用此数据来创建用于生成轨道的模型?例如,使用轨道上的主成分分析作为较大空间中的点,然后对投影到这些成分上的轨道拟合分布(Pearson?)。

2
有什么很好的类比来说明分层贝叶斯模型的优势?
我是贝叶斯统计的新手,最近一直在使用JAGS在不同的数据集上构建分层贝叶斯模型。尽管我对结果非常满意(与标准的glm模型相比),但我需要向非统计人员解释与标准统计模型的区别。特别是,我想说明为什么和何时HBM的性能优于简单模型。 类比很有用,尤其是说明一些关键要素的类比: 多层次的异质性 需要更多计算以适合模型 从相同数据中提取更多“信号”的能力 请注意,答案确实应该是对非统计人员的启发,而不是简单易懂的示例。

3
“经统计证明”的概念
当新闻谈论的事情“经过统计学证明”时,他们是正确使用了定义明确的统计概念,使用了错误的统计信息还是仅仅使用了矛盾的词? 我认为“统计证明”实际上不是为了证明假设而进行的事情,也不是数学证明,而是更多的“统计检验”。
10 inference  proof 


1
这两个回归模型之间的根本区别是什么?
假设我有一个具有显着相关性的双变量响应。我正在尝试比较两种模拟这些结果的方法。一种方法是对两个结果之间的差异进行建模: 另一种方法是对它们进行使用或建模: (yi2−yi1=β0+X′β)(yi2−yi1=β0+X′β)(y_{i2}-y_{i1}=\beta_0+X'\beta)glsgee(yij=β0+time+X′β)(yij=β0+time+X′β)(y_{ij}=\beta_0+\text{time}+X'\beta) 这是一个foo示例: #create foo data frame require(mvtnorm) require(reshape) set.seed(123456) sigma <- matrix(c(4,2,2,3), ncol=2) y <- rmvnorm(n=500, mean=c(1,2), sigma=sigma) cor(y) x1<-rnorm(500) x2<-rbinom(500,1,0.4) df.wide<-data.frame(id=seq(1,500,1),y1=y[,1],y2=y[,2],x1,x2) df.long<-reshape(df.wide,idvar="id",varying=list(2:3),v.names="y",direction="long") df.long<-df.long[order(df.long$id),] df.wide$diff_y<-df.wide$y2-df.wide$y1 #regressions fit1<-lm(diff_y~x1+x2,data=df.wide) fit2<-lm(y~time+x1+x2,data=df.long) fit3<-gls(y~time+x1+x2,data=df.long, correlation = corAR1(form = ~ 1 | time)) fit1和之间有什么根本区别fit2?在fit2和之间fit3,假设它们与值和估计值如此接近?ppp

2
在一个样本t检验,在方差如果发生了什么估计样本均值被替换为
假定一个单样本t检验,其中,所述零假设为。统计是然后吨= ‾ X - μ 0μ = μ0μ=μ0\mu=\mu_0使用样本标准差s。在估计小号,一个观测比较样本均值¯X:t = x¯¯¯- μ0s / n√t=x¯−μ0s/nt=\frac{\overline{x}-\mu_0}{s/\sqrt{n}}ssssssX¯¯¯x¯\overline{x} 。s = 1n − 1∑ñ我= 1(x一世− x¯¯¯)2---------------√s=1n−1∑i=1n(xi−x¯)2s=\sqrt{\frac{1}{n-1}\sum_{i=1}^n (x_i-\overline{x})^2} 然而,如果我们假设在给定是真实的,人们也可以估算标准偏差小号*使用μ 0,而不是样本均值¯ X:μ0μ0\mu_0s∗s∗s^*μ0μ0\mu_0X¯¯¯x¯\overline{x} 。s∗= 1n − 1∑ñ我= 1(x一世- μ0)2----------------√s∗=1n−1∑i=1n(xi−μ0)2s^*=\sqrt{\frac{1}{n-1}\sum_{i=1}^n (x_i-\mu_0)^2} 对我来说,这种方法看起来更自然,因为我们因此也将原假设用于估计SD。有谁知道测试中是否使用了所得统计量,或者为什么不知道?

1
CPH,加速故障时间模型或神经网络用于生存分析的比较
我是生存分析的新手,我最近了解到,对于特定目标,可以采用不同的方法进行。我对这些方法的实际实现和适当性感兴趣。 向我介绍了传统的Cox比例危害,加速故障时间模型和神经网络(多层感知器),作为根据患者的时间,状态和其他医学数据获得患者生存的方法。据说这项研究将在五年内完成,目标是每年为新的记录给出生存风险。 我发现了两个实例,这些实例是通过Cox PH选择其他方法的: 我发现“ 如何从Cox PH模型获得生存期的预测 ”,并提到: 如果您对获取特定时间点生存概率的估计特别感兴趣,我将向您介绍参数化生存模型(又称为加速故障时间模型)。这些是在R的生存程序包中实现的,将为您提供参数化的生存时间分布,您可以在其中简单地插入您感兴趣的时间并获取生存概率。 我去了推荐的站点,并在survival软件包中找到了一个函数survreg。 在此评论中建议使用神经网络: 神经网络方法进行生存分析的一个优势是它们不依赖于Cox分析基础的假设... 另一个问题是“ 带有目标向量的R神经网络模型,其输出包含生存预测 ”,给出了一种详尽的方法来确定神经网络和Cox PH中的生存。 用于获得生存的R代码如下所示: mymodel <- neuralnet(T1+T2+T3+T4+T5~covar1+covar2+covar3+..., data=mydata, hidden=1) compute(mymodel,data=mydata) 我去了R论坛,并在“ predict.coxph和predict.survreg ” 问题中找到了这个答案: 确实,从的predict()功能中,coxph您不能直接获得“时间”预测,而只能获得线性和指数风险评分。这是因为,为了获得时间,必须计算基准危害,而且它并不直接,因为它在Cox模型中是隐含的。 我想知道这三个(或两个考虑Cox PH的论点)中哪一个最适合获取感兴趣时间段的生存率?我对在生存分析中使用哪一个感到困惑。

2
是否有理由不考虑探索性因素分析解决方案?
是否有任何理由不采用探索性因素分析解决方案? 很容易找到将正交解与斜解进行比较的讨论,我想我完全理解所有这些内容。同样,从我在教科书中可以找到的内容来看,作者通常从解释因子分析估计方法正确地解释了轮换的工作方式以及一些不同的选择。我还没有看到关于是否首先旋转的讨论。 另外,如果有人可以提供反对任何类型旋转的论点,这对多种估算因子的方法(例如,主成分法和最大似然法)都是有效的,我将不胜感激。

1
对于已知的平均绝对偏差,哪种分布具有最大熵?
我正在阅读Hacker News上有关标准偏差而不是平均绝对偏差等其他指标的使用的讨论。那么,如果我们遵循最大熵的原理,如果仅知道分布的均值和平均绝对偏差,我们将使用哪种分布? 还是使用中位数和与中位数的平均绝对偏差更有意义? 我发现Grechuk,Molyboha和Zabarankin撰写了一篇论文《具有最大偏差量度的最大熵原理》,该文章似乎掌握了我所好奇的信息,但是花了我一段时间才能对其进行解密。

2
lmerTest :: anova中的自由度正确吗?它们与RM-ANOVA有很大不同
我正在分析R中反应时间实验的结果。 我进行了重复测量方差分析(1个受试者内部因素具有2个水平,而1个受试者之间因素具有2个水平)。我运行了一个类似的线性混合模型,我想使用ANOVA表的形式总结lmer结果lmerTest::anova。 不要误会我的意思:我没想到会有相同的结果,但是我不确定lmerTest::anova结果的自由度。在我看来,它反映的是ANOVA,而在主题级别上没有任何汇总。 我知道以下事实:在混合效应模型中计算自由度是很棘手的,但lmerTest::anova在更新的?pvalues主题(lme4包)中被提及为一种可能的解决方案。 这个计算正确吗?结果lmerTest::anova是否正确反映了指定的模型? 更新:我使个体差异更大。自由度lmerTest::anova与简单的方差不同,但是我仍然不确定,为什么它们对于主体内因素/相互作用如此之大。 # mini example with ANT dataset from ez package library(ez); library(lme4); library(lmerTest) # repeated measures ANOVA with ez package data(ANT) ANT.2 <- subset(ANT, !error) # update: make individual differences larger baseline.shift <- rnorm(length(unique(ANT.2$subnum)), 0, 50) ANT.2$rt <- ANT.2$rt + baseline.shift[as.numeric(ANT.2$subnum)] anova.ez <- ezANOVA(data = …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.