统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
关于混合模型中参数估计的直觉(方差参数与条件模式)
我已经读过很多次了,随机效应(例如,对象的BLUP /条件模式)不是线性混合效应模型的参数,而是可以从估计的方差/协方差参数中得出的。例如Reinhold Kliegl等。(2011)状态: 随机效应是受试者与总体均值RT的偏差以及受试者与固定效应参数的偏差。假定它们是独立且均值为0的正态分布。重要的是要认识到,这些随机效应不是 LMM的参数-只有它们的方差和协方差才是。LMM参数与受试者的数据结合可用于为每个受试者生成随机效果的“预测”(条件模式)。 有人可以给出直观的解释,如何在不实际使用/估计随机效应的情况下估计随机效应的(协)方差参数吗?

3
使用glm()代替简单的卡方检验
我有兴趣更改glm()R中使用的原假设。 例如: x = rbinom(100, 1, .7) summary(glm(x ~ 1, family = "binomial")) 检验的假设p = 0.5p=0.5p = 0.5。如果我想将null更改为ppp =某个任意值,该glm()怎么办? 我知道也可以使用prop.test()和来完成此操作chisq.test(),但是我想探讨一下使用glm()来测试与分类数据有关的所有假设的想法。

5
为什么?
我想 P(A|B)=P(A|B,C)∗P(C)+P(A|B,¬C)∗P(¬C)P(A|B)=P(A|B,C)∗P(C)+P(A|B,¬C)∗P(¬C)P(A|B) = P(A | B,C) * P(C) + P(A|B,\neg C) * P(\neg C) 是正确的,而 P(A|B)=P(A|B,C)+P(A|B,¬C)P(A|B)=P(A|B,C)+P(A|B,¬C)P(A|B) = P(A | B,C) + P(A|B,\neg C) 是不正确的。 但是,我对后一种情况有一个“直觉”,也就是说,通过拆分两种情况(C或Not C)来考虑概率P(A | B)。为什么这种直觉是错误的?

3
我可以使用一个很小的验证集吗?
我了解将数据分为测试集和验证集的原因。我也了解,拆分的大小取决于情况,但通常会在50/50到90/10之间变化。 我建立了一个RNN以纠正拼写,并从大约500万个句子的数据集开始。我削减了50万个句子,然后训练剩下的〜450万个句子。训练完成后,我将使用我的验证集并计算准确性。 有趣的是,仅在我的验证集的4%之后,我的准确度为69.4%,并且该百分比在任一方向上的变化不超过0.1%。最终我只是缩短了验证时间,因为这个数字停留在69.5%。 那么,当我大概可以摆脱1%的费用时,为什么要砍掉10%的费用进行验证?有关系吗?


5
合并方差“实际上”是什么意思?
我是统计方面的菜鸟,所以请您在这里帮助我。 我的问题如下:合并方差实际上是什么意思? 当我在互联网上寻找汇总方差的公式时,我发现很多使用以下公式的文献(例如,在这里:http : //math.tntech.edu/ISR/Mathematical_Statistics/Introduction_to_Statistical_Tests/thispage/newnode19.html): S2p=S21(n1−1)+S22(n2−1)n1+n2−2Sp2=S12(n1−1)+S22(n2−1)n1+n2−2\begin{equation} \label{eq:stupidpooledvar} \displaystyle S^2_p = \frac{S_1^2 (n_1-1) + S_2^2 (n_2-1)}{n_1 + n_2 - 2} \end{equation} 但是它实际计算的是什么?因为当我使用此公式计算合并方差时,它给了我错误的答案。 例如,考虑以下“父样本”: 2,2,2,2,2,8,8,8,8,82,2,2,2,2,8,8,8,8,8\begin{equation} \label{eq:parentsample} 2,2,2,2,2,8,8,8,8,8 \end{equation} 该父样本的方差为,其均值为。S2p=10Sp2=10S^2_p=10x¯p=5x¯p=5\bar{x}_p=5 现在,假设我将此父样本拆分为两个子样本: 第一个子样本是2,2,2,2,2,均值和方差。x¯1=2x¯1=2\bar{x}_1=2S21=0S12=0S^2_1=0 第二个子样本为8,8,8,8,8,均值且方差。x¯2=8x¯2=8\bar{x}_2=8S22=0S22=0S^2_2=0 现在,显然,使用上面的公式来计算这两个子样本的合并/父方方差将产生零,因为和。那么,该公式实际计算的是什么?S1=0S1=0S_1=0S2=0S2=0S_2=0 另一方面,经过长时间的推导,我发现产生正确的合并/父方方差的公式为: S2p=S21(n1−1)+n1d21+S22(n2−1)+n2d22n1+n2−1Sp2=S12(n1−1)+n1d12+S22(n2−1)+n2d22n1+n2−1\begin{equation} \label{eq:smartpooledvar} \displaystyle S^2_p = \frac{S_1^2 (n_1-1) + n_1 d_1^2 + S_2^2 (n_2-1) + n_2 d_2^2} {n_1 + …
15 variance  mean  pooling 

2
Logistic回归如何产生非传统函数的曲线?
我认为我对Logistic回归中的功能如何工作(或者可能只是整体功能)有一些根本的困惑。 函数h(x)如何产生在图像左侧看到的曲线? 我看到这是两个变量的图,但是这两个变量(x1和x2)也是函数本身的参数。我知道一个变量的标准函数映射到一个输出,但是此函数显然没有做到这一点-我不确定为什么。 我的直觉是,蓝色/粉红色曲线并没有真正绘制在该图上,而是一种表示形式(圆圈和X),它们映射到该图的下一个维度(第3个)中的值。这是错误的推理吗,我只是错过了什么吗?感谢您的任何见解/直觉。

1
多次插补后合并校准图
我想对多次插补后合并校准图/统计数据提出建议。在开发统计模型以预测未来事件的设置中(例如,使用医院记录中的数据预测医院出院后的存活或事件),人们可以想象有很多缺失的信息。多重插补是处理这种情况的一种方式,但是导致需要合并每个插补数据集的测试统计数据,并考虑到由于插补固有的不确定性而导致的其他可变性。 我知道有多个校准统计信息(hosmer-lemeshow,Harrell的Emax,估计的校准指数等),可能适用“常规” Rubin合并规则。 但是,这些统计信息通常是校准的总体度量,没有显示模型的特定未校准区域。因此,我宁愿看一下校准图。遗憾的是,我对如何“汇总”图表或背后的数据(每个人的预测概率和每个人的观察到的结果)一无所知,并且在生物医学文献(我熟悉的领域)中找不到很多东西,或在这里,在CrossValidated上。当然,查看每个插补数据集的标定图可能是一个答案,但是当创建许多插补集时(可能会很麻烦)。 因此,我想问一问是否存在可以在多次插补之后合并校准图的技术?

2
为什么期望最大化对于混合模型很重要?
有许多文献强调混合模型(高斯混合模型,隐马尔可夫模型等)上的期望最大化方法。 为何EM重要?EM只是一种优化方法,并未广泛用作基于梯度的方法(梯度体面或牛顿/准牛顿法)或此处讨论的其他无梯度方法。此外,EM仍然存在局部极小问题。 是因为该过程是直观的并且可以轻松地转换为代码吗?还是其他原因?

5
根据平均绝对误差的箱线图删除异常值以改进回归模型是否作弊
我有一个用四种方法测试的预测模型,如下面的箱线图所示。模型预测的属性在0到8的范围内。 您可能会注意到,所有方法都指示一个上界离群值和三个下界离群值。我想知道从数据中删除这些实例是否合适?还是这是一种欺骗,以改善预测模型?


5
对于平均置信区间的近似误差时
令是一族iid随机变量,其值在,具有均值和方差{Xi}ni=1{Xi}i=1n\{X_i\}_{i=1}^n[0,1][0,1][0,1]μμ\muσ2σ2\sigma^2。给出均值的简单置信区间,只要知道就 使用σσ\sigmaP(| X¯−μ|>ε)≤σ2nε2≤1nε2(1).P(|X¯−μ|>ε)≤σ2nε2≤1nε2(1). P( | \bar X - \mu| > \varepsilon) \le \frac{\sigma^2}{n\varepsilon^2} \le\frac{1}{n \varepsilon^2} \qquad (1). 同样,由于渐近分布为标准正态随机变量,因此有时使用正态分布来“构造”近似置信区间。X¯−μσ/n√X¯−μσ/n\frac{\bar X- \mu}{\sigma/\sqrt{n}} 在多项选择题答案统计考试中,我不得不使用这种近似代替(1)(1)(1)每当时。我一直对此感到非常不舒服(超出您的想象),因为无法量化近似误差。n≥30n≥30n \geq 30 为什么使用法线逼近而不是?(1)(1)(1) 我不想再盲目地应用规则。是否有好的参考文献可以支持我拒绝这样做并提供适当的替代方法?((1)是我认为合适的替代方法的示例。)n≥30n≥30n \geq 30(1)(1)(1) 在这里,虽然σσ\sigma和E[|X|3]E[|X|3]E[ |X|^3]未知,但它们很容易被限制。 请注意,我的问题是一个参考请求,尤其是有关置信区间的请求,因此与此处建议作为部分重复的问题的区别有所不同和此处。那里没有答案。

2
尽管损失值高,但精度高
在简单神经网络二进制分类器的训练过程中,我使用交叉熵得到了很高的损失值。尽管如此,验证集的准确性仍然具有很高的价值。有什么意义吗?损失与准确性之间没有严格的关联吗? 我在训练和验证这些值时:0.4011-acc:0.8224-val_loss:0.4577-val_acc:0.7826。这是我实现NN的首次尝试,而我刚刚接触过机器学习,因此无法正确评估这些结果。

1
常规PCA和概率PCA有什么区别?
我知道常规的PCA不遵循概率模型来观察数据。那么PCA和PPCA之间的基本区别是什么?在PPCA中,潜变量模型包含例如观测变量,潜变量(未观察变量x)和矩阵W,矩阵W不必像常规PCA那样是正交的。我可以想到的另一个区别是,常规PCA仅提供主要组件,而PPCA提供了数据的概率分布。yyyxxxWWW 有人可以进一步谈谈PCA和PPCA之间的区别吗?
15 pca 

1
两个回归系数之比的无偏估计量?
假设你适合的线性/对数回归,具有的无偏估计的目的一个1g(y)=a0+a1⋅x1+a2⋅x2g(y)=a0+a1⋅x1+a2⋅x2g(y) = a_0 + a_1\cdot x_1 + a_2\cdot x_2。您是非常有信心,无论一个1和一个2相对于他们的估计噪声非常积极的。a1a2a1a2\frac{a_1}{a_2}a1a1a_1a2a2a_2 如果你有联合协,你可以计算出,或至少模拟了答案。有没有更好的方法,在现实生活中有大量数据的问题中,您在采用估计比率或半步并假设系数独立时会遇到多少麻烦?a1,a2a1,a2a_1, a_2

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.