统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


3
在CLT中,为什么?
令是来自均值和方差的分布的独立观测值,当,则X1,...,XnX1,...,XnX_1,...,X_nμμ\muσ2&lt;∞σ2&lt;∞\sigma^2 < \inftyn→∞n→∞n \rightarrow \infty n−−√X¯n−μσ→N(0,1).nX¯n−μσ→N(0,1).\sqrt{n}\frac{\bar{X}_n-\mu}{\sigma} \rightarrow N(0,1). 为什么这意味着 X¯n∼N(μ,σ2n)?X¯n∼N(μ,σ2n)?\bar{X}_n \sim N\left(\mu, \frac{\sigma^2}{n}\right)?

3
Cohen d的相关样本t检验
快速提问:我已经看到Cohen的d为依赖性样本t检验计算了两种不同的方法(例如,样本内设计在前后时间点对药物的功效进行了测试)。 在Cohen方程的分母中使用变化得分的标准偏差。 在Cohen方程的分母中使用预测分数的标准偏差。 我发现很少有文献描述使用哪个选项和/或何时使用这两个选项。 有什么想法吗?

1
对自相关二进制时间序列建模
对二进制时间序列建模的常用方法是什么?是否有纸质或教科书在其中处理?我认为具有强自相关的二进制过程。类似于从零开始的AR(1)进程的符号。说且 有白噪声。然后,由定义 的二进制时间序列 将显示自相关,我想用以下代码进行说明X0=0X0=0X_0 = 0Xt+1=β1Xt+ϵt,Xt+1=β1Xt+ϵt, X_{t+1} = \beta_1 X_t + \epsilon_t, ϵtϵt\epsilon_t(Yt)t≥0(Yt)t≥0(Y_t)_{t \ge 0}Yt=sign(Xt)Yt=sign(Xt) Y_t = \text{sign}(X_t) set.seed(1) X = rep(0,100) beta = 0.9 sigma = 0.1 for(i in 1:(length(X)-1)){ X[i+1] =beta*X[i] + rnorm(1,sd=sigma) } acf(X) acf(sign(X)) 如果我得到二进制数据并且我所知道的是存在显着的自相关,那么教科书/常用的建模方法是什么?YtYtY_t 我认为,如果使用外部回归变量或季节性假人,我可以进行逻辑回归。但是,纯时间序列方法是什么? 编辑:确切地说,我们假设sign(X)最多可自动关联4个滞后。这将是4阶的马尔可夫模型,我们可以对其进行拟合和预测吗? 编辑2:同时,我偶然发现了时间序列的glms。这些是解释错误的变量,它们是滞后的观察结果和外部回归变量。但是,这似乎是针对泊松和负二项式分布计数完成的。我可以使用泊松分布来估算伯努利斯。我只是想知道是否没有明确的教科书方法。 编辑3:赏金到期...有什么想法吗?

3
哪种回归模型最适合用于计数数据?
我想稍微了解一下统计信息,但是我有些固执。我的数据如下: Year Number_of_genes 1990 1 1991 1 1993 3 1995 4 我现在想建立一个回归模型,以便能够根据数据预测任何给定年份的基因数量。直到现在,我都使用线性回归进行分析,但是我已经阅读了一些文章,对于这种数据,它似乎并不是最佳选择。我已经读过泊松回归可能有用,但是我不确定该使用什么。所以我的问题是: 是否有针对此类数据的通用回归模型?如果不是,我该怎么做才能找出最适合使用哪种方法(就我必须了解的数据而言)?

1
防止帕累托平滑重要性抽样(PSIS-LOO)失败
我最近开始使用帕累托平滑重要性抽样留一法交叉验证(PSIS-LOO),这些论文对此进行了介绍: Vehtari,A.&Gelman,A.(2015年)。帕累托平滑重要性抽样。arXiv预印本(链接)。 Vehtari,A.,Gelman,A.,&Gabry,J.(2016年)。使用留一法交叉验证和WAIC的实用贝叶斯模型评估。arXiv预印本(链接) 这代表了一种非常好的样本外模型评估方法,因为它允许通过一次MCMC运行就可以执行LOO-CV,并且据称比现有的信息标准(例如WAIC)更好。 k^ik^i\hat{k}_ik^i≳0.7k^i≳0.7\hat{k}_i \gtrsim 0.7 不幸的是,我发现在将该方法应用于问题时,对于大多数感兴趣的模型,我发现的很大一部分。毫不奇怪,一些报告的LOO对数似然显然是毫无意义的(与其他数据集相比)。作为双重检查,我执行了传统的(且费时的)10倍交叉验证,发现确实在上述情况下,PSIS-LOO给出了非常错误的结果(从正面来看,结果与10所有的模型的CV。作为记录,我使用的是Aki Vehtari的PSIS-LOO 的MATLAB实现。k^i≫0.7k^i≫0.7\hat{k}_i \gg 0.7k^i≪0.7k^i≪0.7\hat{k}_i \ll 0.7 也许我很倒霉,因为我目前应用此方法的第一个问题对PSIS-LOO来说“困难”,但是我怀疑这种情况可能相对普遍。对于像我这样的案例,Vhttary,Gelman&Gabry的论文简单地说: 即使PSIS估计具有有限的方差,当,用户也应考虑针对有问题的直接从进行采样,请使用倍交叉验证,或使用更可靠的模型。k^&gt;0.7k^&gt;0.7\hat{k} > 0.7p(θs|y−i)p(θs|y−i)p(\theta^s |y_{−i})iiikkk 这些是显而易见的但不是真正理想的解决方案,因为它们都很费时或需要额外的摆弄(我很欣赏MCMC 和模型评估都是摆弄,但越少越好)。 我们是否可以预先应用任何常规方法来尝试防止 PSIS-LOO失败?我有一些初步的想法,但我想知道人们是否已经采用了经验方法。

3
通过方向独立变量来检验正态分布的DV的关联性吗?
是否存在关于正态分布因变量是否与方向分布变量相关联的假设检验? 例如,如果一天中的时间是解释性变量(并且假设诸如星期几,一年中的月份等不相关),这就是如何解释11pm 比 1am 早 22小时的事实,以及2小时落后于联想的测试凌晨1点?我是否可以测试连续时间是否解释了因变量,而不假设在晚上11:59之后一分钟没有出现午夜12:00? 此测试是否也适用于离散方向性(模块化?)解释变量?还是需要单独测试?例如,如何测试是否按年份的月份解释因变量(假设年份的日期和季节以及特定的年份或十年无关紧要)。一年中的月份绝对会忽略顺序。但是将一年中的月份视为标准序数变量(例如Jan = 1 ... Dec = 12)忽略了1月在11月之后的两个月。

2
为什么统计文献中没有那么强调II型错误?
我已经看到很多情况,在各种研究文章中都提到了类型I错误(用alpha值表示)。我发现很少有研究人员考虑到功效或II型错误。 II型错误可能是一件大事吧?当替代假设实际上是错误的时,我们意外地拒绝了它。为什么强调alpha值而不是强调beta值? 当我进行第一年的统计时,我从来没有学会过Beta版-仅Alpha版。我认为这两个错误应同等对待。但是,似乎只强调了alpha。

1
在训练逻辑回归中给予“部分信誉”(连续结果)是否是一个好主意?
我正在训练逻辑回归,以预测哪些运动员最有可能完成艰苦的耐力赛。 很少有跑步者完成这场比赛,所以我的课时失衡非常严重,并且只有很少的成功案例(也许是几十个)。我觉得我可以从几十个几乎做到这一点的跑步者那里得到一些好的“信号” 。(我的训练数据不仅完成了,而且还没有完成,实际达到了多少。)因此,我想知道是否包括一些“部分功劳”是一个糟糕的主意。我想出了一些用于部分功劳的函数,坡度和逻辑曲线,可以给它们提供各种参数。 与回归的唯一区别是,我将使用训练数据来预测修改后的连续结果,而不是二进制结果。比较他们对测试集的预测(使用二进制响应),我得出的结论还很不确定-逻辑部分信用似乎在某种程度上改善了R平方,AUC,P / R,但这只是使用小样本。 我不关心预言正在向着完成均匀偏见-我在意的是正确的排名上出现的可能性参赛者完成,或者甚至估计其相对整理的可能性。 我了解到逻辑回归假设预测变量与比值比的对数之间存在线性关系,并且如果我开始混淆结果,显然该比值没有任何实际解释。我确信从理论上讲这并不明智,但它可能有助于获得一些附加信号并防止过拟合。(我的预测变量几乎与成功一样多,因此使用部分完成的关系作为检查完全完成的关系可能会有所帮助)。 在负责任的实践中曾经使用过这种方法吗? 不管哪种方式,是否还有其他类型的模型(也许是某种明确地对危险率建模的模型,应用于距离而不是时间)可以更适合此类分析?

2
为什么Rao-Blackwell定理要求?
Rao-Blackwell定理指出 让是一个估计与所有。假设对于是足够的,并且让然后对于所有,不等式是严格的,除非是的函数θ^θ^\hat{\theta}θθ\thetaE(θ^2)&lt;∞E(θ^2)&lt;∞\Bbb E (\hat{\theta}^2) < \inftyθθ\thetaTTTθθ\thetaθ∗=E(θ^|T)θ∗=E(θ^|T)\theta ^ * = \Bbb E (\hat{\theta}|T)θθ\thetaE(θ∗−θ)2≤E(θ^−θ)2E(θ∗−θ)2≤E(θ^−θ)2\Bbb E (\theta^* - \theta )^2 \leq \Bbb E (\hat{\theta} - \theta )^2θ^θ^\hat{\theta}TTT 如果我正确理解了该定理,则表明如果我有足够的统计量来计算,则给定的的条件期望值就是(\ hat {\ theta}-\ theta)^ 2TTTθθ\thetaθ^θ^\hat{\theta}TTTminθ^Eminθ^E\min_{\hat{\theta}} \Bbb E (θ^−θ)2(θ^−θ)2(\hat{\theta}-\theta)^2 我的问题 我是否纠正θ∗θ∗\theta^*最小化EE\Bbb E (θ^−θ)2(θ^−θ)2(\hat{\theta}-\theta)^2? 为什么Rao-Blackwell定理要求E(θ^2)&lt;∞E(θ^2)&lt;∞\Bbb E(\hat{\theta}^2) < \infty? 为什么不等式严格,除非θ^θ^\hat{\theta}是T的函数TTT?

3
RBF SVM用例(对比逻辑回归和随机森林)
具有径向基函数内核的支持向量机是一种通用的监督分类器。 虽然我知道这些SVM的理论基础及其优点,但我不知道它们是首选方法的情况。那么,RBF SVM是否比其他ML技术优越呢?(无论是在得分方面,还是其他方面-诸如健壮性,入门容易性,可解释性等) 我在问,因为我的默认方法围绕逻辑回归(也许有些交互作用),随机森林和一些神经网络。我做ML的所有朋友(有些是Kaggle赢家)都不是SVM用户(但这可能是我所在社区的产物,或者是他们处理的问题)。

5
用Layman的术语解释均值,中位数,众数
您将如何解释数字列表的均值,中位数和众数的概念,以及为什么它们对仅具有基本算术技能的人很重要?更不用说偏度,CLT,集中趋势,其统计属性等了。 我已经向某人解释说,这只是“汇总”数字列表的一种快速而肮脏的方法。但是回头看,这很难说明。 有什么想法或现实世界的例子吗?

3
进行线性回归时,斜率的无先验信息是什么?
在执行贝叶斯线性回归时,需要为坡度分配先验并截取。由于是位置参数,因此分配统一的先验是有意义的;但是,在我看来,类似于比例尺参数,并且在其之前分配制服似乎是不自然的。aaabbbbbbaaa 另一方面,为线性回归的斜率分配通常没有信息的杰弗里·普雷尔()似乎不太正确。首先,它可以是负数。但是我看不出还有什么可能。1/a1/a1/a 那么,贝叶斯线性回归的斜率的“适当”先验信息是什么?(任何参考文献将不胜感激。)


3
Logistic回归中的排名功能
我使用了Logistic回归。我有六个功能,我想知道此分类器中比其他功能更能影响结果的重要功能。我使用了Information Gain,但似乎并不依赖于所使用的分类器。是否有任何方法可以根据特定的分类器(例如Logistic回归)根据其重要性对特征进行排名?任何帮助将不胜感激。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.