统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
回归系数的抽样分布
之前,我了解了采样分布,这些分布根据未知参数给出了供估计器使用的结果。例如,对于线性回归模型中和的采样分布β^0β^0\hat\beta_0β^1β^1\hat\beta_1Yi=βo+β1Xi+εiYi=βo+β1Xi+εiY_i = \beta_o + \beta_1 X_i + \varepsilon_i β^0∼N(β0, σ2(1n+x¯2Sxx))β^0∼N(β0, σ2(1n+x¯2Sxx)) \hat{\beta}_0 \sim \mathcal N \left(\beta_0,~\sigma^2\left(\frac{1}{n}+\frac{\bar{x}^2}{S_{xx}}\right)\right) 和 β^1∼N(β1, σ2Sxx)β^1∼N(β1, σ2Sxx) \hat{\beta}_1 \sim \mathcal N \left(\beta_1,~\frac{\sigma^2}{S_{xx}}\right) 其中Sxx=∑ni=1(x2i)−nx¯2Sxx=∑i=1n(xi2)−nx¯2S_{xx} = \sum_{i=1}^n (x_i^2) -n \bar{x}^2 但是现在我在书中看到了以下内容: 假设我们以通常的方式用最小二乘法拟合模型。考虑贝叶斯后验分布,并选择先验,这样就等于通常的常客抽样分布,即…… (β0β1)∼N2[(β^1β^2), σ^2(n∑ni=1xi∑ni=1xi∑ni=1x2i)−1](β0β1)∼N2[(β^1β^2), σ^2(n∑i=1nxi∑i=1nxi∑i=1nxi2)−1] \left( \begin{matrix} \beta_0 \\ \beta_1 \end{matrix} \right) \sim \mathcal N_2\left[\left(\begin{matrix} \hat{\beta}_1 \\ \hat{\beta}_2 \end{matrix} …

1
面板/纵向数据的预测评估指标
我想评估几种不同的模型,这些模型可以每月提供行为预测。数据是平衡的, 100,000, 12。结果是在给定的月份参加音乐会,因此在任何月份中〜80%的人都为零,但是用户量很大,右尾长长。我的预测似乎并不尊重结果的计数性质:小规模音乐会很普遍。T =n=n=n=T=T=T= 我对模型一无所知。我每个人每个月只观察6种不同的黑匣子预测。我确实有额外的一年数据,模型制作者没有估算的数据(尽管一致参加者保持不变),我想评估每个数据在哪里表现良好(就准确性和准确性而言)。例如,某些模型对经常参加音乐会的人是否有很好的预测,但对沙发土豆却没有用?一月份的预测好于十二月的预测吗?另外,很高兴知道这些预测使我能够根据实际情况对人进行正确排名,即使无法相信确切的幅度。y^1,...,y^6y^1,...,y^6\hat y_1,...,\hat y_6 我的第一个想法是对预测的和时间的虚拟变量进行实际的固定效应回归,并查看每个模型的RMSE或。但这不能回答有关每个模型在哪里运行良好或差异是否显着的问题(除非我引导RMSE)。结果的分布也让我担心这种方法。R2R2R^2 我的第二个想法是将结果分为0、1-3和3+,然后计算混淆矩阵,但这会忽略时间维度,除非我将其设为12。这也很粗糙。 我知道concordTJ Steichen和NJ Cox所提供的Stata命令,它们可以by()选择,但是这需要将数据压缩到年度总数中。这将在其他有用的统计数据中,使用置信区间计算Lin的Concordance相关指数。CCC的范围是-1至1,完美的一致性为1。 还有Harrell的(由R. Newson 计算 ),可以选择,但是我不确定这是否允许我处理面板数据。这为您提供了置信区间。Harrell c是连续结果的ROC曲线(AUC)下面积的概括。它是可以排序的所有对的比例,以使具有较高预测值的对象实际上具有较高的结局。因此,对于随机预测,,对于完全区分的模型,。参见哈雷尔的书,第493页c = 0.5 c = 1cccsomersdclusterc=0.5c=0.5c=0.5c=1c=1c=1 您将如何解决这个问题?您是否建议计算预测中常见的统计数据(如MAPE)? 到目前为止发现的有用的东西: 幻灯片上的林的一致性相关系数的重复测量版本

1
等价的零假设
假设是来自正态分布的简单随机样本。X1,X2,...,XnX1,X2,...,XnX_1, X_2, \, ... \, , X_n(μ,σ2)(μ,σ2)(\mu,\sigma^2) 我有兴趣进行以下假设检验: 对于给定的常数。H0:|μ|≤cH1:|μ|&gt;c,H0:|μ|≤cH1:|μ|&gt;c, H_0: | \mu| \le c \\ H_1: |\mu| > c, c&gt;0c&gt;0c > 0 我正在考虑以与通常的生物等效性测试情况类似的方式执行两个单侧检验(TOST),其中null为代替,但是我不知道这是否有意义或正确。ttt|μ|≥c|μ|≥c|\mu| \ge c 我的想法是执行单面测试 和 并且如果值之一小于显着性水平拒绝全局零假设。H01:μ≤cH11:μ&gt;cH01:μ≤cH11:μ&gt;c H_{01} : \mu \le c \\ H_{11} : \mu > c H02:μ≥−cH12:μ&lt;−c,H02:μ≥−cH12:μ&lt;−c, H_{02} : \mu \ge -c \\ H_{12} : \mu < …

2
IQR检测异常值的准确性如何
我正在编写一个分析进程运行时间的脚本。我不确定它们的分布情况,但是我想知道某个进程是否运行“过长”。到目前为止,我一直在使用上次运行时间的3个标准差(n&gt; 30),但有人告诉我,如果数据不正常(看起来好像不是),这将无法提供任何有用的信息。我发现另一个异常测试指出: 找到四分位数间距,即IQR = Q3-Q1,其中Q3是第三个四分位数,而Q1是第一个四分位数。然后找到这两个数字: a)Q1-1.5 * IQR b)Q3 + 1.5 * IQR 如果&lt;a或&gt; b,则该点是异常值 我的数据通常是2sec,3sec,2sec,5sec,300sec,4sec等。其中300sec显然是一个异常值。 哪种方法更好?IQR方法还是std偏差方法?

2
t检验和单向方差分析是否都是Wald检验?
通过用费希尔在样本均值处的正态分布信息估算样本均值的标准偏差,可以将用于检验正态分布样本均值是否等于常数的t检验称为Wald检验。但是t检验中的检验统计量具有学生t分布,而Wald检验中的检验统计量渐近具有卡方分布。我想知道如何解释吗? 在单向方差分析中,检验统计量定义为类间差异与类内差异之间的比率。我想知道这是否也是Wald测试?但是单向方差分析中的检验统计量具有F分布,而Wald检验中的检验统计量渐近地具有卡方分布。我想知道如何解释吗? 感谢致敬!

1
Neg Binomial和Jeffreys的先验
我试图获得负二项式分布的Jeffreys先验。我看不到哪里出了问题,因此,如果有人可以指出这一点,将不胜感激。 好的,情况是这样的:我要比较使用二项式和负二项式获得的先验分布,(在两种情况下)都有试验且成功了。对于二项式情况,我得到了正确的答案,但是对于否定二项式,我没有得到正确的答案。nnnmmm 我们将其称为Jeffreys的先前。然后,πJ(θ)πJ(θ)\pi_J(\theta) πJ(θ)∝[I(θ)]1/2.πJ(θ)∝[I(θ)]1/2. \pi_J(\theta)\propto [I(\theta)]^{1/2}. 在常规条件下(在我们处理指数族时已实现), I(θ)=−E(∂2logL(θ|x)∂θ2)I(θ)=−E(∂2log⁡L(θ|x)∂θ2) I(\theta)=-E\left(\frac{\partial^2 \log L(\theta|x)}{\partial \theta^2}\right) 其中,负二项式n在上面nnn是xxx表达式(成功总数mmm是固定的,nnn不是固定的)。我认为分布是 p(m|θ)∝θm(1−θ)n−mp(m|θ)∝θm(1−θ)n−m p(m|\theta)\propto\theta^m(1-\theta)^{n-m} 因为θθ\theta被定义为成功的概率,而mmm 是成功的次数。这也是可能性,因为mmm是标量而不是向量。因此, L(θ|n)∝θm(1−θ)n−mlogL(θ|n)=mlogθ+(n−m)log(1−θ)∂logL(θ|n)∂θ=mθ−n−m1−θ∂2logL(θ|n)∂θ2=−mθ2−n−m(1−θ)2L(θ|n)∝θm(1−θ)n−mlog⁡L(θ|n)=mlog⁡θ+(n−m)log⁡(1−θ)∂log⁡L(θ|n)∂θ=mθ−n−m1−θ∂2log⁡L(θ|n)∂θ2=−mθ2−n−m(1−θ)2 L(\theta|n)\propto\theta^m(1-\theta)^{n-m}\\ \log L(\theta|n)=m\log\theta +(n-m)\log (1-\theta)\\ \frac{\partial\log L(\theta|n)}{\partial \theta}=\frac{m}{\theta}-\frac{n-m}{1-\theta}\\ \frac{\partial^2\log L(\theta|n)}{\partial \theta^2}=-\frac{m}{\theta^2}-\frac{n-m}{(1-\theta)^2} 因此Fisher信息是 I(θ)=−E(∂2logL(θ|n)∂θ2)=mθ2+E(n)−m(1−θ)2=mθ2+mθ1−θ−m(1−θ)2=m(1−θ)2+mθ3(1−θ)−mθ2θ2(1−θ)2=m(1−2θ)+mθ3(1−θ)θ2(1−θ)2=m(1−2θ)(1−θ)+mθ3θ2(1−θ)3=m(1−3θ+2θ2+θ3)θ2(1−θ)3∝1−3θ+2θ2+θ3θ2(1−θ)3I(θ)=−E(∂2log⁡L(θ|n)∂θ2)=mθ2+E(n)−m(1−θ)2=mθ2+mθ1−θ−m(1−θ)2=m(1−θ)2+mθ3(1−θ)−mθ2θ2(1−θ)2=m(1−2θ)+mθ3(1−θ)θ2(1−θ)2=m(1−2θ)(1−θ)+mθ3θ2(1−θ)3=m(1−3θ+2θ2+θ3)θ2(1−θ)3∝1−3θ+2θ2+θ3θ2(1−θ)3 I(\theta)=-E\left(\frac{\partial^2\log L(\theta|n)}{\partial \theta^2}\right)=\frac{m}{\theta^2}+\frac{E(n)-m}{(1-\theta)^2}=\frac{m}{\theta^2}+\frac{\frac{m\theta}{1-\theta}-m}{(1-\theta)^2}\\ =\frac{m(1-\theta)^2+\frac{m\theta^3}{(1-\theta)}-m\theta^2}{\theta^2(1-\theta)^2}=\frac{m(1-2\theta)+\frac{m\theta^3}{(1-\theta)}}{\theta^2(1-\theta)^2}\\ =\frac{m(1-2\theta)(1-\theta)+m\theta^3}{\theta^2(1-\theta)^3}=\frac{m(1-3\theta+2\theta^2+\theta^3)}{\theta^2(1-\theta)^3}\\ \propto\frac{1-3\theta+2\theta^2+\theta^3}{\theta^2(1-\theta)^3} 但是,这不能给我正确的答案。正确答案是 πJ(θ)∝1θ(1−θ)1/2πJ(θ)∝1θ(1−θ)1/2 \pi_J(\theta)\propto \frac{1}{\theta(1-\theta)^{1/2}} ,这意味着我得到的信息应该是 I(θ)=1θ2(1−θ)I(θ)=1θ2(1−θ) I(\theta)=\frac{1}{\theta^2(1-\theta)} 因为先验应与信息的平方根成比例。 谁能发现任何错误?如果我搞砸了发行版的设置(成功与失败以及各自的概率,等等),我不会感到惊讶。 我使用了Wikipedia的期望值,并且从这里知道正确的答案(第3页)。


2
我可以在元回归中将效果大小作为自变量包括在内吗?
我的问题是,是否可以在元回归中将效应大小用作因变量,将另一个效应大小用作自变量?XXXYYY 例如,我对运动对饮酒问题的影响进行了荟萃分析,发现了显着的结果和高度异质性。我想做一个元回归,并使用这些干预措施对焦虑的影响大小作为自变量,并以饮酒问题的影响大小作为因变量(假设每项研究都评估了焦虑和饮酒问题,并且我计算了效果大小为对冲的)。ggg 你能理解这个吗?

2
时间序列数据的空间自相关
我有一个20年数据集,其中包含一组多边形(约200个不规则形状的连续多边形)的物种丰富度的年度计数。我一直在使用回归分析来推断每个多边形的趋势(每年计数变化),以及基于管理边界的多边形数据汇总。 我确信数据中存在空间自相关,这肯定会影响汇总数据的回归分析。我的问题是-如何对时间序列数据进行SAC测试?我是否需要查看每年回归分析中残差的SAC(全局Moran's I)?还是我可以全年进行一次测试? 一旦我测试了是的,那么就有SAC了,解决这个问题容易吗?我的统计资料背景很少,我在时空建模方面阅读的所有内容听起来都很复杂。我知道R具有距离加权自协变量函数-这一点简单易用吗? 我真的很困惑如何评估/添加SAC来解决此问题,非常感谢任何建议,链接或参考。提前致谢!

2
这种建模方法是否过度拟合
最近有人告诉我,我遵循的过程(MS论文的组成部分)可能被认为过拟合。我希望对此有更好的了解,看看其他人是否同意。 本文这一部分的目的是 在数据集上比较梯度提升回归树与随机森林的性能。 查看所选最终模型(GBM或RF)的性能。 正在使用R中的gbm和randomForest软件包以及 caret。 遵循的过程如下: 数据的初步预处理(例如,将名义上的预测变量的缺失值插入称为“缺失”的不同类别)。没有考虑任何预处理的目标变量(这是非常小的)。 为每种算法的元参数创建值的网格(例如,GBM的迭代次数)。 创建数据集的25个随机分割(65%训练和35%测试)。 对GBM重复以下步骤25次(每次使用随机训练/测试分组之一。每次,训练和测试集都是课程更改的“当前”,这是重复的离开组交叉验证): 使用5倍交叉验证在网格搜索上找到算法的“最佳”参数设置。当前运行中没有使用先前运行中的任何东西。 确定后,将模型拟合到完整的“当前”训练集并预测“当前”测试集。保留此运行的性能指标。 一旦以这种方式获得了25个性能指标(实际上是特定于领域的指标,但将其视为准确性),请使用完全相同的过程,使用完全相同的独立训练和测试样本进行RF(相同过程,只是使用不同的方法)当然是网格搜索)。 现在,我从当时针对GBM和RF的“当前”测试集中获得了25种性能指标。我使用Wilcoxon符号秩检验和排列检验比较它们。我发现GBM更好。我还声称,GBM的这25次运行中的性能指标分布是最终GBM分类器的预期性能。 我没有做的是从一开始就抽取一个随机测试集,并将其放在一边,以便与根据所有训练数据构建的最终GBM模型进行比较。我认为我所做的实际上要好得多,因为我在保持过程中重复了拆分数据/调优模型/测试25次,而仅重复了一次。 这里有过度拟合吗?由于使用了25个运行来选择GBM与RF,这是否意味着从流程中获取的性能指标不能用作完整模型的性能估算? 编辑 为了回应韦恩的评论,这是在25次运行中的每一次运行的过程: 第i个训练集(i = 1,..,25)的采样数据分为5个大小相等的组。使用5组中的4组拟合模型,并将GBM参数(例如,迭代数)设置为等于第j个网格(j = 1,..,18)中的值。 使用此模型计算第五组的表现。 步骤1和步骤2再重复4次(常规旧k倍CV,k = 5)。该性能是从5个子运行中平均得出的,这用特定的一组参数值组成了GBM的预期性能。 对网格中的其他17个“行”重复执行步骤1-3。 一旦完成,就可以确定上述练习中的最佳参数值,并使用这些参数值和完整的第i个训练集拟合GBM。它的性能是在第i个测试集上估计的。 一旦整个过程完成25次,GBM就有25种性能指标。然后他们以完全相同的方式收集到RF。 在比较和选择GBM之后,我查看了这25个性能指标,并采用均值和标准差来确定该数据上GBM模型的置信区间。

4
贝叶斯无信息先验与惯常主义原假设:是什么关系?
我在这里的博客文章中看到了这张图片。 令我感到失望的是,阅读这份声明并没有像我给这个家伙带来同样的面部表情。 那么,零假设是频繁主义者如何表达无信息先验的陈述意味着什么?是真的吗 编辑:我希望有人可以提供一个慈善的解释,使这个说法正确,即使从某种意义上来说也是这样。

8
可视化高维数据
我有两个类别的样本,它们是高维空间中的向量,我想将它们绘制为2D或3D。 我了解降维技术,但是我需要一个非常简单易用的工具(在matlab,python或预构建的.exe中)。 我也想知道2D表示会“有意义”吗?(例如,两个类如何相交或可分离)。

1
高斯过程和Wishart分布的协方差矩阵
我正在阅读有关广义Wishart流程(GWP)的本文。本文使用平方指数协方差函数计算不同随机变量之间的协方差(遵循高斯过程),即。然后说该协方差矩阵遵循GWP。K(x,x′)=exp(−|(x−x′)|22l2)K(x,x′)=exp⁡(−|(x−x′)|22l2)K(x,x') = \exp\left(-\frac{|(x-x')|^2}{2l^2}\right) 我曾经认为从线性协方差函数()K(x,x′)=xTx′K(x,x′)=xTx′K(x,x') = x^Tx'计算出的协方差矩阵遵循具有适当参数的Wishart分布。 我的问题是,我们如何仍可以假设协方差服从具有平方指数协方差函数的Wishart分布?另外,一般来说,协方差函数产生Wishart分布协方差矩阵的必要条件是什么?

2
泊松回归如何可视化?
我想将代码缺陷与代​​码复杂性指标(如紧密度)相关联。一种常见的模型是将其视为泊松过程,其中持续时间是编码花费的时间,而密度是编码复杂度的函数。我能够进行回归并获得显着性值等。 但是,对我而言,很难直观地看到结果(对于数学上不太喜欢的同事而言,则更加困难)。如果是线性趋势等,是否有一种很好的方法来查看异常值?(感谢您链接到R包。) 例如,我可以绘图,Defects / Time ~ Complexity但是这很嘈杂,并且由于Defects离散且很小,所以很难查看趋势。我想到的一件事是,我可以将数据切成分位数,然后对每个分位数进行回归并绘制结果密度-我不确定这是否有效,尤其是因为我的数据不是正态分布的,因此在分位数上误导人们。

2
QQ剧情解读
考虑以下代码和输出: par(mfrow=c(3,2)) # generate random data from weibull distribution x = rweibull(20, 8, 2) # Quantile-Quantile Plot for different distributions qqPlot(x, "log-normal") qqPlot(x, "normal") qqPlot(x, "exponential", DB = TRUE) qqPlot(x, "cauchy") qqPlot(x, "weibull") qqPlot(x, "logistic") 看来,对数正态的QQ图与weibull的QQ图几乎相同。我们如何区分它们?此外,如果这些点在两条外部黑色线所定义的区域内,是否表示它们遵循指定的分布?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.