统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
非嵌套模型的AIC:归一化常数
AIC定义为,其中是最大似然估计量,是参数空间的维数。对于的估计,通常会忽略密度的常数因子。这就是不依赖参数的因素,以简化可能性。另一方面,该因素对于AIC的计算非常重要,因为在比较非嵌套模型时,该因素并不常见,如果不考虑,则相应AIC的顺序可能会有所不同。θ p θAIC=−2log(L(θ^))+2pAIC=−2log⁡(L(θ^))+2pAIC=-2 \log(L(\hat\theta))+2pθ^θ^\hat\thetapppθθ\theta 我的问题是,比较非嵌套模型时,是否需要计算包括所有密度项的?log(L(θ^))log⁡(L(θ^))\log(L(\hat\theta))

2
随机森林:如果我知道变量很重要怎么办
我的理解是随机森林随机选择mtry变量来构建每个决策树。因此,如果mtry = ncol / 3,则每个变量平均将在1/3的树中使用。而2/3的树木将不会使用它们。 但是,如果我知道单个变量可能非常重要,那么手动增加在每棵树中选择此变量的可能性会很好吗?R中的randomForest包可行吗?

6
健壮的(非参数)度量,例如变异系数— IQR /中位数,还是替代方法?
对于给定的一组数据,通常将扩散作为标准偏差或IQR(四分位数间距)进行计算。 尽管a standard deviation是归一化的(z得分等),因此可以用来比较两个不同总体的传播,但IQR情况并非如此,因为来自两个不同总体的样本可能具有两个完全不同的尺度值, e.g. Pop A: 100, 67, 89, 75, 120, ... Pop B: 19, 22, 43, 8, 12, ... 我需要的是一种可靠的(非参数)度量,可以用来比较不同总体中的差异。 选择1: IQR / Median-类似于变异系数,即。σμσμ \frac{\sigma}{\mu} 选择2: Range / IQR 问题:比较人群之间的差异,哪种方法更有意义?如果选择1是选择2是否对任何事情都有意义/有意义,还是从根本上存在缺陷的措施?

2
有限的高斯混合与高斯之间的距离是多少?
假设我混合了有限数量的具有已知权重,均值和标准差的高斯。手段不平等。当然,由于力矩是组分力矩的加权平均值,因此可以计算出混合物的平均值和标准偏差。混合不是正态分布,但是离正态有多远? 上图显示了高斯混合物的概率密度,其中高斯混合物的均值由标准差(各组分的标准差)隔开,而一个高斯混合物的均值和方差相同。222 111 动机:我不同意一些懒惰的人关于他们尚未测量的一些实际分布,他们认为这些分布接近正常值,因为那样很好。我也很懒 我也不想测量分布。我想能够说出他们的假设是不一致的,因为他们说的是,高斯与不同均值的有限混合是不正确的高斯。我不仅要说尾巴的渐近形状是错误的,因为这些只是近似值,仅应在均值的几个标准偏差内合理地准确。我想说的是,如果这些分量被正态分布很好地近似,那么混合就不是,并且我想能够对此进行量化。 L1L1L^12221/41/41/4

3
是否有多样本版本或Kolmogorov-Smirnov检验的替代品?
我正在比较六对样地中树木的大小分布,其中一个样地接受了处理,另一个样地接受了控制。在每对图上使用Kolmogorov-Smirnov检验,我发现范围为至。是否有适当的方法来处理所有重复样本,例如KS测试的多样本扩展,还是有适当的跟进测试?还是我应该得出这样的结论:“ 在两对图中,大小分布差异显着),而在一对图中则略有差异()”。0.0003707 0.75 (p &lt; 0.05 p = 0.59ppp0.00037070.00037070.00037070.750.750.75(p&lt;0.05(p&lt;0.05(p < 0.05p=0.59p=0.59p = 0.59

1
R中重复测量的线性回归
我无法弄清楚如何在R in中执行线性回归以进行重复测量设计。在上一个问题(仍未回答)中,建议我不要使用lm而是使用混合模型。我lm以以下方式使用: lm.velocity_vs_Velocity_response &lt;- lm(Velocity_response~Velocity*Subject, data=mydata) (有关数据集的更多详细信息,请参见上面的链接) 但是,我无法在Internet上找到任何带有R代码的示例,该示例显示了如何执行线性回归分析。 我想要的是,一方面是数据的图,一条线与数据相吻合,另一方面,值与p值一起用于模型的显着性检验。[R2R2R^2 有没有人可以提供一些建议?任何R代码示例都可能有很大帮助。 编辑 根据我到目前为止收到的建议,分析我的数据以了解两个变量Velocity_response(源自调查表)和Velocity(源自绩效)之间是否存在线性关系的解决方案应为: library(nlme) summary(lme(Velocity_response ~ Velocity*Subject, data=scrd, random= ~1|Subject)) 摘要的结果如下: &gt; summary(lme(Velocity_response ~ Velocity*Subject, data=scrd, random= ~1|Subject)) Linear mixed-effects model fit by REML Data: scrd AIC BIC logLik 104.2542 126.1603 -30.1271 Random effects: Formula: ~1 | Subject (Intercept) Residual StdDev: …


2
如何估算合并数据的第三四分位数?
是否有任何技术上的技巧来确定第三个四分位数是否属于一个开放区间,而该区间包含的人口超过四分之一(因此我无法关闭区间并使用标准公式)? 编辑 如果我误解了一些东西,我会或多或少提供完整的背景信息。我将数据安排在一个表中,该表有两列,例如6行。每列对应一个间隔(在第一列中)和“属于”该间隔的数量的人口。最后一个间隔是开放的,包括超过25%的人口。所有间隔(最后一个间隔除外)具有相同的范围。 样本数据(用于演示): Column 1: (6;8),(8;10),(10;12),(12;14),(14;16),(16;∞) Column 2: 51, 65, 68, 82, 78, 182 第一列将被解释为收入水平范围。第二个将被解释为收入属于区间的雇员数。 我正在考虑的标准公式为。Q3=xQ3+3N4−∑k−1i=1ninQ3rQ3Q3=xQ3+3N4−∑i=1k−1ninQ3rQ3\mathbb{Q}_{3}=x_{Q_{3}}+ \frac{\frac{3N}{4}- \sum_{i=1}^{k-1}n_{i}}{n_{Q_{3}}}r_{Q_{3}}

3
时间序列上的STL具有缺失值以进行异常检测
我正在尝试在气候数据的时间序列中检测到一些异常值,但缺少一些观测值。在网上搜索,我发现了许多可用的方法。从消除趋势和季节性成分并研究其余部分的意义上讲,其中的stl分解似乎很有吸引力。阅读STL:一种基于黄土的季节性趋势分解程序,stl在确定分配可变性的设置方面似乎很灵活,不受异常值的影响,即使缺少值也可以应用。但是,尝试使用R,经过四年的观察并根据http://stat.ethz.ch/R-manual/R-patched/library/stats/html/stl.html定义所有参数,我遇到了错误: "time series contains internal NAs"(当时na.action=na.omit)和 "series is not periodic or has less than two periods"(当时na.action=na.exclude)。 我仔细检查了频率是否正确定义。我在博客中看到了相关问题,但是没有找到任何可以解决此问题的建议。不可能stl在缺少值的系列中应用?我非常不愿意对它们进行插值,因为我不想引入(并因此检测...)工件。出于同样的原因,我不知道改为使用ARIMA方法是多么明智(如果缺少值仍然是个问题)。 如果您知道一种适用stl于缺失值的系列的方法,或者您认为我的选择在方法上不合理,或者您有更好的建议,请分享。我是该领域的新手,但堆满了(似乎...)相关信息。


1
为什么基于稀疏数据的协方差矩阵的本征和SVD分解会产生不同的结果?
我正在尝试基于稀疏/不连续的数据集分解协方差矩阵。我注意到,svd随着越来越差的数据,λ的总和(解释方差)用来计算。没有差距,svd并eigen获得相同的结果。 eigen分解似乎不会发生这种情况。我一直倾向于使用,svd因为lambda值始终为正,但是这种趋势令人担忧。是否需要某种校正,或者应该svd完全避免此类问题。 ###Make complete and gappy data set set.seed(1) x &lt;- 1:100 y &lt;- 1:100 grd &lt;- expand.grid(x=x, y=y) #complete data z &lt;- matrix(runif(dim(grd)[1]), length(x), length(y)) image(x,y,z, col=rainbow(100)) #gappy data zg &lt;- replace(z, sample(seq(z), length(z)*0.5), NaN) image(x,y,zg, col=rainbow(100)) ###Covariance matrix decomposition #complete data C &lt;- cov(z, use="pair") E &lt;- eigen(C) …
12 r  svd  eigenvalues 

4
使用AIC(或BIC)选择PCA模型
我想使用Akaike信息准则(AIC)选择要在PCA中提取的适当数量的因子。唯一的问题是我不确定如何确定参数数量。 考虑一个矩阵,其中代表变量数,代表观察数,这样。由于协方差矩阵是对称的,因此的最大似然估计可以将AIC中的参数数量设置为。X Ñ Ť X 〜Ñ (0 ,Σ ) Σ Ñ (Ñ + 1 )Ť× NT×NT\times NXXXñNNŤTTX〜ñ(0 ,Σ )X∼N(0,Σ)X\sim \mathcal N\left(0,\Sigma\right)ΣΣ\Sigmañ(N+ 1 )2N(N+1)2\frac{N\left(N+1\right)}{2} 可选地,在PCA,可以提取第一特征向量和特征值,叫他们和,然后计算 ,其中是平均残差。据我统计,如果你有因素,那么你会在参数,在参数,和参数。Σ β ˚F Λ ˚F Σ = β ˚F Λ ˚F β ' ˚F + 我σ 2 - [R σ 2 - [R ˚F ˚F Λ …

2
randomForest选择回归而不是分类
我在R中使用randomForest包并使用虹膜数据,生成的随机森林是一个分类,但是当我使用具有约700个要素(要素为28x28像素图像中的每个像素)的数据集时,标签列被命名为label,randomForest生成的是回归。我正在使用以下行: rf &lt;- randomForest(label ~ ., data=train) 为什么使用回归而不是分类?数据通过读取read.csv()。
12 r  random-forest 

1
分层贝叶斯模型与经验贝叶斯
您是否认为HBM与EB是超参数在采样/估计/等“游戏中”的两个选择?这两者之间显然存在联系。 您会认为HBM比EB更“完全贝叶斯”吗?在哪里可以看到“完全贝叶斯”和其他替代方案之间的区别? 谢谢。


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.