统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
当关联最密切的预测变量是二进制时,如何开始建立回归模型
我有数据集包含365观察三个变量即pm,temp和rain。现在,我想检查是否pm响应其他两个变量的变化。我的变量是: pm10 =响应(取决于) temp =预测变量(独立) rain =预测变量(独立) 以下是我的数据的相关矩阵: > cor(air.pollution) pm temp rainy pm 1.00000000 -0.03745229 -0.15264258 temp -0.03745229 1.00000000 0.04406743 rainy -0.15264258 0.04406743 1.00000000 问题是,当我研究回归模型的构建时,有人写道,可加方法应从与响应变量最相关的变量开始。在我的数据集中,rain它与pm(与相比temp)高度相关,但是同时它也是一个虚拟变量(rain = 1,norain = 0),所以现在我有了从哪里开始的线索。我为问题附加了两个图像:第一个是数据的散点图,第二个图像是pm10vs. 的散点图rain,我也无法解释pm10vs.的散点图rain。有人可以帮我怎么开始吗?

3
贝叶斯参数估计还是贝叶斯假设检验?
对于我们应该进行贝叶斯参数估计还是贝叶斯假设检验,贝叶斯社区内部似乎正在进行辩论。我有兴趣征求对此的意见。这些方法的相对优点和缺点是什么?在哪一种情况下比另一种情况更合适?我们应该同时进行参数估计和假设检验吗?

3
正态分布的偏度和峰度值的范围
我想知道数据被认为是正态分布的偏度和峰度的取值范围是多少。 我读了很多论据,而且大多数情况下我的回答很混乱。有人说偏度和峰度是正态分布的可接受范围。有人说的偏斜度是可以接受的范围。我在这里找到了详细的讨论:关于此问题的正常数据分布,偏度和峰度的可接受范围是多少?但是我找不到任何决定性的陈述。(- 2 ,2 )(- 1.96 ,1.96 )(−1,1)(−1,1)(-1,1)(−2,2)(−2,2)(-2,2)(−1.96,1.96)(−1.96,1.96)(-1.96,1.96) 决定此间隔的依据是什么?这是一个主观选择吗?或在这些间隔后面有什么数学解释?


2
了解Gelman&Carlin“超越功率计算:…”(2014)
我正在阅读Gelman&Carlin “超越功率计算:评估S型(符号)和M型(幅值)错误”(2014年)。我试图理解主要思想,主要思路,但我感到困惑。有人可以帮我提炼精华吗? 这篇论文是这样的(如果我理解正确的话)。 心理学方面的统计研究经常受到小样本困扰。 在给定的研究中,以统计学上显着的结果为条件, (1)可能会严重高估真实的效应量; (2)除非有足够大的样本量,否则效应的迹象很有可能相反。 以上是使用对种群效应大小的先验猜测显示的,通常认为效应很小。 我的第一个问题是,为什么要以统计显著性为条件?是否反映了出版偏见?但这似乎并非如此。那为什么呢? 我的第二个问题是,如果我自己进行研究,是否应该对结果进行不同于以往的处理(我做常客统计,对贝叶斯不太熟悉)?例如,我将获取一个数据样本,估算一个模型,并记录一个点估算值,以获取感兴趣的效果以及围绕它的置信度。我现在应该怀疑我的结果吗?如果统计意义重大,还是应该不信任它?给定的任何先前更改如何? (1)统计研究的“生产者”和(2)应用统计论文的读者的主要收获是什么? 参考文献: 盖尔曼,安德鲁和约翰·卡林。“超出功率计算:评估类型S(符号)和类型M(幅度)错误。” 心理科学观点 9.6(2014):641-651。 PS:我认为对我来说,新的要点是包括先验信息,我不确定该如何对待(来自常客主义范式)。

1
计算模式的置信区间?
我正在寻找有关计算模式的置信区间的参考(一般而言)。Bootstrap似乎是自然的首选,但正如Romano(1988)所讨论的那样,标准的bootstrap对于mode来说是失败的,并且它没有提供任何简单的解决方案。自本文以来,有什么变化吗?计算模式置信区间的最佳方法是什么?最好的基于引导的方法是什么?您可以提供任何相关参考吗? Romano,JP(1988)。引导模式。统计数学研究所的年鉴,40(3),565-586。


3
拟合曲线的可靠性?
我想估计拟合曲线的不确定性或可靠性。由于我不知道它的确切含义,因此我故意不指定要查找的精确数学量。 这里,ËËE(能量)是因变量(响应),VVV(体积)是自变量。我想找到某种材料的能量-体积曲线Ë(五)Ë(V)E(V)。因此,我使用量子化学计算机程序进行了一些计算,以获取某些样品体积(图中的绿色圆圈)的能量。 然后,我用Birch–Murnaghan函数拟合这些数据样本: 这取决于四个参数: ë 0,V 0,乙0,乙' 0。我还假定这是正确的拟合函数,因此所有误差仅来自样本的噪声。在下文中,拟合函数(ē)将被写成函数 V。E(E|V)=E0+9V0B016⎧⎩⎨[(V0V)23−1]3B′0+[(V0V)23−1]2[6−4(V0V)23]⎫⎭⎬,E(E|V)=E0+9V0B016{[(V0V)23−1]3B0′+[(V0V)23−1]2[6−4(V0V)23]}, \mathbb{E}(E|V) = E_0 + \frac{9V_0B_0}{16} \left\{ \left[\left(\frac{V_0}{V}\right)^\frac{2}{3}-1\right]^3B_0^\prime + \left[\left(\frac{V_0}{V}\right)^\frac{2}{3}-1\right]^2 \left[6-4\left(\frac{V_0}{V}\right)^\frac{2}{3}\right]\right\}\;, Ë0,V0,B0,B′0E0,V0,B0,B0′E_0, V_0, B_0, B_0'(E^)(E^)(\hat{E})VVV 在这里,您可以看到结果(使用最小二乘算法进行拟合)。y轴变量是和x轴变量是V。蓝线是拟合点,绿色圆圈是采样点。ËEEVVV 我现在需要(在体积的依赖性充其量)这个拟合曲线的可靠性一定程度È(V ),因为我需要它来计算像过渡压力或焓进一步的数量。Ë^(五)E^(V)\hat{E}(V) 我的直觉告诉我,拟合曲线在中间是最可靠的,所以我猜想不确定性(例如不确定性范围)应该在样本数据的末尾增加,就像这个草图所示: 但是,我正在寻找什么样的量度,如何计算呢? 准确地说,这里实际上只有一个错误源:由于计算限制,计算出的样本有噪声。因此,如果我要计算一组密集的数据样本,它们将形成颠簸的曲线。 我想要找到所需不确定度估计值的想法是,在学校学习时根据参数计算以下“误差”(不确定性的传播): 的Δë0,ΔV0,Δ乙0和Δ乙'0,由拟合软件给出。Δ è(五)= (∂Ë(五)∂Ë0Δ è0)2+ (∂Ë(五)∂V0Δ V0)2+ (∂Ë(五)∂乙0Δ 乙0)2+ (∂Ë(五)∂乙′0Δ 乙′0)2----------------------------------------------------------√ΔË(V)=(∂Ë(V)∂Ë0ΔË0)2+(∂Ë(V)∂V0ΔV0)2+(∂Ë(V)∂乙0Δ乙0)2+(∂Ë(V)∂乙0′Δ乙0′)2 \Delta E(V) = \sqrt{ \left(\frac{\partial E(V)}{\partial E_0} \Delta E_0\right)^2 + …

4
创建保留集的更合适方法是:删除某些主题或从每个主题中删除一些观测值?
我有一个包含26个要素和31000行的数据集。它是38个主题的数据集。它用于生物识别系统。因此,我希望能够确定主题。 为了进行测试,我知道必须删除一些值。 那么,什么更好呢?为什么呢? (a)保留30个科目作为训练集,并删除8个科目作为测试集 (b)保留38个主题,但删除每个主题的一些行。因此,最后我将得到一个训练集:24800行38个主题,以及一个测试集:6200行38个主题

1
为什么选择K会降低我的交叉验证分数?
在使用scikit-learn中的Boston Housing数据集和RandomForestRegressor(带有默认参数)时,我注意到了一些奇怪的事情:随着将折叠数增加到10以上,交叉验证平均得分降低了。我的交叉验证策略如下: cv_met = ShuffleSplit(n_splits=k, test_size=1/k) scores = cross_val_score(est, X, y, cv=cv_met) ... num_cvs变化多端。我设置test_size为1/num_cvs镜像k倍CV的训练/测试拆分大小行为。基本上,我想要类似k-fold CV的东西,但是我也需要随机性(因此ShuffleSplit)。 将该试验重复几次,然后绘制平均得分和标准差。 (请注意,的大小k由圆的面积表示;标准偏差在Y轴上。) 一致地,增加k(从2到44)会导致得分短暂增加,然后k随着进一步增加(超过10倍)而稳步下降!如果有的话,我希望更多的培训数据会导致分数略有提高! 更新资料 更改评分标准以表示绝对错误会导致我预期的行为:评分会随着K折CV中的折叠数增加而提高,而不是接近0(默认值为' r2 ')。问题仍然是,为什么默认得分指标导致均值和STD指标的性能下降,而折叠次数却越来越多。

1
Mclust模型选择
R软件包mclust使用BIC作为选择集群模型的标准。据我了解,应该选择BIC最低的模型而不是其他模型(如果您仅关心BIC)。但是,当BIC值均为负时,该Mclust功能默认为具有最高BIC值的模型。我的来自各种试验总体理解是mclust识别“最好”的模型作为那些具有。max{BICi}max{BICi}max\{BIC_i\} 我试图理解作者为什么做出这个决定。它在CRAN站点中进行了说明:https ://cran.r-project.org/web/packages/mclust/vignettes/mclust.html 另外,mclust软件包的作者在第5页的基于模型的分类方法:使用化学计量学中的mclust软件中对此进行了记录。 “最佳”模型被认为是拟合模型中BIC最高的模型。 谁能在这个问题上大放异彩?如果较低的BIC总是更好,那么为什么作者不选择具有最低BIC的模型,而是选择具有最小绝对BIC的模型?如果可能,请提供参考。

3
使用Ahrens和Dieter(1972)的方法而不是通过逆变换的指数随机发生器的优点是什么?
我的问题是受R的内置指数随机数生成器函数启发的rexp()。当尝试生成指数分布的随机数时,许多教科书建议使用此Wikipedia页面中概述的逆变换方法。我知道还有其他方法可以完成此任务。特别是,R的源代码使用Ahrens&Dieter(1972)在论文中概述的算法。 我已经说服自己,Ahrens-Dieter(AD)方法是正确的。不过,与逆变换(IT)方法相比,我看不出使用它们的方法的好处。AD不仅比IT实施更复杂。似乎也没有速度上的好处。这是我的R代码,用于对两种方法及其结果进行基准测试。 invTrans <- function(n) -log(runif(n)) print("For the inverse transform:") print(system.time(invTrans(1e8))) print("For the Ahrens-Dieter algorithm:") print(system.time(rexp(1e8))) 结果: [1] "For the inverse transform:" user system elapsed 4.227 0.266 4.597 [1] "For the Ahrens-Dieter algorithm:" user system elapsed 4.919 0.265 5.213 比较这两种方法的代码,AD至少绘制两个统一的随机数(使用C函数unif_rand())以获得一个指数随机数。IT只需要一个统一的随机数。大概是R核心团队决定不实施IT,因为它假设采用对数可能比生成更统一的随机数慢。我了解对数的获取速度可能与机器有关,但至少对我而言是相反的。也许IT的数值精度与对数为0的奇异性有关吗?但是然后,R 源代码sexp.c揭示了AD的实现也失去了一些数值精度,因为C代码的以下部分从统一随机数u中删除了前导位。 double u = unif_rand(); while(u <= 0. || u …

4
独立对数正态随机变量的总和是否显示对数正态?
我试图理解为什么当您增加观察次数时,两个(或多个)对数正态随机变量的总和接近对数正态分布。我在网上看过,但没有发现任何结果。 显然,如果和是独立的对数正态变量,则根据指数和高斯随机变量的性质,也是对数正态的。但是,没有理由表明也是对数正态的。XXXX × Y X + YÿÿYX× YX×ÿX \times YX+ YX+ÿX+Y 然而 如果生成两个独立的对数正态随机变量和,并令,并重复多次此过程,则的分布将显示为对数正态。随着观察次数的增加,它甚至看起来更接近对数正态分布。Y Z = X + Y ZXXXÿÿYž= X+ Yž=X+ÿZ=X+YžžZ 例如:生成一百万对后,Z的自然对数的分布在下面的直方图中给出。这显然很像正态分布,表明确实是对数正态。žžZ 有没有人对本文有任何见解或参考,可能有助于理解?



By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.