统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


1
违反正常程度的一个好的指标是什么?该指标上可以附加哪些描述性标签?
内容: 在上一个问题中,@ Robbie在约600个案例中的一项研究中询问为什么正态性检验表明存在显着的非正态性,而这些图却表明正态分布。一些人指出,正态性的显着性检验不是很有用。对于较小的样本,此类测试没有足够的能力来检测轻微的正常违反情况,而对于较大的样本,它们将检测到足够小的无关紧要的正常违反情况。 在我看来,这个问题类似于关于显着性检验和效应大小的辩论。如果仅关注显着性测试,则在有大量样本时,您可以检测到与实际目的无关的微小影响,而对于小型样本,您将没有足够的能力。 在某些情况下,我什至看到教科书建议人们可以拥有一个“太大”的样本,因为微小的影响在统计上很重要。 在意义测试和效果大小的上下文中,一个简单的解决方案是专注于估计感兴趣的效果的大小,而不是迷恋是否存在效果的二元决策规则。对效应大小的置信区间就是这样一种方法,或者您可以采用某种形式的贝叶斯方法。此外,各种研究领域都建立了关于给定效果大小在实际意义上意味着好坏的想法,应用启发式标签,例如“小”,“中”和“大效果”。这也导致了明智的建议,即最大化样本大小,以便在估计给定感兴趣参数时最大化准确性。 这使我想知道,为什么在假设检验,尤其是正态检验方面,没有更广泛地采用基于效果大小的置信区间的类似方法。 题: 数据违反常态程度的最佳单一指标是什么? 还是谈论多个违反正常性的指标(例如,偏度,峰度,离群率)是更好的选择吗? 如何计算指数的置信区间(或使用贝叶斯方法)? 您可以为该索引上的点分配什么样的口头标签,以表明违反正常性的程度(例如,轻度,中度,强烈,极端等)?这样的标签的目的可能是帮助经验不足的分析人员在违反正常性问题时训练他们的直觉。

1
如果样本呈正态分布,但差异不大,可以使用配对t检验吗?
我有一个实验的数据,其中我在相同的初始条件下应用了两种不同的处理方法,在每种情况下,结果都是0到500之间的整数。我想使用配对t检验来确定两种疗法产生的效果是否显着不同。对于每个处理组的结果是正态分布,但差异在每对之间不正态分布(非对称+一个长尾巴)。 在这种情况下,可以使用配对t检验,还是违反正态性假设,这意味着我应该使用某种非参数检验?

2
如何在JAGS中设置零膨胀泊松?
我正在尝试在R和JAGS中建立零膨胀泊松模型。我是JAGS的新手,我需要一些有关该操作的指南。 我一直在尝试以下方法,其中y [i]是观察到的变量 model { for (i in 1:I) { y.null[i] <- 0 y.pois[i] ~ dpois(mu[i]) pro[i] <- ilogit(theta[i]) x[i] ~ dbern(pro[i]) y[i] <- step(2*x[i]-1)*y.pois[i] + (1-step(2*x[i]-1))*y.null[i] log(mu[i]) <- bla + bla +bla + .... theta[i] <- bla + bla + bla + .... } } 但是,这不起作用,因为您不能在观察到的变量上使用<-。 任何想法如何更改/解决此问题?还有其他方法可以在JAGS中建立零膨胀泊松模型吗?

5
标准化自变量是否会降低共线性?
我在Bayes / MCMC上看到了一篇很好的文章。IT建议您对自变量进行标准化将使MCMC(Metropolis)算法更有效,但也可能会降低(多重)共线性。可以吗?这是我应该做的标准工作吗(抱歉)。 Kruschke,2011年,《进行贝叶斯数据分析》。(美联社) 编辑:例如 > data(longley) > cor.test(longley$Unemployed, longley$Armed.Forces) Pearson's product-moment correlation data: longley$Unemployed and longley$Armed.Forces t = -0.6745, df = 14, p-value = 0.5109 alternative hypothesis: true correlation is not equal to 0 95 percent confidence interval: -0.6187113 0.3489766 sample estimates: cor -0.1774206 > standardise <- function(x) {(x-mean(x))/sd(x)} …

5
为什么所有关于正态性的检验都会拒绝原假设?
Kolgomorov-Smirnov检验,Shapiro检验等都拒绝分布是正态的假设。但是,当我绘制正常的分位数和直方图时,数据显然是正常的。也许是因为测试的功效很高? 样本量大约为650。那么,这些检验中的至少一项是否应该不能拒绝原假设? 结果: Kolmogorov-Smirnov D 0.05031 Pr > D <0.010 Cramer-von Mises W-Sq 0.30003 Pr > W-Sq <0.005 Anderson-Darling A-Sq 1.66965 Pr > A-Sq <0.005 Chi-Square Chi-Sq 3250.43596 18 Pr > Chi-Sq <0.001

1
R中混合数据的鲁棒聚类方法
我正在寻找一个小的数据集(对4个区间变量和一个三因素分类变量的64个观察值)进行聚类。现在,我对聚类分析还很陌生,但是我知道自从层次聚类或k均值成为唯一可用选项以来,已有了相当大的进步。特别是,似乎有可用的基于模型的聚类的新方法,如chl所指出的那样,可以使用“拟合优度指数来确定聚类或类的数量”。 但是,用于基于模型的群集的标准R包mclust显然不适合具有混合数据类型的模型。fpc由于连续变量的非高斯性质,我怀疑该模型会但很难拟合模型。我应该继续使用基于模型的方法吗?如果可能的话,我想继续使用R。如我所见,我有几种选择: 将三级分类变量转换为两个虚拟变量,然后使用mclust。我不确定这是否会使结果产生偏差,但是如果不是这样,则是我的首选。 以某种方式转换连续变量并使用该fpc包。 使用一些我还没有遇到过的R包。 使用Gower的度量创建一个相异矩阵,并使用传统的分层或重定位群集技术。 stats.se hivemind在这里有什么建议吗?

5
如何在numpy中有效地计算高斯核[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 3年前关闭。 我有一个具有m列和n行的numpy数组,这些列是维和行数据点。 现在,我需要为每个数据点组合计算内核值。 对于线性核我可以简单地做K(xi,xj)=⟨xi,xj⟩K(xi,xj)=⟨xi,xj⟩K(\mathbf{x}_i,\mathbf{x}_j) = \langle \mathbf{x}_i,\mathbf{x}_j \rangledot(X,X.T) 如何有效地计算高斯核K(xi,xj)=exp−∥xi−xj∥22s2K(xi,xj)=exp⁡−‖xi−xj‖22s2K(\mathbf{x}_i,\mathbf{x}_j) = \exp{-\frac{\|\mathbf{x}_i-\mathbf{x}_j\|_2^2}{s^2}}与给定s?

3
估计空间过程的参数
我得到了个正整数值的网格。这些数字表示的强度应与占据该网格位置的人的信念强度相对应(较高的值表示较高的信念)。一个人通常会影响多个网格单元。n×nn×nn\times n 我认为强度的模式应“看起来像高斯”,因为它将有一个高强度的中心位置,然后强度在所有方向上呈放射状逐渐减小。具体来说,我想将值建模为来自“比例高斯”,其中一个参数用于方差,另一个用于比例因子。 有两个复杂的因素: 由于背景噪声和其他影响,没有人不会对应零值,但该值应较小。但是它们可能是不稳定的,并且一开始可能很难将其建模为简单的高斯噪声。 强度范围可以变化。在一个实例中,值的范围可能在1到10之间,而在另一个实例中,值可能在1到100之间。 我正在寻找合适的参数估计策略或相关文献的指南。指出为什么我以错误的方式完全解决这个问题的指针也将不胜感激:)。我一直在阅读有关克里金法和高斯过程的信息,但这对于我的问题而言似乎是很繁琐的工作。

5
如何制作好的色彩强度标尺?
我的统计数据绝对不是很好,但我认为我来对地方了。我的问题很简单: 我的问题是比较一个小国家中几个州的人口,但是有些州的人口是30万,有些州的人口是2000。 我正在将其绘制在地图上,颜色的“强度”取决于每个州的人口与整个国家的人口比较。 问题在于,人口众多的州用非常强烈的颜色显示,而小州几乎没有任何颜色。 有没有一种简单的方法可以“标准化”或使数据具有可比性? 我不知道自己是否在正确地解释自己,但我希望有人能帮助我。如果我的问题不清楚,请发表评论,我会澄清。 谢谢您的帮助!


4
如何对非常高维度的数据执行PCA?
要执行主成分分析(PCA),您必须从数据中减去每一列的均值,计算相关系数矩阵,然后找到特征向量和特征值。嗯,这是我在Python中实现的方法,只是它仅适用于小型矩阵,因为找到相关系数矩阵(corrcoef)的方法不允许我使用高维数组。由于我必须将其用于图像,因此我当前的实现并没有真正帮助我。 我已经读过,可以只使用数据矩阵并计算而不是,但这对我不起作用。好吧,除了它应该是矩阵而不是(在我的情况下为)之外,我不确定我是否理解它的含义。我在特征脸教程中读到了有关这些内容的文章,但似乎都没有一个能以我能真正理解的方式进行解释。d d ⊤ / Ñ d ⊤ d / Ñ Ñ × Ñ p × p p » ÑDDDD D⊤/ nDD⊤/nDD^\top/nd⊤D / nD⊤D/nD^\top D/nn × nn×nn \times np × pp×pp\times pp » Ñp≫np\gg n 简而言之,该方法是否有简单的算法描述,以便我可以遵循?
12 pca  python 

1
SVM网格搜索是否应显示周围的准确性较低的高精度区域?
我有12个积极的训练集(用药物治疗的癌细胞具有12种不同的作用机制中的每一种)。对于这些正面训练集,我想训练一个支持向量机,以将其与从实验中采样的大小相等的负面集合区分开来。每组具有1000到6000个像元,每个像元有476个特征(图像特征),每个特征线性缩放为[0,1]。 我使用LIBSVM和高斯RGB内核。使用五重交叉验证,我对log 2 C∈[-5,15]和log 2ɣ∈[-15,3]进行了网格搜索。结果如下: 令我感到失望的是,没有一个参数集可以为所有12个分类问题提供高精度。我也感到惊讶的是,网格通常不会显示出由较低精度包围的高精度区域。这是否仅表示我需要扩展搜索参数空间,还是网格搜索是否表明存在其他问题?
12 svm 

4
如何从大清单中抽取许多10个样本,而不整体替换
我有大量数据(20,000个数据点),我想从中重复取样10个数据点。但是,一旦选择了这10个数据点,就不要再次选择它们。 我已经尝试过使用该sample函数,但是它似乎没有一个选项,可以在不替换该函数的多个调用的情况下进行采样。有没有简单的方法可以做到这一点?
12 r  sample 

3
为什么要使用滞后DV作为工具变量?
我继承了一些数据分析代码,尽管我不是计量经济学家,但我一直难以理解。一个模型使用以下Stata命令运行工具变量回归 ivreg my_dv var1 var2 var3 (L.my_dv = D2.my_dv D3.my_dv D4.my_dv) 该数据集是一个针对该组变量具有多个顺序观察值的面板。 为什么此代码将DV的滞后值用作工具?据我了解(从深入研究旧教科书中),当由于回归变量与误差项相关而出现问题时,使用了IV估计。但是,没有提到选择DV的滞后作为工具。 此行代码的注释中提到“因果关系”。欢迎大家弄清楚这里的目标是什么。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.