统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
可靠的均值t检验
我正在尝试针对随机变量(针对该变量的轻度到中度偏斜和峰度),针对局部替代测试零。遵循Wilcox在“稳健估计和假设检验简介”中的建议之后,我基于修整后的均值,中位数以及位置的M估计值(Wilcox的“一步”过程)对测试进行了研究。在使用非偏斜但具有正态分布的分布进行测试时,就功率而言,这些强大的测试确实优于标准t检验。E[X]=0E[X]=0E[X] = 0E[X]>0E[X]>0E[X] > 0XXX 但是,当使用偏斜的分布进行检验时,根据原假设,这些单面检验要么过于宽松,要么过于保守,这分别取决于该分布是左偏斜还是右偏斜。例如,对于1000个观察值,基于中位数的测试实际上将拒绝〜40%的时间,即名义5%的水平。原因很明显:对于偏斜的分布,中位数和均值是完全不同的。但是,在我的应用程序中,我确实需要测试均值,而不是中位数,而不是修整后的均值。 是否有t检验的更强大版本可以实际测试均值,但不能偏斜和峰度? 理想情况下,该程序在无偏斜,高峰度的情况下也能很好地工作。“单步”测试几乎足够好,“弯曲”参数设置得较高,但是在没有偏斜的情况下,它不如经过修剪的均值测试强大,并且在保持偏斜下的废品标称水平方面有些麻烦。 背景:我真正关心平均值而不是平均值的原因是,该测试将用于金融应用程序。例如,如果您想测试某个投资组合是否具有正的预期对数回报,则该平均值实际上是适当的,因为如果您投资该投资组合,您将体验到所有的回报(这是平均值乘以样本数),而不是中位数的重复项。也就是说,我真的很在乎RV的和。nnnnnnXXX

3
利克特项目构成的问卷的因子分析
我曾经从心理学的角度分析项目。但是现在我正在尝试分析关于动机和其他主题的其他类型的问题。这些问题都是在李克特量表上。我最初的想法是使用因子分析,因为假设这些问题可以反映一些潜在的方面。 但是因子分析是否合适? 是否有必要验证每个问题的维度? 对李克特项目进行因子分析是否存在问题? 是否有关于如何对李克特和其他分类项目进行因子分析的好的论文和方法?

12
介绍统计数据分析的最佳书籍?
已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 我买了这本书: 如何衡量一切:在企业中发现无形资产的价值 和 头先数据分析:大数,统计和好的决策学习者指南 您还会推荐哪些其他书籍?

5
具有大数据的泊松回归:更改度量单位是否错误?
由于泊松分布中的阶乘,当观测值较大时,估计泊松模型(例如,使用最大似然)变得不切实际。因此,例如,如果我试图估计一个模型来解释给定年份的自杀数量(仅提供年度数据),并且说每年有数千个自杀,那么表达数百种自杀是否错误? ,则2998将为29.98〜= 30?换句话说,更改度量单位以使数据易于管理是否错误?


2
是否可以自动化时间序列预测?
我想构建一种算法,该算法能够分析任何时间序列,并“自动”为分析的时间序列数据选择最佳的传统/静态预测方法(及其参数)。 可以做这样的事情吗?如果是,您能给我一些如何解决的技巧吗?

2
如果自回归时间序列模型是非线性的,它是否仍然需要平稳性?
关于使用递归神经网络进行时间序列预测的思考。与使用线性自回归的ARMA和ARIMA模型相比,它们基本上实现了一种广义的非线性自回归。 如果我们正在执行非线性自回归,那么时间序列是否仍需保持平稳,是否需要以与ARIMA模型相同的方式进行微分? 还是模型的非线性特征使其具有处理非平稳时间序列的能力? 换句话说,ARMA和ARIMA模型的平稳性要求(均值和方差)是由于这些模型是线性的,还是因为其他原因?

2
有人可以用英语向我解释NUTS吗?
我对算法的理解如下: 没有掉头采样器(NUTS)是哈密顿蒙特卡罗方法。这意味着它不是马尔可夫链方法,因此该算法避免了通常被认为效率低且收敛缓慢的随机游走部分。 NUTS不会执行随机游走,而是执行长度为x的跳跃。随着算法继续运行,每次跳转都会加倍。这会一直发生,直到轨迹到达要返回起点的点为止。 我的问题:掉头有什么特别之处?如何将轨迹加倍不会跳过优化点?我的上述描述正确吗?

1
稳健的PCA与稳健的Mahalanobis距离,可用于异常值检测
健壮的PCA(由Candes等人2009或Netrepalli等人2014年开发)是一种流行的多变量离群值检测方法,但考虑到协方差矩阵的鲁棒,规则化估计,马氏距离也可以用于离群值检测。我很好奇使用一种方法相对于另一种方法的(缺点)优势。 我的直觉告诉我,两者之间的最大区别是:当数据集为“小”(从统计意义上来说)时,稳健的PCA将给出较低等级的协方差,而稳健的协方差矩阵估计将给出完整的-由于Ledoit-Wolf正则化导致的秩协方差。这又如何影响离群值检测?

3
使用套索进行变量选择后的推论
我正在使用Lasso在相对较低的尺寸设置(n >> p)中进行特征选择。拟合套索模型后,我想使用具有非零系数的协变量来拟合无惩罚的模型。我这样做是因为我想要无偏差的估计,而套索不能给我。我还希望无偏估计的p值和置信区间。 我很难找到有关该主题的文献。我发现的大多数文献都是关于将置信区间放在套索估计上,而不是重新拟合的模型。 根据我的阅读,仅使用整个数据集来重新拟合模型会导致不切实际的p值/ std错误。目前,样本分割(按照Wasserman和Roeder(2014年)或Meinshausen等人(2009年)的样式)似乎是一个不错的选择,但我正在寻找更多建议。 有没有人遇到这个问题?如果是这样,请您提供一些建议。

3
神经网络中样本,时间步长和特征之间的差异
我正在浏览LSTM神经网络上的以下博客:http : //machinelearningmastery.com/understanding-stateful-lstm-recurrent-neural-networks-python-keras/ 作者针对LSTM的不同配置将输入向量X重塑为[样本,时间步长,特征]。 作者写道 实际上,字母序列是一个特征的时间步长,而不是单独特征的一个时间步长。我们为网络提供了更多的上下文,但是没有像预期的那样提供更多的顺序 这是什么意思?


3
如何在嵌套交叉验证中获取超级参数?
我已经阅读了以下有关嵌套交叉验证的文章,但仍然不确定100%如何使用嵌套交叉验证进行模型选择: 嵌套交叉验证,用于模型选择 模型选择和交叉验证:正确的方法 为了解释我的困惑,让我尝试逐步使用嵌套交叉验证方法进行模型选择。 使用K折创建外部CV循环。这将用于估计“赢得”每个内部CV循环的超参数的性能。 使用GridSearchCV创建一个内部CV循环,在每个内部循环中,GSCV都会遍历参数空间的所有可能组合,并提供最佳的参数集。 GSCV在内部循环中找到最佳参数后,将使用外部循环中的测试集对其进行测试,以获得性能评估。 然后,外循环更新为测试集的下一个折叠,其余的更新为训练集,并重复1-3次。总共可能的“获胜”参数是在外循环中指定的折数。因此,如果外部循环是5倍,那么您将对具有5组不同的超参数的算法进行性能评估,而不是一组特定的超参数的性能。 SKLearn的示例页面上说明了这种方法:http ://scikit-learn.org/stable/auto_examples/model_selection/plot_nested_cross_validation_iris.html 问题:4 . 之后,您如何确定哪些超级参数效果最佳?我知道您想使用最后的COMPLETE数据来训练算法(例如逻辑回归,随机森林等)。但是,如何确定哪些超级参数在嵌套交叉验证中效果最好?我的理解是,对于每个内部循环,一组不同的超参数将获胜。对于外循环,您正在评估GridSearchCV的性能,但没有任何一组特定的超参数。因此,在最终的模型创建中,您如何知道要使用哪些超参数?那是我从其他方面难以理解的缺失逻辑。 预先感谢您提供任何提示,尤其是如果@Dikran Marsupial和@cbeleites可以发出提示音! 编辑:如果可以的话,请在回答中使用“算法”和“超级参数”之类的术语。我认为让我感到困惑的一个原因是人们使用术语“模型”或“模型选择”。无论他们是在谈论选择使用哪种算法还是使用哪些超级参数,我都感到困惑。 编辑2:我创建了一个笔记本,其中显示了两种进行嵌套交叉验证的方法。第一种方法是SKLearn示例中显示的方法,另一种较长的方法是我编写的方法。SKLearn中显示的方法没有公开“获胜”的超参数,但我的较长方法却没有。但是问题仍然是一样的。完成嵌套交叉验证后,即使暴露了超参数,我现在该怎么办?从笔记本末尾的超参数可以看出,它们之间的差异很大。

1
嵌套交叉验证后如何建立最终模型并调整概率阈值?
首先,为发布一个已经在这里,这里,这里,这里,这里详细讨论过的问题的道歉,并用于重新加热旧主题。我知道@DikranMarsupial已经在帖子和期刊论文中详细介绍了这个主题,但是我仍然感到困惑,从这里的类似帖子数量来看,这仍然是其他人难以理解的事情。我还应该指出,我在这个话题上的矛盾加剧了我的困惑。您还应该知道我本来是物理学家,而不是统计学家,所以我在这方面的专业知识有限。我正在写一篇期刊论文,其中我想使用嵌套的CV来评估最终模型所期望的性能。在我的领域,这是第一个。(我们几乎从不使用任何是我领域中强大的简历的一种形式,但要用神经网络和增强型决策树的研究成果来愉快地抽出论文!)因此,有一个非常透彻和清晰的理解非常重要,这样我就不会搞砸和传播对我的社区来说是一个错误的过程,可能需要多年才能学会!谢谢!关于这个问题... 嵌套交叉验证后如何构建最终模型? 我正在训练一个具有L1和L2正则化的简单glmnet模型。快速,简单和可解释。我执行特征中心,缩放和Box-Cox转换,以使特征分布均值中心,标准化并且有点像高斯型。我在交叉验证中执行此步骤,以防止信息泄漏。纯粹是因为我的硬件速度非常慢,而且我无法使用更多的CPU资源,所以在特征预处理之后,我还会在CV中执行基于过滤器的快速特征选择。我正在使用随机网格搜索来选择alpha和lambda超参数。我知道我不应该通过CV循环获得此估算值。我知道内部CV回路用于模型选择(在这种情况下,是最佳超参数),而外部回路则用于模型评估,即内部CV和外部CV具有两个不同的用途,这些用途常常被错误地混为一谈。(到目前为止,我还好吗?) 现在,我发布的链接建议“考虑交叉验证的方法是估计使用构建模型的方法获得的性能,而不是估计模型的性能”。鉴于此,我应该如何解释嵌套CV过程的结果? 我读过的建议似乎表明以下问题---如果这是错误的,请纠正我:内部CV是允许我选择glmnet模型的最佳alpha和lambda超参数的机制的一部分。如果我完全按照内部CV中所使用的过程(包括超参数调整)并使用整个数据集构建最终模型,则外部CV会告诉我可以从最终模型中获得的估计值。即,超参数调整是“用于构建模型的方法”的一部分。这是正确的吗?因为这使我感到困惑。在其他地方,我已经看到了构建要部署的最终模型的过程涉及使用固定值对整个数据集进行训练使用CV选择的超参数。在此,“用于建立模型的方法”不包括调整。那是什么呢?在某个时候,将选择最佳超参数并将其固定以构建最终模型!哪里?怎么样?如果我的内循环是CV的5倍,而我的外循环是CV的5倍,并且我在内部CV中选择了100个测试点作为随机网格搜索的一部分,那么我实际训练了几次glmnet模型?(100 * 5 * 5)+ 1作为最终版本,还是我不知道还有更多步骤? 基本上,我需要对如何从嵌套CV解释性能估计以及如何构建最终模型进行非常清晰的描述。 我还想知道选择概率阈值的适当程序,以将最终的glmnet模型的概率分数转换为(二进制)类标签---需要另一个CV循环吗?


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.