统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
如何使用主成分分析选择变量进行回归?
我目前正在使用主成分分析来选择要在建模中使用的变量。目前,我在实验中进行了A,B和C测量-我真正想知道的是:我可以减少测量并停止记录C和/或B以节省时间和精力吗? 我发现所有这三个变量都在我的第一个主成分上加重了,这占我数据差异的60%。组件得分告诉我,如果我将这些变量按一定比率(aA + bB + cC)加在一起。我可以在数据集中为每种情况在PC1上获得一个分数,并且可以将此分数用作建模中的变量,但这不能让我停止测量B和C。 如果我对PC1上的A,B和C的负载求平方,我发现变量A占PC1方差的65%,变量B占PC1方差的50%,变量C也占50%,即有些每个变量A,B和C所占PC1方差的一个变量与另一个变量共享,但是A占更大的比例。 认为我可以选择变量A或在模型中使用变量(可能是aA + bB)是错误的,因为该变量描述了PC1中很大一部分的方差,而这又描述了PC1中很大一部分的方差。数据? 您过去采用哪种方法? 即使有其他重型装载机,单个变量在PC1上的负载也最重? 使用所有变量在PC1上的组件得分,即使它们都是重型装载机?

1
条件同方差与异方差
摘自《计量经济学》,作者:Fumio Hayashi(第一章): 无条件同方性: 误差项E(εᵢ²)的第二矩在整个观测中都是恒定的 在所有观察结果中,函数形式E(εᵢ²| xi)是恒定的 有条件的同方性: 解除了误差项E(ε)²)的第二矩在整个观测值中恒定的限制 因此,条件二阶矩E(εᵢ²| xi)可能由于对xᵢ的依赖而在观测中有所不同。 所以,我的问题是: 有条件的同方性与异方性有何不同? 我的理解是,当第二个时刻的观测值不同时,存在异方差。

2
求蒙特卡罗模拟估计的精度
背景 我正在设计一个结合了一系列模型输出的蒙特卡洛模拟,并且我想确保该模拟将使我能够对模拟结果的概率和该概率估计的精度提出合理的要求。 模拟将发现从特定社区招募的陪审团将某被告定罪的可能性。这些是模拟步骤: 使用现有数据,通过对人口预测变量上的“初选投票”进行回归,生成逻辑概率模型(M)。 使用蒙特卡洛方法模拟M的 1,000个版本(即,模型参数的系数的1000个版本)。 选择模型的1,000个版本之一(M i)。 Empanel 1,000陪审团通过从具有特定人口特征分布的个人“社区”(C)中随机选择1,000组12个“陪审员”来进行。 使用M i确定性地计算每个陪审员第一次有罪表决的概率。 将每个“陪审员”的可能的票数投给确定票(根据票数是大于还是小于0-1之间的随机选择值)。 通过使用陪审团定罪的概率模型(从经验数据得出)来确定每个“陪审团”的“最终投票”,条件是陪审员在第一次投票中对定罪投票的比例。 存储有1000个陪审团(PG i)的有罪判决的比例。 对M的1,000个模拟版本中的每一个重复步骤3-8 。 计算PG的平均值,并将其报告为C中定罪概率的点估计 。 确定PG的2.5和97.5个百分位数,并将其报告为0.95置信区间。 我目前正在使用1,000名陪审员和1,000名陪审员的理论,即从概率分布(C或M版本的人口统计特征)中抽取1000次随机抽奖将填补该分布。 问题 这将使我能够准确地确定估计的精度吗?如果是这样,我需要为每个PG i计算覆盖几个陪审团,以涵盖C的概率分布(因此避免了选择偏差);我可以使用少于1000个吗? 非常感谢您的帮助!

3
从使用统计软件过渡到理解数学方程式?
内容: 我是心理学博士研究生。与许多心理学博士生一样,我知道如何使用统计软件进行各种统计分析,以及PCA,分类树和聚类分析等技术。但这并不能真正令人满意,因为尽管我可以解释为什么进行分析以及指标的含义,但无法解释该技术的工作原理。 真正的问题是,掌握统计软件很容易,但是却受到限制。要学习文章中的新技术,我需要了解如何阅读数学方程式。目前,我无法计算特征值或K均值。方程对我来说就像一门外语。 题: 是否有全面的指南可帮助您理解期刊文章中的方程式? 编辑: 我认为这个问题将更加自我解释:在一定的复杂性之上,统计符号对我来说变得毫无意义。假设我想用R或C ++编写自己的函数以了解一种技术,但是有一个障碍。我无法将方程式转换为程序。确实:我不知道美国博士学位学校的情况,但是在我的(法国),我唯一可以学习的课程是大约16世纪的文学运动...

2
测试两个非嵌套模型的AIC差异
AIC或任何其他信息标准的全部要点是,越少越好。因此,如果我有两个模型M1:y = a0 + XA + e和M2:y = b0 + ZB + u,并且如果第一个(A1)的AIC小于第二个(A2)的AIC,则M1具有从信息论的角度来看,这是一个更好的选择。但是,是否存在差异A1-A2的截止基准?少多少就是少多少?换句话说,除了眼球外,是否还有针对(A1-A2)的测试? 编辑:Peter / Dmitrij ...感谢您的答复。实际上,在这种情况下,我的实质专长与我的统计专长相冲突。从本质上讲,问题不是在两个模型之间进行选择,而是在检查两个我知道在很大程度上相等的变量是否添加了相等数量的信息(实际上,第一个模型中的一个变量和第二个模型中的向量。请考虑以下情况)一堆变量,而不是它们的索引。)正如Dmitrij指出的那样,最好的选择似乎是考克斯考验。但是,是否有一种方法可以实际测试两个模型的信息内容之间的差异?
12 regression  aic 

4
数据集的皮尔逊相关性可能具有零标准偏差?
我在计算标准偏差可能为零的数据集的皮尔逊相关系数时遇到问题(即所有数据具有相同的值)。 假设我有以下两个数据集: float x[] = {2, 2, 2, 3, 2}; float y[] = {2, 2, 2, 2, 2}; 相关系数“ r”将使用以下公式计算: float r = covariance(x, y) / (std_dev(x) * std_dev(y)); 但是,由于数据集“ y”中的所有数据都具有相同的值,因此标准偏差std_dev(y)将为零,而“ r”将不确定。 这个问题有什么解决办法吗?还是在这种情况下我应该使用其他方法来测量数据关系?

1
非嵌套模型的测试等效性
假设是和虚拟d的线性函数。我的假设是d本身就像其他变量Z的向量的享乐主义索引。我有一个这种支持MANOVA的ž(即Z_1,Z_2,...,z_n)上d。有什么方法可以测试这两个模型的等效性:yyyxxxddddddZZZMANOVAMANOVAMANOVAZZZz1z1z_1z2z2z_2znznz_nddd 模型1:y=b0+b1⋅x+b2⋅d+e1y=b0+b1⋅x+b2⋅d+e1y = b_0 + b_1 \cdot x + b_2\cdot d + e_1 模型2:y=g0+Z⋅G+e2y=g0+Z⋅G+e2y = g_0 + Z\cdot G + e_2 其中GGG是参数的列向量。

3
处理三级列联表的适当方法
我有一个三级列联表,其中包含几种物种的计数数据,收集它们的寄主植物以及该收集是否在下雨天发生(这实际上很重要!)。使用R,假数据可能是这样的: count <- rpois(8, 10) species <- rep(c("a", "b"), 4) host <- rep(c("c","c", "d", "d"), 2) rain <- c(rep(0,4), rep(1,4)) my.table <- xtabs(count ~ host + species + rain) , , rain = 0 species host a b c 12 15 d 10 13 , , rain = 1 species …

1
反复测试累积数据时出现总体I型错误
我对组顺序方法有疑问。 根据维基百科: 在具有两个治疗组的随机试验中,按以下方式使用经典组顺序测试:如果每个组中有n位受试者可用,则对2n位受试者进行中期分析。进行统计分析以比较两组,如果接受替代假设,则终止试验。否则,将继续试验另外2n名受试者,每组n名受试者。再次对4n名受试者进行统计分析。如果接受了替代方案,则审判终止。否则,它将继续进行定期评估,直到N组2n个主题可用为止。此时,将进行最后一次统计检验,并且该试验将终止 但是通过以这种方式反复测试累积数据,I型错误级别被夸大了…… 如果样本彼此独立,则总的I类错误将为α⋆α⋆\alpha^{\star} α⋆=1−(1−α)kα⋆=1−(1−α)k\alpha^{\star} = 1 - (1 - \alpha)^k 其中是每个测试的级别,是临时外观的数量。αα\alphakkk 但是样本不是独立的,因为它们重叠。假设以相等的信息增量执行临时分析,则可以发现(幻灯片6) 您能解释一下该表格的获取方式吗?

2
如果exp(X)〜Gamma如何快速采样X?
我有一个简单的采样问题,我的内循环看起来像: v = sample_gamma(k, a) 其中sample_gamma从Gamma分布样品以形成样品狄利克雷。 它运行良好,但对于某些k / a值,一些下游计算会出现下溢。 我将其修改为使用日志空间变量: v = log(sample_gamma(k, a)) 在修改了该程序的所有其余部分之后,它可以正常工作(至少在测试案例中它给我的结果是相同的)。但是,它比以前慢。 有没有一种方法可以直接对进行采样而无需使用这样的慢函数?我为此进行了谷歌搜索,但是我什至不知道此发行版是否具有通用名称(log-gamma?)。对数()X,exp(X)〜伽玛X,exp⁡(X)∼GammaX, \exp(X) \sim \text{Gamma}日志()log⁡()\log()

2
设计一个好的混合/哈密顿蒙特卡洛算法,我应该知道些什么?
我正在为PyMC设计一种混合蒙特卡洛采样算法,并且试图使其尽可能地简化和通用,因此我正在寻找有关设计HMC算法的好的建议。我已阅读雷德福的调查章节和Beskos等。等人最近发表的有关HMC最佳(步长)调整的论文,我收集了以下技巧: 动量变量应该与协方差分布,其中Ç通常是一样的东西分配(为简单分布)的协方差矩阵,但可以想见,是不同的(对于滑稽形分布)。默认情况下,我在该模式下使用粗麻布。C−1C−1C^{-1}CCC 轨迹应使用跳越法计算(其他集成商似乎不值得) 对于非常大的问题,最佳接受率是.651,否则更高。 步长大小应该被缩放等,其中,大号是自由变量和d是维数。L×d(1/4)L×d(1/4)L\times d^{(1/4)}LLLddd 当存在轻尾或其他具有奇数稳定性特征的区域时,步长应更小。步长随机化可以对此有所帮助。 还有其他我应该采纳或至少考虑的想法吗?我应该阅读其他论文吗?例如,是否有值得采用的自适应步长算法?轨迹长度是否有好的建议?实际上是否有更好的集成商? 有人请使其成为社区Wiki。

2
模型选择或正则化后的GLM
我想分两个部分提出这个问题。两者都处理广义线性模型,但是前者处理模型选择,而其他则处理正则化。 背景:我利用GLM(线性,逻辑,伽马回归)模型进行预测和描述。当我提到“ 正常情况下,人们会做回归 ”时,我主要是指这样的描述:(i)系数周围的置信区间,(ii)预测周围的置信区间和(iii)与系数线性组合有关的假设检验,例如“是治疗A和治疗B有什么区别?”。 您是否在以下每种情况下使用正常理论合理地丧失了做这些事情的能力?如果是这样,这些事情真的只对用于纯预测的模型有用吗? I.当通过某种模型选择过程拟合了GLM时(具体来说,它是基于AIC的逐步过程)。 二。通过正则化方法拟合GLM时(例如在R中使用glmnet)。 我的感觉是,对我来说,答案是技术上来说,您应该对“ 使用回归进行的正常操作 ”使用引导程序,但是没有人真正遵守。 添加: 在收到一些答复并在其他地方阅读后,这是我的看法(对其他人有益并能得到纠正)。 I. A)RE:错误概括。为了概括新数据的错误率,在没有保留集的情况下,可以进行交叉验证,但是您需要为每个折叠完全重复该过程-使用嵌套循环-因此必须进行任何功能选择,参数调整等。每次独立完成。这个想法应该适用于任何建模工作(包括惩罚方法)。 B)RE:假设检验和GLM的置信区间。当对广义线性模型使用模型选择(特征选择,参数调整,变量选择)并且存在保留集时,可以在分区上训练模型,然后将模型拟合到其余数据或完整数据集上并使用该模型/数据执行假设检验等。如果不存在保留集,则可以使用引导程序,只要对每个引导程序样本重复完整的过程即可。但这限制了可以进行的假设检验,因为例如可能不一定总是选择一个变量。 C)RE:不对未来数据集进行预测,然后在理论和一些假设检验的指导下,建立一个有目的的模型,甚至考虑在模型中保留所有变量(无论是否有意义)(沿Hosmer和Lemeshow的思路)。这是回归模型的小变量集经典类型,然后允许使用CI和假设检验。 D)RE:惩罚回归。没有建议,也许认为这仅适合于预测(或作为特征选择的一种,然后应用于上述B中的另一数据集),因为引入的偏差使CI和假设检验变得不明智-即使使用自举。


1
在线,可扩展的统计方法
这受到高效在线线性回归的启发,我发现这非常有趣。是否有专门用于大规模统计计算的文本或资源,通过这些文本或资源进行的数据集计算过大而无法放入主存储器中,并且可能变化太多而无法有效地进行子采样。例如,是否可以在线方式拟合混合效果模型?有没有人研究过用一阶SGD型技术替换MLE的标准二阶优化技术的效果?

5
最佳距离测量
语境 我有两组数据要比较。在这两组的每个数据元素是含有22角(所有之间的矢量−π−π-\pi和ππ\pi)。角度与给定的人体姿势配置有关,因此姿势由22个关节角度定义。 我最终想要做的是确定两组数据的“紧密度”。因此,对于一组中的每个姿势(22D矢量),我想在另一组中找到其最近的邻居,并为每个最接近的对创建距离图。 问题 我可以简单地使用欧几里得距离吗? 为了有意义,我假设距离度量需要定义为:θ=|θ1−θ2|modπθ=|θ1−θ2|modπ\theta = |\theta_1 - \theta_2| \quad mod \quad \pi,其中|...||...||...|是绝对值,mod是模。然后使用得到的22个theta,我可以执行标准的欧几里德距离计算,t21+t22+…+t222−−−−−−−−−−−−−−√t12+t22+…+t222\sqrt{t_1^2 + t_2^2 + \ldots + t_{22}^2}。 它是否正确? 另一个距离度量标准(例如卡方或Bhattacharyya或其他度量标准)会更有用吗?如果是这样,请您提供一些原因的见解。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.