统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
为什么不对部分模拟的数据执行荟萃分析?
背景: 典型的心理学荟萃分析可能试图对两个变量X和Y之间的相关性进行建模。该分析通常涉及从文献中获得一组相关的相关性以及样本量。然后可以将公式应用于计算加权平均相关性。然后,可以进行分析以查看各个研究之间的相关性变化是否比随机抽样的单纯影响所暗示的变化大。 此外,可以使分析变得更加复杂。可以针对可靠性,范围限制等进行调整。相关性可以组合使用,以探索元结构方程建模或元回归等。 但是,所有这些分析都是使用摘要统计信息(例如,相关性,优势比,标准化的均值差)作为输入数据执行的。这需要使用接受汇总统计信息的特殊公式和过程。 荟萃分析的替代方法 因此,我正在考虑一种元分析的替代方法,其中将原始数据用作输入。即,对于相关性,输入数据将是用于形成相关性的原始数据。显然,在大多数荟萃分析中,即使不是大多数,实际的原始数据也无法获得。因此,基本过程可能如下所示: 与寻求原始数据的所有已发布作者联系,如果提供的话,请使用实际原始数据。 对于不提供原始数据的作者,请模拟原始数据,以使其具有与所报告的摘要统计相同的摘要统计。这样的模拟还可以合并从原始数据中获得的任何知识(例如,如果已知变量存在偏差等)。 在我看来,这种方法可能有几个好处: 使用原始数据作为输入的统计工具可用于分析 通过至少获取一些实际的原始数据,荟萃分析的作者将被迫考虑与实际数据相关的问题(例如,异常值,分布等)。 题 对真实的原始数据和模拟的数据进行荟萃分析研究是否存在任何问题,以使其具有与现有已发表研究相同的汇总统计数据? 这样的方法是否会优于对汇总统计数据执行荟萃分析的现有方法? 是否有现有文献讨论,主张或批评这种方法?

4
是否对OLS中的遗漏变量偏差进行了测试?
我知道Ramsey重置测试可能会检测到非线性相关性。但是,如果只丢弃其中一个回归系数(仅是线性相关性),则可能会产生偏差,具体取决于相关性。重置测试显然未检测到这一点。 我没有找到针对这种情况的测试,而是这样声明:“除非包含潜在的省略变量,否则您无法测试OVB”。这可能是一个合理的陈述,不是吗?

3
数据挖掘者实验设计课程
我是从事数据挖掘的计算机科学家。可以肯定地说,计算机科学家在进行系统的实验设计和评估方面相当差劲-使用p值和置信度估计被认为是高级的:)。 我想知道是否有好的课程/材料可以教计算机科学家有关好的实验设计的知识。为了更加具体,我将添加以下信息: 本课程应针对可以假定对概率有合理理解但统计学背景有限的研究生。 本课程应侧重于“不受控制的非自然环境”中的实验设计:换句话说,既没有潜在的物理基础事实,也没有控制数据收集过程的方式(与人类受试者一样)。当然,一门好的课程将侧重于基本原理,但是它应该以一种重要的方式来应对这种情况。 计算元素将是奖励,但不是强制性的。我们处理大量数据,但可以根据需要自己解决计算问题。

3
平均数
我正在处理高度偏斜的数据,因此我使用中位数而不是均值来概括中心趋势。我想测量分散度虽然我经常看到人们报告平均值标准偏差±±\pm或中值四分位数±±\pm以总结中心趋势,但报告中值中值绝对分散度(MAD)±±\pm 是否可以?这种方法是否存在潜在问题? 与报告上下四分位数相比,我会发现这种方法更加紧凑和直观,尤其是在充满数字的大表中。

2
参考为
@Erik P.在回答我的上一个问题时,给出了表达式 其中Var[s2]=σ4(2n−1+κn),Var[s2]=σ4(2n−1+κn), \mathrm{Var}[s^2]=\sigma^4 \left(\frac{2}{n-1} + \frac{\kappa}{n}\right) \>, 是分布的峰度。给出了有关样本方差分布的Wikipedia条目的引用,但是Wikipedia页面上显示“需要引用”。κκ\kappa 我的主要问题是,此公式是否有参考?推导是否“琐碎”?如果是的话,可以在教科书中找到它吗?(@Erik P.在数学统计和数据分析中找不到,在Casella和Berger的统计推断中也找不到。尽管涵盖了该主题。 拥有教科书参考书会很好,但是拥有(主要)参考书会更有用。 (一个相关的问题是:样本分布与未知分布的方差分布是什么?) 更新:@cardinal指出了另一个方程math.SE: 其中,μ4是第四中心矩。Var(S2)=μ4n−σ4(n−3)n(n−1)Var(S2)=μ4n−σ4(n−3)n(n−1) \mathrm{Var}(S^2)={\mu_4\over n}-{\sigma^4\,(n-3)\over n\,(n-1)} μ4μ4\mu_4 是否可以通过某种方式重新排列方程式并解决这两个问题,还是标题中的方程式错误?

2
泊松分布是否稳定,MGF是否有反演公式?
首先,我对泊松分布是否“稳定”存在疑问。非常幼稚(而且我不太确定“稳定”的分布),我使用MGF的产品算出了Poisson分布RV的线性组合的分布。看来我得到了另一个泊松,其参数等于各个RV的参数的线性组合。所以我得出结论,泊松是“稳定的”。我想念什么? 其次,MGF是否有像特征函数一样的反演公式?


2
将Adaboost与SVM一起使用进行分类
我知道Adaboost会尝试使用一组弱分类器的线性组合来生成强分类器。 但是,我读过一些论文,建议Adaboost和SVM在某些条件和情况下可以协调工作(即使SVM是强大的分类器)。 从体系结构和编程的角度看,我无法把握它们如何结合使用。我读过许多论文(也许是错误的论文),但并没有清楚地解释它们如何协同工作。 有人可以阐明他们如何结合使用以进行有效分类吗?指向一些论文/文章/期刊的指针也将不胜感激。

5
我可以对偏态正常数据进行假设检验吗?
我有一个数据收集,本来以为是正态分布的。然后我实际上查看了一下,意识到不是,主要是因为数据是歪斜的,并且我还进行了shapiro-wilks测试。 我仍然想使用统计方法对其进行分析,因此我想对偏态正态性进行假设检验。 所以我想知道是否有一种方法可以测试偏斜正态性,如果可能的话,还有一个库可以为我做测试。

3
如何从正态分布中找到样本标准偏差的标准偏差?
如果我错过了一些显而易见的事情,请原谅我。 我是一位物理学家,本质上是(直方图)分布,其中心是一个近似于正态分布的平均值。对我来说,重要的值是该高斯随机变量的标准偏差。我将如何尝试查找样本标准偏差上的误差?我感觉到它与原始直方图中每个bin上的错误有关。

2
有没有公​​平的死法呢?
有没有公​​平的死法呢?在骰子上,数字由by出的圆点表示,肯定会有所不同吗?有人做过研究吗? 实际上,考虑一下,为什么抛硬币是公平的?双方的物理学完全不同。
11 dice 

2
重要的预测变量在多元逻辑回归中变得不重要
当我在两个单独的(单变量)逻辑回归模型中分析变量时,得到以下信息: Predictor 1: B= 1.049, SE=.352, Exp(B)=2.85, 95% CI=(1.43, 5.69), p=.003 Constant: B=-0.434, SE=.217, Exp(B)=0.65, p=.046 Predictor 2: B= 1.379, SE=.386, Exp(B)=3.97, 95% CI=(1.86, 8.47), p<.001 Constant: B=-0.447, SE=.205, Exp(B)=0.64, p=.029 但是,当我将它们输入到单个多元逻辑回归模型中时,我得到: Predictor 1: B= 0.556, SE=.406, Exp(B)=1.74, 95% CI=(0.79, 3.86), p=.171 Predictor 2: B= 1.094, SE=.436, Exp(B)=2.99, 95% CI=(1.27, …

1
ABC型号选择
已经表明,不建议使用贝叶斯因数选择ABC模型,因为存在使用汇总统计数据产生的错误。本文的结论依赖于一种流行的方法的行为的近似贝叶斯因子(算法2)的研究。 众所周知,贝叶斯因素并不是进行模型选择的唯一方法。还有其他一些功能,例如模型的预测性能,可能会引起关注(例如评分规则)。 我的问题是:是否有一种类似于算法2的方法,可以根据复杂情况下的预测性能,近似一些计分规则或其他可用于进行模型选择的数量?

2
预测和公差区间
对于预测和公差区间,我有几个问题。 首先让我们就容忍区间的定义达成一致:给我们一个置信度,例如90%,要捕获的总体百分比,例如99%,样本量,例如20。概率分布是已知的,例如正态为了方便。现在,考虑到上述三个数字(90%,99%和20)以及基础分布为正态的事实,我们可以计算公差数。给定具有均值和标准偏差的样本,公差区间为。如果此公差区间捕获了99%的人口,则样本被称为成功kkk(x1,x2,…,x20)(x1,x2,…,x20)(x_1,x_2,\ldots,x_{20})x¯x¯\bar{x}sssx¯±ksx¯±ks\bar{x}\pm ks(x1,x2,…,x20)(x1,x2,…,x20)(x_1,x_2,\ldots,x_{20})并且要求90%的样本是成功的。 评论:90%是样本成功的先验概率。假设样本成功,则99%是有条件的概率,将来的观察将在公差区间内。 我的问题:我们可以将预测间隔视为公差间隔吗?在网上浏览时,我对此有矛盾的答案,更不用说没有人真正仔细地定义预测间隔了。因此,如果您对预测间隔(或参考)有精确的定义,我将不胜感激。 我了解的是,例如99%的预测间隔不会捕获所有样本的所有将来值的99%。这与以100%的概率捕获99%的总体的公差区间相同。 在我发现的90%预测间隔的定义中,90%是给定样本(大小固定)和单个未来观察值的先验概率,即将在预测间隔内。因此,与容差区间相反,似乎在同一时间给出了样本和终值,而公差区间是在给出样本的情况下以一定的概率成功的,并且在一个成功y y(x1,x2,…,x20)(x1,x2,…,x20)(x_1,x_2,\ldots,x_{20})yyyyyy,则给出一个未来值,并以一定的概率落入公差区间。我不确定上述预测间隔的定义是否正确,但是(至少)似乎违反直觉。 有什么帮助吗?


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.