统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
当因变量具有“截止”时建模
如果我使用的任何术语不正确,请提前道歉。我欢迎任何纠正。如果我所说的“截断”使用不同的名称,请告诉我,我可以更新问题。 我感兴趣的情况是:您有自变量和一个因变量。我将保持模糊,但是假设为这些变量获得良好的回归模型将相对简单。xx\bf{x}yyy 但是,您要创建的模型是针对自变量xx\bf{x}和因变量w=min(y,a)w=min(y,a)w = \min(y,a),其中aaa是y范围内的某个固定值yyy。同样,您有权访问的数据不包含yyy,仅包含www。 一个(有些不切实际的)例子是,如果您试图模拟人们将领取养老金的年限。在这种情况下,xx\bf{x}可能是相关信息,例如性别,体重,每周运动时间等。“基本”变量yyy是预期寿命。但是,您可以访问并试图在模型中预测的变量将是w=min(0,y−r)w=min(0,y−r)w = \min(0, y-r),其中r是退休年龄(为简单起见,它是固定的)。 在回归建模中是否有解决此问题的好方法?

3
贝叶斯vs MLE,过度拟合问题
他在Bishop的PRML书中说,过度拟合是最大似然估计(MLE)的问题,贝叶斯可以避免这种情况。 但是我认为,过度拟合问题更多地与模型选择有关,而不是与用于参数估计的方法有关。也就是说,假设我有一个数据集,它是通过,现在我可以选择不同的模型来拟合数据并找出哪一个是最好的。所考虑的模型是具有不同阶数的多项式,是阶数1,是阶数2,是阶数9。DDDf(x)=sin(x),x∈[0,1]f(x)=sin(x),x∈[0,1]f(x)=sin(x),\;x\in[0,1]HiHiH_iH1H1H_1H2H2H_2H3H3H_3 现在,我尝试以适应数据与各3款,每个模型都有其paramters,表示为的。DDDwiwiw_iHiHiH_i 使用ML,我将获得模型参数的点估计,并且太简单了,总是会拟合数据,而太复杂了,会拟合数据,只有会很好地拟合数据。wwwH1H1H_1H3H3H_3H2H2H_2 我的问题是 1)模型将使数据过拟合,但我认为这不是ML的问题,而是模型本身的问题。因为将ML用于不会导致过拟合。我对吗?H3H3H_3H1,H2H1,H2H_1,H_2 2)与贝叶斯算法相比,机器学习确实有一些缺点,因为它仅给出模型参数的点估计,并且过于自信。贝叶斯不仅仅依赖于参数的最可能值,而且还依赖于给定观测数据所有可能参数值,对吗?wwwDDD 3)为什么贝叶斯可以避免或减少过度拟合?据我了解,我们可以使用贝叶斯模型进行模型比较,也就是说,给定数据,我们可以找出所考虑的每种模型的边际可能性(或模型证据),然后选择边际可能性最高的模型(对) ?如果是这样,那为什么呢?DDD

1
为什么高斯线性模型中的F检验功能最强大?
对于高斯线性模型,其中μ,假定为位于某些向量空间W ^和ģ对标准正态分布ř Ñ,所述的统计˚F -test为ħ 0:{ μ ∈ ù }其中ü ⊂ w ^是一个向量空间,是的增加一到一个功能偏差统计: ˚F = φ ( 2 日志SUP μ ∈ w ^ÿ= μ + σGY=μ+σGY=\mu+\sigma Gμμ\muw ^WWGGG[RñRn\mathbb{R}^nFFFH0:{ μ ∈ û}H0:{μ∈U}H_0\colon\{\mu \in U\}ü⊂ w ^U⊂WU \subset W 我们怎么知道这个统计数据为H0提供了最有力的检验(也许在丢弃了异常情况之后)?因为这个定理断言,似然比测试是最有力的对点的假设这并不奈曼皮尔森定理干ħ0:{μ=μ0,σ=σ0}和ħ1:{F= ϕ ( 2 对数SUPμ ∈ w ^,σ> 0L (μ ,σ| ÿ)SUPμ ∈ û,σ> …


2
为什么独立性测试使用卡方分布?
所述拟合优度测试使用以下统计: 在测试中,授予该该条件得到满足,一个用途 - 分布来计算p值,鉴于条件之一将相同尺寸的代表性样品中观察这样的值。χ 2 0 = Ñ Σ我= 1(直径:我 - ë 我)2χ2χ2\chi^2 χ2ħ0χ20=∑i=1n(Oi−Ei)2Eiχ02=∑i=1n(Oi−Ei)2Ei \chi_0^2=\sum_{i=1}^n\frac{(O_i-E_i)^2}{E_i} χ2χ2\chi^2H0H0H_0 但是,为了使统计遵循(具有个自由度),必须为: 用于独立的标准普通(Wikipedia)。测试的条件如下(同样来自Wikipedia): χ 2 ñ - 1 ñ Σ我= 1(直径:我 - ë 我)2χ20χ02\chi_0^2χ2χ2\chi^2n−1n−1n-1 Zi∑i=1n(Oi−Ei)2Ei=∑i=1n−1Z2i∑i=1n(Oi−Ei)2Ei=∑i=1n−1Zi2 \sum_{i=1}^n\frac{(O_i-E_i)^2}{E_i}=\sum_{i=1}^{n-1}Z_i^2 ZiZiZ_i 人口样本代表 大样本量 预期细胞数足够大 每个类别之间的独立性 从条件(1,2)可以看出,我们满足了从样本到总体的推断条件。(3)似乎是一个必要的假设,因为分母中的离散计数不会导致每个的近连续分布,并且如果它不够大,则存在可以用Yates校正的误差校正 -这似乎是由于以下事实:离散分布基本上是“泛滥”的连续分布,因此每个分布的偏移都可以对此进行校正。ž 我EiEiE_iZiZiZ_i1/21/21/2 (4)的必要性似乎稍后会派上用场,但我不知道如何。 起初,我认为对于使统计信息与分布匹配是必要的。这使我得出一个令人质疑的假设,即,这确实是错误的。实际上,从等式两边的维数从到可以看出,事实并非如此。Zi=Oi−EiEi√Zi=Oi−EiEiZ_i=\frac{O_i-E_i}{\sqrt{E_i}}Oi−Ei∼N(0,Ei−−√)Oi−Ei∼N(0,Ei)O_i-E_i\sim \mathcal{N}(0, \sqrt{E_i})nnnn−1n−1n-1 由于whuber的解释,很明显不必等于每个项,因为对于功能独立的标准正态随机变量,(注意总的减少)。ZiZiZ_iOi−EiEi√Oi−EiEi\frac{O_i-E_i}{\sqrt{E_i}}χ20=∑n−1i=1Z2iχ02=∑i=1n−1Zi2\chi_0^2=\sum_{i=1}^{n-1}Z_i^2ZiZiZ_i 那么,我的问题是如何遵循分布?项中的每一个的什么样的组合会导致平方标准法线?显然,这需要使用CLT(这很有意义),但是如何?换句话说,每个等于(或近似等于)是多少?χ20χ02\chi_0^2χ2χ2\chi^2 Z 2 i Zi(Oi−Ei)2Ei(Oi−Ei)2Ei\frac{(O_i-E_i)^2}{E_i}Z2iZi2Z_i^2ZiZiZ_i

2
该 -test VS的 -试验比较2组患感冒的几率
我刚刚读了一篇颇受人尊敬的(受欢迎的)科学杂志(德国PM,02/2013,第36页),其中讲述了一个有趣的实验(不幸的是,没有资料来源)。它引起了我的注意,因为直觉上我怀疑结果的重要性,但是所提供的信息足以重现统计检验。 研究人员想知道,在寒冷的天气中变冷是否会增加患感冒的几率。因此,他们将180名学生随机分为两组。一组不得不将脚放进冷水中20分钟。另一个人穿鞋。我认为这是一种有趣的操作,但另一方面,我不是医生,也许医生认为很有趣。除了道德问题。 无论如何,经过5天的治疗,治疗组中的13名学生患了感冒,但只有5名学生保持着鞋凉。因此,该实验的优势比为2.87。 鉴于样本量很小,我开始怀疑这种差异是否可能很大。所以我进行了两次测试。 首先,使用正态逼近对比例相等进行简单测试。该测试的,。我的猜测是,这就是研究人员测试过的。这确实很重要。但是,由于正态近似,如果没有记错的话,此z检验仅在大样本中有效。此外,患病率还很小,我想知道这是否不会影响效果置信区间的覆盖率。p = 0.0468z=1.988z=1.988z=1.988p=0.0468p=0.0468p=0.0468 因此,我的第二次尝试是对卡塔尔独立性进行卡方检验,包括蒙特卡罗模拟和标准皮尔逊卡方。在这里,我发现p值都约为。p=.082p=.082p=.082 现在,所有这些都不会让您对结果感到放心。我想知道是否有更多选择来测试此数据,以及您对这两项测试的想法是什么(特别是第一个重要测试的假设)

4
假设检验用于两个以上样本之间的中位数差异
题 将三组人的测试成绩另存为R中的向量。 set.seed(1) group1 <- rnorm(100, mean = 75, sd = 10) group2 <- rnorm(100, mean = 85, sd = 10) group3 <- rnorm(100, mean = 95, sd = 10) 我想知道这些群体之间的中位数是否存在显着差异。我知道我可以使用Wilcoxon测试来测试第1组和第2组。 wilcox.test(group1, group2) 但是,这一次只比较两个组,我想同时比较所有三个组。我想进行统计检验,得出p值为0.05的显着性水平。有人可以帮忙吗? 编辑#1-情绪中位数测试 按照用户Hibernating的建议答案,我尝试了Mood的中位数测试。 median.test <- function(x, y){ z <- c(x, y) g <- rep(1:2, c(length(x), length(y))) m …

5
递归(在线)正则化最小二乘算法
谁能指出我的Tikhonov正则化(正则化最小二乘)在线(递归)算法的方向吗? 在离线环境,我将计算β = (X Ť X + λ我)- 1 X Ť ÿ使用在我的原始数据集λ是使用n重交叉验证中发现。一个新的ÿ值可以预测对于给定的X使用Ŷ = X Ť β。β^= (XŤX+ λ我)− 1XŤÿβ^=(XTX+λI)−1XTY\hat\beta=(X^TX+λI)^{−1}X^TYλλλÿyyXxxÿ= xŤβ^y=xTβ^y=x^T\hat\beta 在在线设置中,我不断绘制新的数据点。如何更新β当我绘制新的额外的数据样本不会对整个数据集做了充分的重新计算(原件+新)?β^β^\hat\beta

1
概率比率与PDF比率
我正在使用贝叶斯解决聚类问题。经过一些计算,我最终需要获得两个概率的比率: P(A)/P(B)P(A)/P(B)P(A)/P(B) 以获得。这些概率是通过将两个不同的2D多元KDE集成而获得的,如以下答案所示:P(H|D)P(H|D)P(H|D) P(A)=∬x,y:f^(x,y)&lt;f^(ra,sa)f^(x,y)dxdyP(A)=∬x,y:f^(x,y)&lt;f^(ra,sa)f^(x,y)dxdyP(A) = \iint_{x, y : \hat{f}(x, y) < \hat{f}(r_a, s_a)} \hat{f}(x,y)\,dx\,dy P(B)=∬x,y:g^(x,y)&lt;g^(rb,sb)g^(x,y)dxdyP(B)=∬x,y:g^(x,y)&lt;g^(rb,sb)g^(x,y)dxdyP(B) = \iint_{x, y : \hat{g}(x, y) < \hat{g}(r_b, s_b)} \hat{g}(x,y)\,dx\,dy 其中f^(x,y)f^(x,y)\hat{f}(x, y)和g^(x,y)g^(x,y)\hat{g}(x, y)是KDE,并且对低于阈值f^(ra,sa)f^(ra,sa)\hat{f}(r_a, s_a)和g^(rb,sb)g^(rb,sb)\hat{g}(r_b, s_b)。两个KDE都使用高斯内核。可以在这里看到与我正在使用的KDE类似的KDE代表性图像:在2D中集成内核密度估计器。 我通过stats.gaussian_kde python函数来计算KDE,因此我假设它具有以下一般形式: KDE(x,y)=1n∑i=1n−12h2e−(x−xi)2+(y−yi)22h2KDE(x,y)=1n∑i=1n−12h2e−(x−xi)2+(y−yi)22h2KDE(x,y) = \frac{1}{n} \sum_{i=1}^{n} -\frac{1}{2h^2} e^{-\frac{(x-x_i)^2 + (y-y_i)^2}{2h^2}} n我的点阵列的长度在哪里,h使用的带宽是多少。 上面的积分是使用蒙特卡洛过程计算的,该过程在计算上非常昂贵。我已经读过某处(忘了在哪里,对不起),在这种情况下,可以用在阈值点评估的PDF(KDE)比率替换概率比率,以获得同样有效的结果。我对此感兴趣,因为计算KDEs的比率要比计算MC积分的比率要快几个数量级。 因此问题被简化为该表达式的有效性: P(A)P(B)=f^(ra,sa)g^(rb,sb)P(A)P(B)=f^(ra,sa)g^(rb,sb)\frac{P(A)}{P(B)} = \frac{\hat{f}(r_a, s_a)}{\hat{g}(r_b, s_b)} 在什么情况下(如果有的话)我可以说这种关系是正确的? [固定错字(编辑)] …

3
二项式Fisher信息与成反比的直观原因
它使二项式的方差与成正比,这使我感到困惑/不高兴。等效地,Fisher信息与成正比。这是什么原因呢?为什么在将Fisher信息最小化?也就是说,为什么在推理最困难?1p (1 − p )p(1−p)p(1-p) p=0.5p=0.51个p (1 − p )1p(1−p)\frac{1}{p(1-p)}p = 0.5p=0.5p=0.5p = 0.5p=0.5p=0.5 内容: 我正在使用样本量计算器,并且的公式(所需的样本量)是的增加因子,这是推导中方差估计的结果。p (1 − p )ñNNp (1 − p )p(1−p)p(1-p)

10
具有特殊统计意义的常用词
我不是统计学家,但我的研究工作涉及统计学(分析数据,阅读文献等)。我在这里发表的一个问题的评论再次提醒我,对于那些在统计学领域有良好实践经验的人,有些常用词具有特别的含义或内涵。 列出此类单词可能会有所帮助,并且可能是短语以及一些注释。

2
MLE是否总是意味着我们知道数据的基础PDF,而EM是否意味着我们不知道?
关于MLE(最大似然估计),以及与EM(期望最大化)之间的联系,我想澄清一些简单的概念性问题。 据我了解,如果有人说“我们使用了MLE”,这是否自动意味着他们拥有其数据PDF的显式模型?在我看来,答案是肯定的。换句话说,如果有人在任何时候说“ MLE”,可以公平地问他们假设使用什么PDF。这是正确的吗? 最后,在EM上,我的理解是,在EM中,我们实际上并不知道-或需要知道我们数据的基础PDF。这是我的理解。 谢谢。

2
t分布密度函数的直觉
我正在研究学生的t分布,我开始怀疑,如何得出t分布密度函数(来自Wikipedia,http://en.wikipedia.org/wiki/Student%27s_t-distribution): F(t )= Γ (v + 12)v π--√Γ (v2)( 1 + 吨2v)− v + 12f(t)=Γ(v+12)vπΓ(v2)(1+t2v)−v+12f(t) = \frac{\Gamma(\frac{v+1}{2})}{\sqrt{v\pi}\:\Gamma(\frac{v}{2})}\left(1+\frac{t^2}{v} \right)^{-\frac{v+1}{2}} 其中是自由度,Γ是伽马函数。这个功能的直觉是什么?我的意思是,如果我查看二项式分布的概率质量函数,这对我来说很有意义。但是t分布密度函数对我完全没有意义...乍一看根本不直观。还是直觉认为它具有钟形曲线并满足我们的需求?vvvΓΓ\Gamma Thnx寻求任何帮助:)

2
如何在多个插补数据集中合并自举的p值?
我担心的问题是,我想从乘归(MI)数据中引导p值来估计,但是我不清楚如何在MI集合中组合p值。θθ\theta 对于MI数据集,获得估计总方差的标准方法使用Rubin规则。有关合并MI数据集的评论,请参见此处。总方差的平方根用作的标准误差估计。但是,对于某些估计量,总方差没有已知的闭合形式,或者采样分布不正常。然后,统计量可能不是t分布的,甚至不是渐近的。θ / 小号ë (θ )θθ\thetaθ / 塞e (θ )θ/se(θ){\theta}/{se(\theta)} 因此,在完整数据的情况下,即使采样分布不是正态且其闭合形式未知,一种替代方法是引导统计信息以找到方差,p值和置信区间。在MI的情况下,有两个选择: 跨MI数据集合并自举差异 跨MI数据集合并p值或置信范围 然后,第一种选择将再次使用鲁宾规则。但是,如果具有非正态采样分布,则我认为这是有问题的。在这种情况下(或更一般而言,在所有情况下),可以直接使用自举p值。但是,在MI的情况下,这将导致多个p值或置信区间,需要将其跨MI数据集合并。θθ\theta 所以我的问题是:如何在多个估算数据集之间合并多个自举p值(或置信区间)? 我欢迎任何有关如何进行的建议,谢谢。

5
术语频率/文档反向频率(TF / IDF):加权
我有一个数据集,代表1000个文档以及其中出现的所有单词。因此,行代表文档,列代表单词。因此,例如,单元格代表单词j在文档i中出现的时间。现在,我必须使用tf / idf方法找到单词的“权重”,但实际上我不知道该怎么做。有人可以帮我吗?(i,j)(i,j)(i,j)jjjiii

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.