统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
您可以在R中计算Kolmogorov-Smirnov检验的功效吗?
是否可以对R中的两面Kolmogorov Smirnov测试进行功率分析? 我正在使用ks.test()测试两个经验分布是否不同,并希望添加功效分析。 我无法在R中找到用于KS测试的内置功率分析。有什么建议吗? 编辑:这些是随机生成的分布,非常接近我的数据(具有真实的样本大小和指数分布的估计衰减率) set.seed(100) x <- rexp(64, rate=0.34) y <- rexp(54,rate=0.37) #K-S test: Do x and y come from same distribution? ks.test(x,y) 这些数据是两个不同组中身体大小的度量。我想证明两组的分布基本相同,但是一位合作者问我是否有能力根据样本量来说明这一点。我是从这里的指数分布中随机抽取的,但是它们接近真实数据。 到目前为止,我已经说过,基于双面KS测试,这些分布没有显着差异。我还绘制了两个分布。考虑到x和y的样本大小和衰减率,如何证明我有能力做出这样的陈述?

1
几乎可以肯定,收敛并不意味着完全收敛
如果每个我们说完全收敛到。X1,X2,…X1,X2,…X_1, X_2, \ldotsXXXϵ&gt;0ϵ&gt;0\epsilon>0 ∑∞n=1P(|Xn−X|&gt;ϵ)&lt;∞∑n=1∞P(|Xn−X|&gt;ϵ)&lt;∞\sum_{n=1}^\infty \text{P}\left(|X_n-X|>\epsilon\right) <\infty 有了Borel Cantelli的引理,就可以直接证明完全收敛意味着几乎肯定的收敛。 我正在寻找一个几乎可以确定Borel Cantelli无法证明融合的示例。这是一个随机变量序列,几乎可以肯定收敛,但不能完全收敛。

1
贝叶斯A / B测试的公式没有任何意义
我正在使用贝叶斯ab测试的公式,以便使用贝叶斯方法计算AB测试的结果。 PR (p乙&gt; p一个)= ∑我= 0α乙− 1B (α一个+ 我,β乙+ β一个)(β乙+ i )B(1 + i ,β乙)B (α一个,β一个)镨(p乙&gt;p一个)=∑一世=0α乙-1个乙(α一个+一世,β乙+β一个)(β乙+一世)乙(1个+一世,β乙)乙(α一个,β一个) \Pr(p_B > p_A) = \sum^{\alpha_B-1}_{i=0} \frac{B(\alpha_A+i,\beta_B+\beta_A)}{(\beta_B+i)B(1+i,\beta_B)B(\alpha_A, \beta_A)} 哪里 α一个α一个\alpha_A加A的成功次数 β一个β一个\beta_A加A的失败次数 α乙α乙\alpha_B加上B的成功次数 β乙β乙\beta_B加上B的失败次数 乙乙B是Beta函数 示例数据: control: 1000 trials with 78 successes test: 1000 trials with 100 successes 标准的非贝叶斯prop测试可以给我带来显着的结果(p &lt;10%): prop.test(n=c(1000,1000), x=c(100,78), correct=F) # 2-sample test …
10 r  bayesian  ab-test 

2
嵌套交叉验证的实现
我试图弄清楚我对嵌套交叉验证的理解是否正确,因此我写了这个玩具示例来看看我是否正确: import operator import numpy as np from sklearn import cross_validation from sklearn import ensemble from sklearn.datasets import load_boston # set random state state = 1 # load boston dataset boston = load_boston() X = boston.data y = boston.target outer_scores = [] # outer cross-validation outer = cross_validation.KFold(len(y), n_folds=3, shuffle=True, …

3
如何通过卷积神经网络(CNN)对不平衡数据集进行分类?
我在二元分类任务中有一个不平衡的数据集,其中正数与负数的比例为0.3%对99.7%。正面和负面之间的差距是巨大的。当我用MNIST问题中使用的结构训练CNN时,测试结果显示出较高的假阴性率。同样,训练误差曲线在开始的几个时期中迅速下降,但在随后的时期中保持相同的值。 您能建议我一种解决此问题的方法吗?谢谢!


2
基于马尔可夫链的抽样是蒙特卡洛抽样的“最佳”方法吗?有替代方案吗?
马尔可夫链蒙特卡洛方法是基于马尔可夫链的方法,它使我们能够从非标准分布中获取样本(在蒙特卡洛环境中),而我们无法直接从中提取样本。 我的问题是,为什么马尔可夫链对于蒙特卡洛采样来说是“最先进的”。另一个问题可能是,是否还有其他方法(如马尔可夫链)可用于蒙特卡洛采样?我知道(至少从研究文献的角度来看)MCMC具有深厚的理论根源(就(a)周期性,同质性和详细平衡之类的条件而言),但我想知道蒙特卡洛是否有任何“可比的”概率模型/方法卡洛采样类似于马尔可夫链。 如果我对问题的某些部分感到困惑(或者似乎完全令人困惑),请指导我。

1
足够或不足
考虑一个随机样本 {X1,X2,X3}{X1,X2,X3}\{X_1,X_2,X_3\} 哪里 XiXiX_i 是我 Bernoulli(p)Bernoulli(p)Bernoulli(p) 随机变量 p∈(0,1)p∈(0,1)p\in(0,1)。检查是否 T(X)=X1+2X2+X3T(X)=X1+2X2+X3T(X)=X_1+2X_2+X_3 是足够的统计 ppp。 首先,我们如何找到 (X1+2X2+X3)(X1+2X2+X3)(X_1+2X_2+X_3)?还是应该分解为X1+X2+X2+X3X1+X2+X2+X3X_1+X_2+X_2+X_3 然后这将跟随 乙我Ñ (4 ,p )Bin(4,p)Bin(4,p)?我认为不是因为要注意所有变量在这里不是独立的。 或者,如果我只考虑因式的联合pmf而采用因式分解条件 (X1个,X2,X3)(X1,X2,X3)(X_1,X_2,X_3) 然后 F(X1个,X2,X3)=pX1个+X2+X3(1 − p)3 - (X1个+X2+X3)= [pt (x )(1 − p)3 − t (x )]p-X2(1 − p)X2f(X1,X2,X3)=px1+x2+x3(1−p)3−(x1+x2+x3)=[pt(x)(1−p)3−t(x)]p−x2(1−p)x2f(X_1,X_2,X_3)=p^{x_1+x_2+x_3}(1-p)^{3-(x_1+x_2+x_3)}=[p^{t(x)}(1-p)^{3-t(x)}]p^{-x_2}(1-p)^{x_2} 哪里 t (x )=X1个+ 2X2+X3t(x)=x1+2x2+x3t(x)=x_1+2x_2+x_3。 这表明 ŤTT 还不够。 但是,如果我想遵循定义并想应用该怎么办 F(X| p)G(T(X)| p )f(X|p)g(T(X)|p)\dfrac{f(X|p)}{g(T(X)|p)} …

2
超参数化模型的Fisher信息矩阵行列式
考虑一个带有参数(成功概率)的伯努利随机变量。似然函数和Fisher信息(矩阵)为:X∈{0,1}X∈{0,1}X\in\{0,1\}θθ\theta1×11×11 \times 1 L1(θ;X)I1(θ)=p(X|θ)=θX(1−θ)1−X=detI1(θ)=1θ(1−θ)L1(θ;X)=p(X|θ)=θX(1−θ)1−XI1(θ)=detI1(θ)=1θ(1−θ) \begin{align} \mathcal{L}_1(\theta;X) &= p(\left.X\right|\theta) = \theta^{X}(1-\theta)^{1-X} \\ \mathcal{I}_1(\theta) &= \det \mathcal{I}_1(\theta) = \frac{1}{\theta(1-\theta)} \end{align} 现在考虑带有两个参数的“过度参数化”版本:成功概率θ1θ1\theta_1和失败概率θ0θ0\theta_0。(请注意θ1+θ0=1θ1+θ0=1\theta_1+\theta_0=1,并且此约束表示参数之一是多余的。)在这种情况下,似然函数和Fisher信息矩阵(FIM)为: L2(θ1,θ0;X)I2(θ1,θ0)detI2(θ)=p(X|θ1,θ0)=θX1θ1−X0=(1θ1001θ0)=1θ1θ0=1θ1(1−θ1)L2(θ1,θ0;X)=p(X|θ1,θ0)=θ1Xθ01−XI2(θ1,θ0)=(1θ1001θ0)detI2(θ)=1θ1θ0=1θ1(1−θ1) \begin{align} \mathcal{L}_2(\theta_1,\theta_0;X) &= p(\left.X\right|\theta_1,\theta_0) = \theta_1^{X}\theta_0^{1-X} \\ \mathcal{I}_2(\theta_1,\theta_0) &= \left( \begin{matrix} \frac{1}{\theta_1} & 0 \\ 0 & \frac{1}{\theta_0} \end{matrix} \right) \\ \det \mathcal{I}_2(\theta) &= \frac{1}{\theta_1 \theta_0} = \frac{1}{\theta_1 (1-\theta_1)} \end{align} …


3
是否有偏度和峰度的标准化等效项?
与数据具有相同单位的与偏度的归一化等价是什么?同样,标准化的等同于峰度是什么?理想情况下,这些函数相对于数据应该是线性的,这意味着如果将所有观测值乘以一个因子n,则将结果归一化的偏度和峰度将乘以相同的因子n。具有这样的归一化等效项的好处是能够将它们覆盖在标准箱须图的顶部。

1
在统计假设检验中,原假设 H0H0H_0 通常采用(至少在我读过的书中)的形式: H0:H0:θ=θ0θ≤θ0H0:θ=θ0H0:θ≤θ0 \begin{align*} H_0:&\theta=\theta_0\\ H_0:&\theta\le\theta_0 \end{align*} 要么 H0:θ1≤θ≤θ2H0:θ1≤θ≤θ2 H_0:\theta_1\le\theta\le\theta_2 只是约定俗成的 H0H0H_0关闭了吗?还是还有其他原因?

2
当解释变量之一可能具有二次项和三次项时,我该如何建模?
我衷心希望我对这个问题的表述方式能够得到明确的回答-如果没有,请让我知道,我会再试一次!我还应该注意,我将使用R进行这些分析。 我plant performance (Ys)怀疑有几种措施受到了我实施的四种治疗的影响- flower thinning (X1), fertilization (X2), leaf clipping (X3)和biased flower thinning (X4)。对于所有可能的Y,N至少为242,因此我的样本量很大。所有地块都进行了稀疏或不间断处理,但每个地块也经历了其他三种处理方式中的一种(也只有一种)(或没有,也有对照地块)。该设计的目的是测试其他三种处理是否能够“掩盖”或“增强”细化效果。因此,通过设计,后三种处理(X2-X4)不能相互作用彼此,因为他们没有交叉,但他们可以每疏花互动-他们可能会做。 我的明确假设是:1)开花稀疏将很重要,并且2)X1*X2, X1*X3, and X1*X4,花卉稀疏与其他三种处理之间的相互作用项也将很重要。就是说,疏花应该很重要,但是其他三种处理方式却应该大大改变疏花的方式。 我想将所有这些信息包括在混合模型中: Y ~ X0 + X1 + X2 + X3 + X4 + X1*X2 + X1*X3 + X1*X4 + (Up to three random effects) 但是有一个困扰:我有充分的理由相信细化对Y的影响是非线性的。它们可能是二次方的,但在某些情况下甚至可能是三次方的。这是因为细化对性能的影响很可能在更高的细化水平下更快地增加。如果我尝试通过为X1添加二次项和三次项来通过上述等式对这种非线性关系进行建模,那么我不确定如何对交互项进行建模-我应该包括X1的所有可能组合(X1)^ 2,以及(X1)^ 3 * X2,X3和X4?因为即使有我拥有的数据点的数量,这似乎也要尝试估计很多参数,而且我不确定如何解释得到的结果。就是说,我没有生物学上的理由认为这将是对情况进行建模的不明智的方式。 因此,对于如何解决此问题,我有三点想法: 首先拟合一个较小的模型,例如Y …

1
有关电话簿中采样示例的参考
我今天和某人谈论抽样问题,并且隐约记得一个故事,该故事涉及一位非常受尊敬的统计学家,建议在特定法律案件中从电话簿中进行系统抽样。我记得这个故事就像法官在法庭上对他说的话,例如“我不太了解统计信息,但我确实知道对第100个姓名进行抽样并不正确”,然后他不得不向法官解释说实际上,他曾建议这样做。 有人知道这个故事的来历吗,或者我记得正确吗?我想刷新我对上下文的记忆。感觉就像我在Mosteller的回忆录中读到的东西一样,但是经过检查却在那儿找不到。此外,我们部门的某人说听起来很熟悉,并认为可能是科克伦,还有其他人想起了乔治·科布(George Cobb)讲过类似的故事,但这对我的搜索也没有帮助。

2
是否有一种优雅/有见地的方式来理解多个对象的线性回归身份
在线性回归中,我遇到了一个令人愉快的结果:如果我们拟合模型 E[Y]=β1X1+β2X2+c,E[Y]=β1X1+β2X2+c,E[Y] = \beta_1 X_1 + \beta_2 X_2 + c, 然后,如果我们标准化并居中 YYY, X1X1X_1 和 X2X2X_2 数据, R2=Cor(Y,X1)β1+Cor(Y,X2)β2.R2=Cor(Y,X1)β1+Cor(Y,X2)β2.R^2 = \mathrm{Cor}(Y,X_1) \beta_1 + \mathrm{Cor}(Y, X_2) \beta_2. 在我看来,这就像是2个变量的版本 R2=Cor(Y,X)2R2=Cor(Y,X)2R^2 = \mathrm{Cor}(Y,X)^2 对于 y=mx+cy=mx+cy=mx+c 回归,这是令人愉快的。 但是,我所知道的唯一证据无论如何都不具有建设性或洞察力(请参阅下文),但纵观它,似乎应该容易理解。 范例想法: 的 β1β1\beta_1 和 β2β2\beta_2 参数给我们的“比例” X1X1X_1 和 X2X2X_2 在 YYY,因此我们采用各自比例的相关性... 的 ββ\betas是偏相关, R2R2R^2 是平方多重相关...相关乘以部分相关... 如果我们先正交化,那么 ββ\betas将是 Cov/VarCov/Var\mathrm{Cov}/\mathrm{Var}...这个结果在某种程度上讲几何意义吗? …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.