统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
为什么我们要使用残差来检验回归误差的假设?
假设我们有一个模型Yi=β0+β1Xi1+β2Xi2+⋯+βkXik+ϵiYi=β0+β1Xi1+β2Xi2+⋯+βkXik+ϵiY_i = \beta_0 + \beta_1X_{i1} + \beta_2X_{i2} + \dots + \beta_kX_{ik} + \epsilon_i。 回归有许多假设,例如误差ϵiϵi\epsilon_i应该以均值为零和恒定方差的正态分布。我被教导要检查使用正常的QQ阴谋测试残差的常态这些假设ei=Yi−Y^iei=Yi−Y^ie_i = Y_i - \hat{Y}_i和残差对拟合曲线图,以检查残差与不断变化而改变零附近。 但是,这些测试全部针对残差,而不是误差。 据我所知,误差被定义为每个观察值与其“真实”平均值的偏差。因此,我们可以写ϵi=Yi−E[Yi]ϵi=Yi−E[Yi]\epsilon_i = Y_i - \mathbb{E}[Y_i]。我们无法观察到这些错误。* 我的问题是:残差在模仿错误方面做得如何? 如果对残差似乎满足假设,是否也就对误差也满意?还有其他(更好)的方法来测试假设吗,例如将模型拟合到测试数据集并从中获取残差? *此外,这是否不需要正确指定模型?也就是说,响应确实有与预测的关系在该模型中指定的方式等。X1,X2,X1,X2,X_1, X_2, 如果我们缺少某些预测(比方说,),则期望ë [ ÿ 我 ] = β 0 + β 1 X 我1 + β 2 X 我2 + ⋯ + β …

4
如何使用Python统计证明列是否具有分类数据
我在python中有一个数据框,我需要在其中查找所有类别变量。检查列的类型并不总是可行的,因为int类型也可以是分类的。 因此,我在寻找正确的假设检验方法以识别列是否为分类方面寻求帮助。 我正在尝试进行卡方检验以下的测试,但是我不确定这是否足够好 import numpy as np data = np.random.randint(0,5,100) import scipy.stats as ss ss.chisquare(data) 请指教。


3
大型数据集的高斯过程回归
我一直在从在线视频和讲义中学习有关高斯过程回归的知识,我的理解是,如果我们有一个包含个点的数据集,那么我们就假设数据是从维多元高斯模型中采样的。所以我的问题是在是百万分之一的情况下,高斯过程回归仍然有效吗?内核矩阵会不会很大,从而使过程完全无效?如果是这样,是否有适当的技术来处理此问题,例如多次重复从数据集中采样?处理这类案件有哪些好的方法? ññnññnññn

2
AlphaZero纸中Dirichlet噪声的目的
在DeepMind的AlphaGo Zero和AlphaZero论文中,他们描述了在蒙特卡洛树搜索中,将Dirichlet噪声添加到根节点(板状态)的先验概率上: 通过将Dirichlet噪声添加到根节点的先验概率来实现额外的探索,特别是,其中和\ varepsilon = 0.25 ; 这种噪音确保可以尝试所有动作,但是搜索可能仍会否决不良动作。 P (小号,一)= (1 - ε )p 一个 + ε η 一个 η 〜风向(0.03 )ε = 0.25s0s0s_0P(s,a)=(1−ε)pa+εηaP(s,a)=(1−ε)pa+εηaP(s, a) = (1−\varepsilon)p_a+ \varepsilon \eta_aη∼Dir(0.03)η∼Dir(0.03)\eta \sim \text{Dir}(0.03)ε=0.25ε=0.25\varepsilon = 0.25 (AlphaGo零) 和: Dirichlet噪声Dir(α)Dir(α)\text{Dir}(\alpha)已添加到根节点中的先验概率;这与典型位置中合法移动的近似数量成反比例,即α={0.3,0.15,0.03}α={0.3,0.15,0.03}\alpha = \{0.3, \; 0.15, \; 0.03\}用于国际象棋,将棋和围棋。 (零零) 我不明白的两件事: P(s, a)是维向量。是的简写与狄利克雷分布参数,每个的值是?风向(α )ñ αnnnDir(α)Dir(α)\text{Dir}(\alpha)nnnαα\alpha 我只遇到Dirichlet作为多项式分布的共轭形式。为什么在这里挑选呢? 就上下文而言,P(s, …

5
条件概率-它们是贝叶斯主义独有的吗?
我想知道条件概率是贝叶斯主义所独有的,还是更多地是统计学家/统计学家/概率论者之间在几种思想流派中所共有的一般概念。 我以为是这样,因为我假设没有人可以是逻辑上的,所以我认为常客主义者至少在理论上会同意,同时警告不要使用贝叶斯主义推断更多是出于实际原因,而不是由于条件概率。p(A,B)=p(A|B)p(B)p(A,B)=p(A|B)p(B)p(A,B) = p(A|B)p(B)

2
单位为高斯的KL损失
我一直在执行VAE,并且在网上注意到简化的单变量高斯KL散度的两种不同实现。原始发散按照这里是 如果我们假设我们事先是单位高斯即μ2=0和σ2=1,这简化向下 ķ大号升ö小号小号=-日志(σ1)+σ 2 1 +μ 2 1ķ大号升Ø 小号小号= 日志(σ2σ1个)+ σ21个+ (μ1个- μ2)22个σ22− 12KLloss=log⁡(σ2σ1)+σ12+(μ1−μ2)22σ22−12 KL_{loss}=\log(\frac{\sigma_2}{\sigma_1})+\frac{\sigma_1^2+(\mu_1-\mu_2)^2}{2\sigma^2_2}-\frac{1}{2} μ2= 0μ2=0\mu_2=0σ2= 1σ2=1\sigma_2=1 这就是我的困惑所在。尽管我发现上述实现有一些晦涩的github仓库,但我更常用的是:ķ大号升Ø 小号小号= - 日志(σ1个)+ σ21个+ μ21个2− 12KLloss=−log⁡(σ1)+σ12+μ122−12 KL_{loss}=-\log(\sigma_1)+\frac{\sigma_1^2+\mu_1^2}{2}-\frac{1}{2} ķ大号升Ø 小号小号= - 12(2 日志(σ1个)- σ21个- μ21个+ 1 )KLloss=−12(2log⁡(σ1)−σ12−μ12+1) KL_{loss}=-\frac{1}{2}(2\log(\sigma_1)-\sigma_1^2-\mu_1^2+1) = - 12(日志(σ1个)- σ1个- μ21个+ 1 )=−12(log⁡(σ1)−σ1−μ12+1) =-\frac{1}{2}(\log(\sigma_1)-\sigma_1-\mu^2_1+1) 例如在官方Keras自动编码器教程中。我的问题是,这两者之间我想念什么?主要区别是在对数项上降低因子2,而不是对方差求平方。从分析上讲,我成功地使用了后者,以获取其价值。在此先感谢您的帮助!

3
是独立的变量时分布
作为常规练习,我试图找到的分布,其中 和是独立的随机变量。X2+Y2−−−−−−−√X2+Y2\sqrt{X^2+Y^2}XXXYYYU(0,1)U(0,1) U(0,1) 的联合密度为 (X,Y)(X,Y)(X,Y)fX,Y(x,y)=10&lt;x,y&lt;1fX,Y(x,y)=10&lt;x,y&lt;1f_{X,Y}(x,y)=\mathbf 1_{0\cos^{-1}\left(\frac{1}{z}\right)cosθcos⁡θ\cos\thetaθ∈[0,π2]θ∈[0,π2]\theta\in\left[0,\frac{\pi}{2}\right]zsinθ&lt;1⟹θ&lt;sin−1(1z)zsin⁡θ&lt;1⟹θ&lt;sin−1⁡(1z)z\sin\theta<1\implies\theta<\sin^{-1}\left(\frac{1}{z}\right)sinθsin⁡θ\sin\thetaθ∈[0,π2]θ∈[0,π2]\theta\in\left[0,\frac{\pi}{2}\right] 因此,对于1&lt;z&lt;2–√1&lt;z&lt;21< z<\sqrt 2,我们有cos−1(1z)&lt;θ&lt;sin−1(1z)cos−1⁡(1z)&lt;θ&lt;sin−1⁡(1z)\cos^{-1}\left(\frac{1}{z}\right)<\theta<\sin^{-1}\left(\frac{1}{z}\right)。 变换的雅可比的绝对值为|J|=z|J|=z|J|=z 因此(Z,Θ)(Z,Θ)(Z,\Theta)的联合密度由下式给出 fZ,Θ(z,θ)=z1{z∈(0,1),θ∈(0,π/2)}⋃{z∈(1,2√),θ∈(cos−1(1/z),sin−1(1/z))}fZ,Θ(z,θ)=z1{z∈(0,1),θ∈(0,π/2)}⋃{z∈(1,2),θ∈(cos−1⁡(1/z),sin−1⁡(1/z))}f_{Z,\Theta}(z,\theta)=z\mathbf 1_{\{z\in(0,1),\,\theta\in\left(0,\pi/2\right)\}\bigcup\{z\in(1,\sqrt2),\,\theta\in\left(\cos^{-1}\left(1/z\right),\sin^{-1}\left(1/z\right)\right)\}} 积分θθ\theta,我们得到ZZZ的pdf 为 fZ(z)=πz210&lt;z&lt;1+(πz2−2zcos−1(1z))11&lt;z&lt;2√fZ(z)=πz210&lt;z&lt;1+(πz2−2zcos−1⁡(1z))11&lt;z&lt;2f_Z(z)=\frac{\pi z}{2}\mathbf 1_{0\sqrt 2 \end{cases} 看起来像正确的表达。对于情况微分会带来一个表达式,该表达式不易简化为我已经获得的pdf。FZFZF_Z1&lt;z&lt;2–√1&lt;z&lt;21< z<\sqrt 2 最后,我认为我具有CDF的正确图片: 对于:0&lt;z&lt;10&lt;z&lt;10

3
当输入条件独立时,超平面可以对数据进行最佳分类-为什么?
在名为“ 深度学习和信息瓶颈原理”的论文中,作者在II A)节中指出: 单神经元只能对线性可分离的输入进行分类,因为它们只能在其输入空间实现超平面。当输入是独立的时,超平面可以对数据进行最佳分类。u=wh+bu=wh+bu = wh+b 为了说明这一点,他们得出以下结论。使用贝叶斯定理,他们得到: (1)p(y|x)=11+exp(−logp(x|y)p(x|y′)−logp(y)p(y′))p(y|x)=11+exp(−logp(x|y)p(x|y′)−logp(y)p(y′))p(y|x) = \frac{1}{1 + exp(-log\frac{p(x|y)}{p(x|y')} -log\frac{p(y)}{p(y')})} 其中是输入,y是类别,y '是预测类别(我假设,y '未定义)。继续,他们说:xxxyyyy′y′y'y′y′y' (2)p(x|y)p(x|y′)=∏Nj=1[p(xj|y)p(xj|y′)]np(xj)p(x|y)p(x|y′)=∏j=1N[p(xj|y)p(xj|y′)]np(xj)\frac{p(x|y)}{p(x|y')} = \prod^N_{j=1}[\frac{p(x_j|y)}{p(x_j|y')}]^{np(x_j)} 其中是输入维度,n不确定(同样,两者均未定义)。考虑一个S型神经元,S型激活函数σ (u )= 1NNNnnn和预激活u,将(2)插入(1)后,我们得到最佳权重值wj=logp(xj|y)σ(u)=11+exp(−u)σ(u)=11+exp(−u)\sigma(u) = \frac{1}{1+exp(-u)}uuu和b=logp(y)wj=logp(xj|y)p(xj|y′)wj=logp(xj|y)p(xj|y′)w_j = log\frac{p(x_j|y)}{p(x_j|y')},当输入值ħĴ=Ñp(XĴ)。b=logp(y)p(y′)b=logp(y)p(y′)b=log\frac{p(y)}{p(y')}hj=np(xj)hj=np(xj)h_j=np(x_j) 现在我的问题。我知道将(2)插入(1)会导致最佳权重和输入值。我不明白的是以下内容:w,b,hw,b,hw,b,h (1)如何使用贝叶斯定理导出? (2)如何得出?什么是?它是什么意思?我认为这与条件独立性有关nnn 即使x的尺寸是有条件独立的,如何能说出x等于其缩放的概率?(即如何陈述?)hj=np(xj)hj=np(xj)h_j=np(x_j) 编辑:变量是一个二进制类变量。据此,我认为y '是“其他”类。这将解决问题1.您是否同意?yyyy′y′y'

1
ARIMA vs Kalman过滤器-它们如何相关
当我开始阅读有关卡尔曼滤波器的文章时,它认为这是ARIMA模型的一种特例(即ARIMA(0,1,1))。但实际上似乎情况更加复杂。首先,ARIMA可用于预测,而卡尔曼滤波器可用于滤波。但是它们不是紧密相关吗? 问题: ARIMA和卡尔曼滤波器之间是什么关系?一个正在使用另一个吗?是另一种特例吗?

1
添加线性回归预测变量可减小R平方
我的数据集()具有因变量(DV),五个独立的“基准”变量(P1,P2,P3,P4,P5)和一个独立的关注变量(Q)。N≈10,000N≈10,000N \approx 10,000 我为以下两个模型运行了OLS线性回归: DV ~ 1 + P1 + P2 + P3 + P4 + P5 -&gt; R-squared = 0.125 DV ~ 1 + P1 + P2 + P3 + P4 + P5 + Q -&gt; R-squared = 0.124 即,添加预测变量Q减少了线性模型中解释的方差量。据我了解,这不应该发生。 明确地说,这些是R平方值,而不是调整后的R平方值。 我已经使用Jasp和Python的statsmodels验证了R平方值。 有什么理由可以看到这种现象吗?也许与OLS方法有关的东西?

1
为什么随机傅立叶特征非负?
随机傅里叶特征提供了内核函数的近似值。它们用于各种内核方法,例如SVM和高斯进程。 今天,我尝试使用TensorFlow实现,但我的一半功能却得到了负值。据我了解,这不应该发生。 因此,我回到了原论文上,就像我期望的那样,该论文说这些功能应该存在于[0,1]中。但是它的解释(在下面突出显示)对我来说没有意义:余弦函数可以在[-1,1]中的任何位置产生值,并且显示的大多数点都具有负余弦值。 我可能缺少明显的东西,但是如果有人可以指出它是什么,我将不胜感激。

3
如果是有限的,吗?
对于连续随机变量XXX,如果E(|X|)E(|X|)E(|X|)是有限的,则limn→∞nP(|X|&gt;n)=0limn→∞nP(|X|&gt;n)=0\lim_{n\to\infty}n P(|X|>n)=0吗? 这是我在互联网上发现的一个问题,但是我不确定它是否成立。 我知道nP(|X|&gt;n)&lt;E(|X|)nP(|X|&gt;n)&lt;E(|X|)n P(|X|>n)

1
离群值和离群值之间的区别
我偶然发现了LOF度量中的“离群值”一词(局部离群值因子),我对离群值一词很熟悉(基本上是说谎者-实例不像其余实例那样)。 在异常检测的情况下,“ Inliers”是什么意思?以及它与异常值有何关系?


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.