统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
该估计量的方差是多少
我想估计函数f的平均值,即 ,其中和是独立随机变量。我有f的样本,但没有iid:有iid样本,每个有来自样本:EX,Y[f(X,Y)]EX,Y[f(X,Y)]E_{X,Y}[f(X,Y)]XXXYYYY1,Y2,…YnY1,Y2,…YnY_1,Y_2,\dots Y_nYiYiY_ininin_iXXXXi,1,Xi,2,…,Xi,niXi,1,Xi,2,…,Xi,niX_{i,1},X_{i,2},\dots, X_{i,n_i} 所以总共我有样本f(X1,1,Y1)…f(X1,n1,Y1)…f(Xi,j,Yi)…f(Xn,nn,Yn)f(X1,1,Y1)…f(X1,n1,Y1)…f(Xi,j,Yi)…f(Xn,nn,Yn)f(X_{1,1},Y_1) \dots f(X_{1,n_1},Y_1 ) \dots f(X_{i,j},Y_i) \dots f(X_{n,n_n},Y_n) 为了估计平均值,我计算 显然,所以是一个无偏估计量。我现在想知道什么是,即估计量的方差是多少。μ=∑i=1n1/n∗∑j=1nif(Xi,j,Yi)niμ=∑i=1n1/n∗∑j=1nif(Xi,j,Yi)ni\mu=\sum_{i=1}^n 1/n * \sum_{j=1}^{n_i}\frac{ f(X_{i,j},Y_i)}{n_i}EX,Y[μ]=EX,Y[f(X,Y)]EX,Y[μ]=EX,Y[f(X,Y)]E_{X,Y}[\mu]=E_{X,Y}[f(X,Y)]μμ\muVar(μ)Var(μ)Var(\mu) 编辑2:这是正确的方差吗? 它似乎在极限中起作用,即,如果n = 1且所有则方差仅成为均值的方差。如果该公式成为估计量方差的标准公式。它是否正确?我如何证明它是? Var(μ)=VarY(μi)n+∑i=1nVarX(f(X,Yi)))ni∗n2Var(μ)=VarY(μi)n+∑i=1nVarX(f(X,Yi)))ni∗n2Var(\mu)=\frac{Var_Y(\mu_i)}{n}+\sum_{i=1}^n \frac{Var_X(f(X,Y_i)))}{n_i*n^2}ni=∞ni=∞n_i=\inftyni=1ni=1n_i=1 编辑(忽略此内容): 因此,我想我取得了一些进展:让我们首先定义,这是对。μi=∑nij=1f(Xi,j,Yi)niμi=∑j=1nif(Xi,j,Yi)ni\mu_i=\sum_{j=1}^{n_i}\frac{ f(X_{i,j},Y_i)}{n_i}EX[f(X,Yi)]EX[f(X,Yi)]E_X[f(X,Y_i)] 使用方差的标准公式,我们可以编写: Var(μ)=1/n2∑l=1n∑k=1nCov(μl,μk)Var(μ)=1/n2∑l=1n∑k=1nCov(μl,μk)Var(\mu)=1/n^2 \sum_{l=1}^n \sum_{k=1}^n Cov(\mu_l,\mu_k) 可以简化为 和因为是独立绘制的,所以我们可以进一步简化为 并且对于协方差: 1/n2(∑i=1nVar(μl)+1/n2∑l=1n∑k=l+1n2∗Cov(μl,μk))1/n2(∑i=1nVar(μl)+1/n2∑l=1n∑k=l+1n2∗Cov(μl,μk))1/n^2( \sum_{i=1}^n Var(\mu_l)+ 1/n^2\sum_{l=1}^n \sum_{k=l+1}^n 2*Cov(\mu_l,\mu_k))XijXijX_{ij}1/n2(∑i=1n1/niVar(f(Xi,j,Yi))+1/n2∑l=1n∑k=l+1n2∗Cov(μl,μk))1/n2(∑i=1n1/niVar(f(Xi,j,Yi))+1/n2∑l=1n∑k=l+1n2∗Cov(μl,μk))1/n^2( \sum_{i=1}^n 1/n_i Var(f(X_{i,j},Y_i))+1/n^2 \sum_{l=1}^n \sum_{k=l+1}^n 2*Cov(\mu_l,\mu_k))Cov(μl,μk)=Cov(∑j=1nlf(Xj,l,Yl)nl,∑j=1nkf(Xj,k,Yk)nk)=1(nk∗nl)∗Cov(∑j=1nlf(Xj,l,Yl),∑j=1nkf(Xj,k,Yk))=1(nk∗nl)∗∑j=1nl∑j=1nkCov(f(X,Yl),f(X,Yk))=nk∗nl(nk∗nl)Cov(f(Xi,l,Yl),f(Xi,k,Yk))=Cov(f(X,Yl),f(X,Yk))Cov(μl,μk)=Cov(∑j=1nlf(Xj,l,Yl)nl,∑j=1nkf(Xj,k,Yk)nk)=1(nk∗nl)∗Cov(∑j=1nlf(Xj,l,Yl),∑j=1nkf(Xj,k,Yk))=1(nk∗nl)∗∑j=1nl∑j=1nkCov(f(X,Yl),f(X,Yk))=nk∗nl(nk∗nl)Cov(f(Xi,l,Yl),f(Xi,k,Yk))=Cov(f(X,Yl),f(X,Yk))\begin{align} Cov(\mu_l,\mu_k)&=Cov(\sum_{j=1}^{n_l} \frac{f(X_{j,l},Y_l)}{n_{l}},\sum_{j=1}^{n_k} \frac{f(X_{j,k},Y_k)}{n_{k}})\\ …

1
有哪些方法可以调整图形内核SVM超参数?
我有一些数据存在于图。顶点属于两个类别之一Ÿ 我 ∈ { - 1 ,1 },我很感兴趣,训练的SVM两个类之间进行区分。这样做的一个适当的内核是扩散核,其中,是拉普拉斯的和是调谐参数。G=(V,E)G=(V,E)G=(V,E)yi∈{−1,1}yi∈{−1,1}y_i\in\{-1,1\}K=exp(−βL),K=exp⁡(−βL),K=\exp(-\beta L),LLLGGGββ\beta 调整SVM需要选择超参数,因此我必须调整按照惯例,我们对这个问题使用交叉验证,但是在这里似乎不合适,因为从删除顶点改变整个图,甚至可能增加连接的组件的数量!如果连接的组件的数量发生变化,则某些顶点将变得无法与其他顶点联系,并且我们将面临与开始时非常不同的数据集。也就是说,我们不仅会丢失已删除的顶点,而且还会丢失关于图形中与该顶点相邻的所有其他顶点信息。θ=(β,C).θ=(β,C).\theta=(\beta, C).iiiGGGiiijjj 交叉验证的基本概念是,我们想近似模型在被提供新数据时的性能。在标准问题中,省略某些测试数据不会更改其余训练数据的值。但是,对于图形数据,不清楚模型在CV设置中看到“新”数据的含义。省略顶点或边可能会完全更改数据。例如,设想的图表这是一个 -star曲线图,其中一个顶点有边缘顶点,和所有其他顶点具有1个边缘。省略中心顶点以构造训练数据S=(VS,ES)S=(VS,ES)S=(V_S,E_S)kkkkkkkkkS∗S∗S^*将完全断开图形,并且内核矩阵将是对角的!但是当然可以在提供的训练数据上训练模型。尚不清楚的是,然后测试所得模型的样本外性能意味着什么。是否可以重新计算的内核矩阵,并提供该矩阵以进行预测?S∗S∗S^*SSS 或者,是否可以从整体上计算的内核矩阵开始,并根据需要省略行和列以产生用于估计SVM的内核矩阵?这提出了自己的概念性问题,因为在S中包含中心节点意味着每个顶点都可以从其他每个顶点到达,并且内核矩阵密集。这种包含是否意味着跨折存在信息泄漏,并使交叉验证输出偏斜?一方面,由于省略的中央节点使图相连,因此仍然存在有关省略的中央节点的数据。另一方面,我们对标签y一无所知SSSSSS yÿy ,因此我们可以从以这种方式执行CV得到合理无偏的样本外估计中感到满意。 如何针对此类问题选择超参数?简历不完美但可以接受,还是我们需要专门的方法?在我的上下文中,是否甚至可以进行超参数调整?


2
平均数据然后拟合与拟合数据然后平均之间的差异
如果有,则在将一条线拟合到多个单独的“实验”之间进行平均,然后对拟合进行平均,或者对来自单独实验的数据进行平均,然后对平均数据进行拟合。让我详细说明: 我执行计算机仿真,生成一条曲线,如下所示。我们提取一个数量,通过拟合图的线性区域(长时间)将其称为“ A”。该值只是线性区域的斜率。当然,与线性回归有关的误差。 我们通常在不同的初始条件下运行100个左右的模拟,以计算平均值“ A”。有人告诉我,最好将原始数据(如下图所示)平均分成10组,然后拟合“ A”,然后再对这10个“ A”进行平均。 我没有直觉可言,它是否有任何优点,或者比拟合100个单独的“ A”值取平均值还要好。
10 error  fitting  average 

3
G检验与Pearson的卡方检验
我在列联表中测试独立性。我不知道G检验或Pearson的卡方检验是否更好。样本数量为数百,但单元格计数较低。如Wikipedia页面所述,对于G检验,卡方分布的近似值比对Pearson的卡方检验更好。但是我正在使用蒙特卡洛模拟来计算p值,所以这两个测试之间有什么区别吗?ñ× Mñ×中号N \times M

4
给定n个均匀分布的r.v,那么一个rv的PDF除以所有n个r.v的总和是多少?
我对以下类型的情况感兴趣:有n个连续的随机变量,这些变量的总和必须为1。那么任何一个这样的变量的PDF将是什么?因此,如果n=3n=3n=3,那么我对X 1的分布感兴趣X1X1+X2+X3X1X1+X2+X3\frac{X_1}{X_1+X_2+X_3},其中X1,X2X1,X2X_1, X_2和X3X3 X_3 均均匀分布。平均,当然,在这个例子中,1/31/31/3,作为平均只有1/n1/n1/n,虽然很容易R中模拟的分布,我不知道是什么的PDF或CDF实际方程式。 这种情况与Irwin-Hall分布( https://en.wikipedia.org/wiki/Irwin%E2%80%93Hall_distribution)有关。只有Irwin-Hall是n个均匀随机变量之和的分布,而我想将n个均匀rv之一除以所有n个变量之和的分布。谢谢。
10 uniform 

2
神经网络中的交叉熵代价函数
我正在看本教程中发现的交叉熵成本函数: C=−1n∑x[ylna+(1−y)ln(1−a)]C=−1n∑x[yln⁡a+(1−y)ln⁡(1−a)]C = -\frac{1}{n} \sum_x [y \ln a+(1−y)\ln(1−a)] 我们到底要总结什么?当然,过,但和不改变。所有的的被输入到所述一个。 甚至在方程以上段落中,因为所有的和的函数来定义的和的。 xxxyyyaaaxxxxxxaaaaaawwwxxx 另外,定义为输入到该特定神经元的数量,对吗?它被表述为“训练数据项的总数”。nnn 编辑: 我认为正确吗 C=−1n∑x[ylna+(1−y)ln(1−a)]C=−1n∑x[yln⁡a+(1−y)ln⁡(1−a)]C= -\frac{1}{n} \sum_x [y \ln a+(1−y)\ln(1−a)] 将是整个网络的成本函数,而 C=[ylna+(1−y)ln(1−a)]C=[yln⁡a+(1−y)ln⁡(1−a)]C = [y \ln a+(1−y)\ln(1−a)] 单个神经元的成本是多少?总和不应该超过每个输出神经元吗?

3
为什么要在逻辑回归中对分类预测变量进行WOE转换?
类别变量的证据权重(WOE)转换何时有用? 该示例可以在WOE转换中看到 (因此,对于一个响应,&与分类预测类,& 成功出试验的内个这种预测器的类别,对于所述WOE个类别被定义为k y j n j j jÿÿyķķkÿĴÿĴy_jñĴñĴn_jĴĴjĴĴj 日志ÿĴ∑ķĴÿĴ∑ķĴ(nĴ- ÿĴ)ñĴ- ÿĴ日志⁡ÿĴ∑ĴķÿĴ∑Ĵķ(ñĴ-ÿĴ)ñĴ-ÿĴ\log \frac{y_j} {\sum_j^k {y_j}} \frac{\sum_j^k (n_j-y_j)}{n_j-y_j} &转换包括使用其WOE对分类预测器的每个类别进行编码,以形成新的连续预测器。) 我想了解WOE转换有助于逻辑回归的原因。这背后的理论是什么?

1
期望值是分位数的函数吗?
我想知道哪里有一个通用公式将连续随机变量的期望值与相同rv的分位数相关联的期望值定义为: 并将分位数定义为: 对于。È (X )= ∫ X d ˚F X(X )Q p X = { X :˚F X(X )= p } = ˚F - 1 X(p )p ∈ (0 ,1 )XXX Ë(X)= ∫X dFX(x )Ë(X)=∫XdFX(X)E(X) = \int x dF_X(x) 问pX= { x :FX(x )= p } = F− 1X(p )问Xp={X:FX(X)=p}=FX-1个(p)Q^p_X …

1
大规模PCA甚至可能吗?
主成分分析(PCA)的经典方法是在输入数据矩阵上进行,列的均值为零(然后PCA可以“最大化方差”)。通过将列居中可以轻松实现。但是,当输入矩阵稀疏时,居中的矩阵现在将变得稀疏,并且-如果矩阵很大,则不再适合内存。有针对存储问题的算法解决方案吗?

1
找到独特的MVUE
该问题来自Robert Hogg的《数理统计入门》第六版问题7.4.9,第388页。 令用pdf在其他地方为零,其中。X1,...,XnX1,...,XnX_1,...,X_nf(x;θ)=1/3θ,−θ&lt;x&lt;2θ,f(x;θ)=1/3θ,−θ&lt;x&lt;2θ,f(x;\theta)=1/3\theta,-\theta0 (a)求MLE的θ^θ^\hat{\theta}θθ\theta (b)足够用于统计?为什么呢θ^θ^\hat{\theta}θθ\theta (c)是的唯一MVUE 吗?为什么呢(n+1)θ^/n(n+1)θ^/n(n+1)\hat{\theta}/nθθ\theta 我想我可以解决(a)和(b),但是我对(c)感到困惑。 为一个): 令为订单统计信息。Y1&lt;Y2&lt;...YnY1&lt;Y2&lt;...YnY_10 因此,似然函数正在减小。L(θ;x)L(θ;x)L(\theta;x) 从和, 和 (−θ&lt;y1(−θ&lt;y1(-\theta< y_1 yn&lt;2θ)yn&lt;2θ) y_n < 2\theta)⇒⇒\Rightarrow (θ&gt;−y1(θ&gt;−y1(\theta>-y_1 θ&gt;yn/2),⇒θ&gt;max(−y1,yn/2)θ&gt;yn/2),⇒θ&gt;max(−y1,yn/2)\theta>y_n/2), \Rightarrow \theta>max(-y_1,y_n/2) L(θ,x)L(θ,x)L(\theta,x)被降低,因此,当具有samllest值似然函数将达到最大,因为,当,似然函数将达到最大值。θθ\thetaθ&gt;max(−y1,yn/2)θ&gt;max(−y1,yn/2)\theta>max(-y_1,y_n/2)θ=max(−y1,yn/2)θ=max(−y1,yn/2)\theta=max(-y1,y_n/2) ∴∴\therefore theremleθ^=max(−y1,yn/2)θ^=max(−y1,yn/2)\hat{\theta}=max(-y_1,y_n/2) 对于(b): f(x1;θ)f(x2;θ)...f(xn;θ)=1(3θ)n∏niI(−θ&lt;xi&lt;2θ)=1(3θ)nI(max(xi)&lt;2θ)×1f(x1;θ)f(x2;θ)...f(xn;θ)=1(3θ)n∏inI(−θ&lt;xi&lt;2θ)=1(3θ)nI(max(xi)&lt;2θ)×1f(x_1;\theta)f(x_2;\theta)...f(x_n;\theta)=\frac{1}{(3\theta)^n}\prod_{i}^{n} I(-\theta-\theta)\times 1 ∴∴\therefore通过Neyman的因式分解定理,对于是足够的统计量。因此,也是足够的统计信息。y1=min(xi)y1=min(xi)y_1=min(x_i)θθ\theta−y1−y1-y_1 对于(c): 首先,我们找到的CDFXXX F(x)=∫x−θ13θdt=x+θ3θ,−θ&lt;x&lt;2θF(x)=∫−θx13θdt=x+θ3θ,−θ&lt;x&lt;2θF(x)=\int_{-\theta}^{x}\frac{1}{3\theta}dt=\frac{x+\theta}{3\theta},-\theta0 因此,pdf族已完成。Y1Y1Y_1 同样,仍然通过,我们可以证明pdf族是完整的。FTCFTCFTCYnYnY_n 现在的问题是,我们需要证明是无偏的。(n+1)θ^n(n+1)θ^n\frac{(n+1)\hat{\theta}}{n} 当θ^=−y1θ^=−y1\hat{\theta}=-y_1 E(−y1)=∫2θ−θ(−y1)n(3θ)n(2θ−y1)n−1dy1=1(3θ)n∫2θ−θy1d(2θ−y1)nE(−y1)=∫−θ2θ(−y1)n(3θ)n(2θ−y1)n−1dy1=1(3θ)n∫−θ2θy1d(2θ−y1)nE(-y_1)=\int_{-\theta}^{2\theta}(-y_1)\frac{n}{(3\theta)^n}(2\theta-y_1)^{n-1}dy_1=\frac{1}{(3\theta)^n}\int_{-\theta}^{2\theta}y_1d(2\theta-y_1)^n 我们可以通过零件积分来求解积分 E(−y1)=1(3θ)n[y1(2θ−y1)n∣2θ−θ−∫2θ−θ(2θ−y1)ndy1]=1(3θ)n[θ(3θ)n−(3θ)n+1n+1]=θ−3θn+1=(n−2)θn+1E(−y1)=1(3θ)n[y1(2θ−y1)n∣−θ2θ−∫−θ2θ(2θ−y1)ndy1]=1(3θ)n[θ(3θ)n−(3θ)n+1n+1]=θ−3θn+1=(n−2)θn+1E(-y_1)=\frac{1}{(3\theta)^n}[y_1(2\theta-y_1)^n\mid_{-\theta}^{2\theta}-\int_{-\theta}^{2\theta}(2\theta-y_1)^ndy_1]=\frac{1}{(3\theta)^n}[\theta (3\theta)^n-\frac{(3\theta)^{n+1}}{n+1}]=\theta-\frac{3\theta}{n+1}=\frac{(n-2)\theta}{n+1} ∴E((n+1)θ^n)=n+1nE(−y1)=n+1n(n−2)θn+1=n−2nθ∴E((n+1)θ^n)=n+1nE(−y1)=n+1n(n−2)θn+1=n−2nθ\therefore E(\frac{(n+1)\hat{\theta}}{n})=\frac{n+1}{n}E(-y_1)=\frac{n+1}{n}\frac{(n-2)\theta}{n+1}=\frac{n-2}{n}\theta 因此,当时,并非的无偏估计量(n+1)θ^n(n+1)θ^n\frac{(n+1)\hat{\theta}}{n}θθ\thetaθ^=−y1θ^=−y1\hat{\theta}=-y_1 当θ^=yn/2θ^=yn/2\hat{\theta}=y_n/2 E(Yn)=∫2θ−θynn(3θ)n(yn+θ)n−1dyn=1(3θ)n∫2θ−θynd(yn+θ)n=1(3θ)n[yn(yn+θ)n∣2θ−θ−∫2θ−θ(yn+θ)ndyn]=1(3θ)n[2θ(3θ)−(3θ)n+1n+1]=2θ−3θn+1=2n−1n+1θE(Yn)=∫−θ2θynn(3θ)n(yn+θ)n−1dyn=1(3θ)n∫−θ2θynd(yn+θ)n=1(3θ)n[yn(yn+θ)n∣−θ2θ−∫−θ2θ(yn+θ)ndyn]=1(3θ)n[2θ(3θ)−(3θ)n+1n+1]=2θ−3θn+1=2n−1n+1θE(Y_n)=\int_{-\theta}^{2\theta}y_n\frac{n}{(3\theta)^n}(y_n+\theta)^{n-1}dy_n=\frac{1}{(3\theta)^n}\int_{-\theta}^{2\theta}y_nd(y_n+\theta)^n=\frac{1}{(3\theta)^n}[y_n(y_n+\theta)^n\mid_{-\theta}^{2\theta}-\int_{-\theta}^{2\theta}(y_n+\theta)^ndy_n]=\frac{1}{(3\theta)^n}[2\theta(3\theta)^-\frac{(3\theta)^{n+1}}{n+1}]=2\theta-\frac{3\theta}{n+1}=\frac{2n-1}{n+1}\theta ∴E((n+1)θ^n)=n+1nE(Yn/2)=n+12nE(Yn)=n+12n2n−1n+1θ=2n−12nθ∴E((n+1)θ^n)=n+1nE(Yn/2)=n+12nE(Yn)=n+12n2n−1n+1θ=2n−12nθ\therefore E(\frac{(n+1)\hat{\theta}}{n})=\frac{n+1}{n}E(Y_n/2)=\frac{n+1}{2n}E(Y_n)=\frac{n+1}{2n}\frac{2n-1}{n+1}\theta=\frac{2n-1}{2n}\theta 不过,当时,并不是的无偏估计量(n+1)θ^n(n+1)θ^n\frac{(n+1)\hat{\theta}}{n}θθ\thetaθ^=yn/2θ^=yn/2\hat{\theta}=y_n/2 …

2
在没有仪器的情况下,关于观测数据的模型我们能说些什么?
过去,我曾在多个领域对发表的论文提出过一些问题,这些领域在观测数据(即非受控实验产生的数据)上使用了回归(以及相关模型,例如面板模型或GLM) ,在许多情况下-但并非总是-随时间推移观察到的数据),但没有尝试引入工具变量。 作为回应,我提出了许多批评(例如,当重要变量可能缺失时描述带有偏见的问题),但是由于此处的其他人无疑比我对这方面的知识要了解得多,我想问一下: 在这种情况下,试图得出有关关系的结论(特别是但不限于因果结论)有哪些主要问题/后果? 在没有仪器的情况下,适合此类模型的研究能做些有用的事情吗? 关于这种建模的问题有哪些好的参考文献(书或论文)(最好具有明显的非技术动机来进行后果分析,因为通常提出问询的人具有各种背景,有些人没有很多统计资料)一篇论文?用仪器讨论预防措施/问题也将很有用。 (有关工具变量的基本参考资料在此处,但是如果您要在其中添加任何内容,那也会有所帮助。) 指向发现和使用工具的良好实践示例的指针将是一个好处,但不是这个问题的中心。 [在出现此类问题时,我可能会在这里指出其他任何好的答案。我可能会添加一两个示例。]

1
使用随机森林进行建模是否需要交叉验证?
据我所见,人们对此的看法往往有所不同。最佳实践肯定会规定使用交叉验证(尤其是将RF与同一数据集上的其他算法进行比较时)。另一方面,原始消息来源指出,在模型训练期间计算出OOB误差这一事实足以说明测试集的性能。甚至特雷弗·哈斯提(Trevor Hastie)在最近的一次对话中都说“随机森林提供免费的交叉验证”。直观上,如果在一个数据集上训练并尝试改进基于RF的模型,这对我来说很有意义。 您对此有何看法?


1
在MCMC中管理高自相关
我正在为使用R和JAGS的元分析建立一个相当复杂的分层贝叶斯模型。简化了一下,该模型的两个关键级别具有 其中是的第观察研究终点(在这种情况下,是转基因作物与非转基因作物的产量),是研究的影响, s是各种研究水平变量的影响(通过函数族和索引完成了研究,作物种类,研究方法等)ÿ我Ĵ= αĴ+ ϵ一世ÿ一世Ĵ=αĴ+ϵ一世 y_{ij} = \alpha_j + \epsilon_i αĴ= ∑Hγh (j )+ ϵĴαĴ=∑HγH(Ĵ)+ϵĴ\alpha_j = \sum_h \gamma_{h(j)} + \epsilon_jÿ我Ĵÿ一世Ĵy_{ij}一世一世iĴĴjαĴαĴ\alpha_jĴĴjγγ\gammaHHhϵϵ\epsilons是错误术语。请注意,不是虚拟变量的系数。相反,对于不同的研究水平值,存在不同的变量。例如,有为发展中国家和发达国家。 γγ\gammaγγ\gammaγde v e l o p 我Ñ 克γdËvË升Øp一世ñG\gamma_{developing}γdÈ v Ë 升ö p ë dγdËvË升ØpËd\gamma_{developed} 我主要对估算的值感兴趣。这意味着从模型中删除研究级别的变量不是一个好的选择。 γγ\gamma 一些研究水平变量之间具有高度相关性,我认为这在我的MCMC链中产生了很大的自相关性。此诊断图说明了链轨迹(左)和所得的自相关(右): 自相关的结果是,我从4个每10,000个样本的链中获得了60-120的有效样本量。 我有两个问题,一个是客观的,另一个是主观的。 除了细化,添加更多链和使采样器运行更长时间之外,我还可以使用哪些技术来管理此自相关问题?“管理”是指“在合理的时间内得出合理的估计”。在计算能力方面,我正在MacBook Pro上运行这些模型。 自相关程度有多严重?此处和John Kruschke博客上的讨论都表明,如果我们将模型运行足够长的时间,“笨拙的自相关可能已经全部消除了”(Kruschke),因此这并不是什么大问题。 这是产生上面的图的模型的JAGS代码,以防万一有人有兴趣浏览细节的情况: model { for (i in 1:n) …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.