统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
我应该如何解释GAP统计信息?
我使用GAP统计信息来估算R中的k个聚类。但是,我不确定我是否解释得很好。 从上图可以看出,我应该使用3个群集。 从第二个图中,我应该选择6个群集。GAP统计信息的正确解释吗? 我将不胜感激。
10 clustering 

1
广义加性模型的方差膨胀因子
在用于线性回归的常规VIF计算中,每个自变量/解释变量在普通最小二乘回归中均被视为因变量。即XjXjX_j Xj=β0+∑i=1,i≠jnβiXiXj=β0+∑i=1,i≠jnβiXi X_j = \beta_0 + \sum_{i=1, i \neq j}^n \beta_i X_i 的值被存储用于每个的回归和VIF由下式确定R2R2R^2nnn VIFj=11−R2jVIFj=11−Rj2 VIF_j = \frac{1}{1-R^2_j} 对于特定的解释变量。 假设我的广义加性模型采用以下形式: Y=β0+∑i=1nβiXi+∑j=1msj(Xi).Y=β0+∑i=1nβiXi+∑j=1msj(Xi). Y=\beta_0+ \sum_{i=1}^n \beta_iX_i + \sum_{j=1}^m s_j(X_i) . 这种类型的模型是否有等效的VIF计算?有什么方法可以控制平滑项来测试多重共线性吗?sjsjs_j

1
澄清信息几何
此问题与Amari撰写的《弯曲指数家庭的微分几何-曲率和信息损失》有关。 全文如下。 令是具有坐标系统的维概率分布流形,其中假设 ...Sn={pθ}Sn={pθ}S^n=\{p_{\theta}\}nnnθ=(θ1,…,θn)θ=(θ1,…,θn)\theta=(\theta_1,\dots,\theta_n)pθ(x)>0pθ(x)>0p_{\theta}(x)>0 我们可以把每一个点的作为承载功能的 ...θθ\thetaSnSnS^nlogpθ(x)log⁡pθ(x)\log p_{\theta}(x)xxx 让是切空间在,这一点,粗略地说,有一小附近的线性化版本标识在。令是与协调系统关联的的自然基础...TθTθT_{\theta}SnSnS^nθθ\thetaθθ\thetaSnSnS^nei(θ),i=1,…,nei(θ),i=1,…,ne_i(\theta), i=1,\dots,nTθTθT_{\theta} 由于每个点的携带功能的,很自然地认为在作为表示函数θθ\thetaSnSnS^nlogpθ(x)log⁡pθ(x)\log p_{\theta}(x)xxxei(θ)ei(θ)e_i(\theta)θθ\thetaei(θ)=∂∂θilogpθ(x).ei(θ)=∂∂θilog⁡pθ(x).e_i(\theta)=\frac{\partial}{\partial\theta_i}\log p_{\theta}(x). 我不明白最后的陈述。这出现在上述论文的第2节中。上式如何给出切线空间的基础?如果该社区中熟悉此类材料的某人可以帮助我理解这一点,将会很有帮助。谢谢。 更新1: 尽管我同意(来自@aginensky),如果是线性独立的,则由于它们也是线性独立的,所以这些切线空间的成员首先是如何的还不是很清楚。因此如何将视为切线空间的基础。任何帮助表示赞赏。∂∂θipθ∂∂θipθ\frac{\partial}{\partial\theta_i}p_{\theta}∂∂θilogpθ∂∂θilog⁡pθ\frac{\partial}{\partial\theta_i}\log p_{\theta}∂∂θilogpθ∂∂θilog⁡pθ\frac{\partial}{\partial\theta_i}\log p_{\theta} 更新2: @aginensky:Amari在他的书中说: 让我们考虑以下情况:,上所有(严格)正概率度量的集合,其中我们将视为。实际上,是仿射空间一个开放子集。Sn=P(X)Sn=P(X)S^n=\mathcal{P}(\mathcal{X})X={x0,…,xn}X={x0,…,xn}\mathcal{X}=\{x_0,\dots,x_n\}P(X)P(X)\mathcal{P}(\mathcal{X})RX={X∣∣X:X→R}RX={X|X:X→R}\mathbb{R}^{\mathcal{X}}=\{X\big|X:\mathcal{X}\to \mathbb{R}\}P(X)P(X)\mathcal{P}(\mathcal{X}){X∣∣∑xX(x)=1}{X|∑xX(x)=1}\{X\big |\sum_x X(x)=1\} 然后切空间的每一点可以自然地与所确定的线性子空间。对于coordiante系统的自然基础,我们有。Tp(Sn)Tp(Sn)T_p(S^n)SnSnS^nA0={X∣∣∑xX(x)=0}A0={X|∑xX(x)=0}\mathcal{A}_0=\{X\big |\sum_x X(x)=0\}∂∂θi∂∂θi\frac{\partial}{\partial\theta_i}θ=(θ1,…,θn)θ=(θ1,…,θn)\theta=(\theta_1,\dots,\theta_n)(∂∂θi)θ=∂∂θipθ(∂∂θi)θ=∂∂θipθ(\frac{\partial}{\partial\theta_i})_{\theta}=\frac{\partial}{\partial\theta_i}p_{\theta} 接下来,就让我们再嵌入,并确定与该亚群的。的切线矢量然后通过操作的结果表示到,我们通过表示。特别是,我们有。显然和 p↦logpp↦log⁡pp\mapsto \log pSnSnS^nlogSn:={logp∣∣p∈Sn}log⁡Sn:={log⁡p|p∈Sn}\log S^n:=\{\log p\big |p\in S^n\}RXRX\mathbb{R}^{\mathcal{X}}X∈Tp(Sn)X∈Tp(Sn)X\in T_p(S^n)XXXp↦logpp↦log⁡pp\mapsto \log pX(e)X(e)X^{(e)}(∂∂θi)(e)θ=∂∂θilogpθ(∂∂θi)θ(e)=∂∂θilog⁡pθ(\frac{\partial}{\partial\theta_i})_{\theta}^{(e)}=\frac{\partial}{\partial\theta_i}\log p_{\theta}X(e)=X(x)/p(x)X(e)=X(x)/p(x)X^{(e)}=X(x)/p(x)T(e)p(Sn)={X(e)∣∣X∈Tp(Sn)}={A∈RX∣∣∑xA(x)p(x)=0}.Tp(e)(Sn)={X(e)|X∈Tp(Sn)}={A∈RX|∑xA(x)p(x)=0}.T_p^{(e)}(S^n)=\{X^{(e)}\big |X\in T_p(S^n)\}=\{A\in \mathbb{R}^{\mathcal{X}}\big |\sum_x A(x)p(x)=0\}. 我的问题:如果和都是切线空间的基础,那么这不会与事实和是不同的和?∂∂θi∂∂θi\frac{\partial}{\partial\theta_i}(∂∂θi)(e)(∂∂θi)(e)(\frac{\partial}{\partial\theta_i})^{(e)}TpTpT_pT(e)pTp(e)T_p^{(e)}∂∂θi(e)∈T(e)p∂∂θi(e)∈Tp(e)\frac{\partial}{\partial\theta_i}^{(e)}\in T_p^{(e)} 我猜想()和之间似乎存在关联。如果您可以澄清这一点,将有很大帮助。您可以给出答案。Sn,TpSn,TpS^n,T_p(logSn,T(e)p)(log⁡Sn,Tp(e))(\log S^n,T_p^{(e)})

1
拟合GARCH(1,1)-R中具有协变量的模型
我对时间序列建模有一些经验,以简单的ARIMA模型等形式。现在,我有一些表现出波动性聚类的数据,我想尝试从数据上拟合GARCH(1,1)模型开始。 我有一个数据系列,并且我认为许多变量会影响它。因此,从基本的回归角度来看,它看起来像: ÿŤ= α + β1个XŤ 1+ β2X第2+ ϵŤ。yt=α+β1xt1+β2xt2+ϵt. y_t = \alpha + \beta_1 x_{t1} + \beta_2 x_{t2} + \epsilon_t . 但是我完全不知道如何将其实现为GARCH(1,1)-模型?我已经在中查看了rugarch-package和fGarch-package R,但是除了可以在Internet上找到的示例之外,我没有做任何有意义的事情。
10 r  regression  garch 

3
什么时候终止贝叶斯A / B测试?
我正在尝试对贝叶斯方法进行A / B测试,就像在针对黑客的概率编程和贝叶斯A / B测试中一样。这两篇文章都假定决策者仅根据某些准则(例如的概率来决定哪个变量更好,因此更好。这种可能性无法提供有关是否有足够数据量可以得出任何结论的任何信息。因此,我不清楚何时停止测试。P(p一个> p乙)= 0.97P(pA>pB)=0.97P(p_A > p_B) = 0.97 一个AA 假设有两个二进制RV,即和,我想根据和的观察来估计和的可能性是多少。此外,假设和是beta分布的。B p A > p B一个AA乙BBp一个> p乙pA>pB p_A > p_B ABpApBp一个- p乙p一个> 5 %pA−pBpA>5% \frac{p_A - p_B}{p_A} > 5\% 一个AA乙BBp一个pAp_Ap乙pBp_B 由于我可以找到和的参数,可以对后验样本进行采样,并估计。python中的示例:p 甲α ,βα,β\alpha, \betap Bp一个|数据pA|datap_A\,|\,\text{data} P (p A > p B | data )p乙|数据pB|datap_B\,|\,\text{data} P(p一个> p乙 | 数据) …

2
烧录后的MCMC迭代能否用于密度估计?
老化后,我们是否可以直接使用MCMC迭代进行密度估计,例如通过绘制直方图或核密度估计?我担心的是,尽管MCMC迭代最多是相同分布的,但它们不一定是独立的。 如果我们进一步将细化应用于MCMC迭代该怎么办?我担心的是,MCMC迭代最多是不相关的,并且尚未独立。 我通过Glivenko–Cantelli定理学习了将经验分布函数用作真实分布函数估计的基础,其中经验分布函数是基于iid样本计算的。我似乎看到了一些使用直方图或核密度估计作为密度估计的理由(渐近结果?),但我不记得他们了。

2
相同还是不同?贝叶斯方法
说我有以下模型: Poisson(λ)∼{λ1λ2if t<τif t≥τPoisson(λ)∼{λ1if t<τλ2if t≥τ\text{Poisson}(\lambda) \sim \begin{cases} \lambda_1 & \text{if } t \lt \tau \\ \lambda_2 & \text{if } t \geq \tau \end{cases} 我从数据中推断出下面所示的和。是否存在贝叶斯方法来判断(或量化)和是相同还是不同?λ 2 λ 1 λ 2λ1λ1\lambda_1λ2λ2\lambda_2λ1λ1\lambda_1λ2λ2\lambda_2 也许可以测量与不同的概率λ 2λ1λ1\lambda_1λ2λ2\lambda_2?还是使用KL散度? 例如,如何测量或至少?p (λ 2 > λ 1)p(λ2≠λ1)p(λ2≠λ1)p(\lambda_2 \neq \lambda_1)p(λ2>λ1)p(λ2>λ1)p(\lambda_2 \gt \lambda_1) 总的来说,一旦您获得了如下所示的后验者(假设两者的PDF值到处都是非零值),那么回答这个问题的好方法是什么? 更新资料 这个问题似乎可以通过两种方式回答: 如果我们有后验的样本,我们可以查看(或等效地 )中样本的比例。@ Cam.Davidson.Pilon提供了一个答案,可以使用此类样本解决此问题。λ 2 > …


1
多层次建模的符号
一个需要指定用于训练多层模型(lmer从lme4 R库中使用)的公式总是能帮助我。我读了无数的教科书和教程,但从未正确地理解它。 因此,这是本教程中的一个示例,我希望看到公式中的公式。我们正在尝试根据不同的情景将语音频率建模为性别(女性的声音比男性普遍高)和人的态度(无论他/她以礼貌还是非正式的方式回答)的函数。同样,从subject专栏中您可以看到,每个人都经过多次测量。 > head(politeness, n=20) subject gender scenario attitude frequency 1 F1 F 1 pol 213.3 2 F1 F 1 inf 204.5 3 F1 F 2 pol 285.1 4 F1 F 2 inf 259.7 5 F1 F 3 pol 203.9 6 F1 F 3 inf 286.9 7 F1 F …

1
可视化许多左偏分布
我要显示一系列左偏/重尾分布。有跨越三个因素42个分布(标示为A,B和C下文)。同样,差异也在整个因数间缩小B。 我的问题是,很难在结果的范围(比例或倍数变化)上区分分布: 记录数据似乎过分强调了左偏度,并将更多样本移到尾部(创建了多个离群点): 有人对其他可视化这些数据的技术有建议吗?

2
就模型的交叉验证预测误差而言,LASSO优于正向选择/反向消除
我使用以下方法从原始完整模型中获得了三个简化模型 前向选择 向后淘汰 L1惩罚技术(LASSO) 对于使用前向选择/后向消除得到的模型,我使用获得的预测误差的横验证估计CVlm在包DAAG提供R。对于通过LASSO选择的模型,我使用cv.glm。 LASSO的预测误差小于其他方法的预测误差。因此,通过LASSO获得的模型在预测能力和可变性方面似乎更好。这是一种经常发生的普遍现象,还是特定于问题的?如果这是普遍现象,那么理论上的依据是什么?

1
如何解释Cochran-Mantel-Haenszel检验?
我正在测试由C分层的两个变量A和B的独立性。A和B是二进制变量,C是分类变量(5个值)。运行费舍尔对A和B(所有层的总和)的精确测试,我得到: ## (B) ## (A) FALSE TRUE ## FALSE 1841 85 ## TRUE 915 74 OR: 1.75 (1.25 -- 2.44), p = 0.0007 * 其中OR是优势比(估计值和95%置信区间),*意味着p <0.05。 对每个层(C)运行相同的测试,我得到: C=1, OR: 2.31 (0.78 -- 6.13), p = 0.0815 C=2, OR: 2.75 (1.21 -- 6.15), p = 0.0088 * C=3, OR: 0.94 (0.50 …

1
分位数回归估计器公式
我已经看到了分位数回归估计量的两种不同表示形式,分别是 Q(βq)=∑i:yi≥x′iβnq∣yi−x′iβq∣+∑i:yi&lt;x′iβn(1−q)∣yi−x′iβq∣Q(βq)=∑i:yi≥xi′βnq∣yi−xi′βq∣+∑i:yi&lt;xi′βn(1−q)∣yi−xi′βq∣Q(\beta_{q}) = \sum^{n}_{i:y_{i}\geq x'_{i}\beta} q\mid y_i - x'_i \beta_q \mid + \sum^{n}_{i:y_{i}< x'_{i}\beta} (1-q)\mid y_i - x'_i \beta_q \mid 和 Q(βq)=∑i=1nρq(yi−x′iβq),ρq(u)=ui(q−1(ui&lt;0))Q(βq)=∑i=1nρq(yi−xi′βq),ρq(u)=ui(q−1(ui&lt;0))Q(\beta_q) = \sum^{n}_{i=1} \rho_q (y_i - x'_i \beta_q), \hspace{1cm} \rho_q(u) = u_i(q - 1(u_i < 0 )) 其中。有人可以告诉我如何显示这两个表达的对等吗?这是我到目前为止尝试过的,从第二个表达式开始。ui=yi−x′iβqui=yi−xi′βqu_i = y_i - x'_i \beta_q 但从这一点上,我就死在如何进行。请不要说这不是家庭作业或作业问题。非常感谢。Q(βq)=∑i=1nui(q−1(ui&lt;0))(yi−x′iβq)=∑i=1n(yi−x′iβq)(q−1(yi−x′iβq&lt;0))(yi−x′iβq)=⎡⎣∑i:yi≥x′iβn(q(yi−x′iβq))+∑i:yi&lt;x′iβn(q(y一世-x′一世βq)− (y一世-x′一世βq))⎤⎦(y一世-x′一世βq)Q(βq)=∑一世=1个ñü一世(q-1个(ü一世&lt;0))(ÿ一世-X一世′βq)=∑一世=1个ñ(ÿ一世-X一世′βq)(q-1个(ÿ一世-X一世′βq&lt;0))(ÿ一世-X一世′βq)=[∑一世:ÿ一世≥X一世′βñ(q(ÿ一世-X一世′βq))+∑一世:ÿ一世&lt;X一世′βñ(q(ÿ一世-X一世′βq)-(ÿ一世-X一世′βq))](ÿ一世-X一世′βq) \begin{align} Q(\beta_q) &= \sum^{n}_{i=1} …

1
使用训练和测试集评估回归模型的性能?
我经常听到有关通过提供测试集并在训练集上训练模型来评估分类模型的性能的信息。然后创建2个向量,一个用于预测值,一个用于真实值。显然,进行比较可以使人们使用F-Score,Kappa统计,Precision&Recall,ROC曲线等工具通过其预测能力来判断模型的性能。 这与评估诸如回归之类的数字预测相比有何不同?我假设您可以在训练集上训练回归模型,使用它来预测值,然后将这些预测值与测试集中的真实值进行比较。显然,性能指标必须有所不同,因为这不是分类任务。通常的残差和统计量是明显的量度,但是是否有更多/更好的方法来评估回归模型的性能?分类似乎有很多选择,但是回归留给和残差。R2R2R^2R2R2R^2

1
贝叶斯和费舍尔的线性判别分析方法
我知道2种进行LDA的方法,贝叶斯方法和费舍尔方法。 假设我们有数据(x ,y)(X,ÿ)(x,y),其中XXx是ppp维预测变量,ÿÿy是ķķK类的因变量。 通过贝叶斯方法,我们计算后验p (ÿķ| x)= p (x | yķ)p (yķ)p (x )∝ p (x | yķ)p (yķ)p(ÿķ|X)=p(X|ÿķ)p(ÿķ)p(X)∝p(X|ÿķ)p(ÿķ)p(y_k|x)=\frac{p(x|y_k)p(y_k)}{p(x)}\propto p(x|y_k)p(y_k),如书中所述,假设p (x | yķ)p(X|ÿķ)p(x|y_k)是高斯函数,那么我们现在将第ķķk类的判别函数设为,我可以看到˚Fķ(X)是一个线性函数X,所以对于所有的ķ我们有类ķ线性判别函数。Fķ(x )= lnp (x | yķ)+ lnp (ÿķ)= ln[ 1(2 π)p / 2| Σ |1 / 2经验值( − 12(X - μķ)ŤΣ− 1(X - μķ)) ] +lnp (ÿķ)= xŤΣ− 1μķ− …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.