统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


1
为什么截距的标准
截距项的标准误差(β 0)在Ŷ = β 1 X + β 0 + ε由下式给出小号È (β 0 )2 = σ 2 [ 1β^0β^0\hat{\beta}_0y=β1x+β0+εy=β1x+β0+εy=\beta_1x+\beta_0+\varepsilon 其中ˉX是平均的X我的。SE(β^0)2=σ2[1n+x¯2∑ni=1(xi−x¯)2]SE(β^0)2=σ2[1n+x¯2∑i=1n(xi−x¯)2]SE(\hat{\beta}_0)^2 = \sigma^2\left[\frac{1}{n}+\frac{\bar{x}^2}{\sum_{i=1}^n(x_i-\bar{x})^2}\right]x¯x¯\bar{x}xixix_i 据我了解,在SE量化你的uncertainty-例如,在样本的95%,区间将包含真实β 0。我不明白的SE,不确定性的度量,如何与增加ˉ X。如果我只是转移我的数据,使ˉ X = 0,我的不确定性下降?那似乎是不合理的。[β^0−2SE,β^0+2SE][β^0−2SE,β^0+2SE][\hat{\beta}_0-2SE,\hat{\beta}_0+2SE]β0β0\beta_0x¯x¯\bar{x}x¯=0x¯=0\bar{x}=0 类似的解释是-在我的数据的非中心版本对应于我的预测在X = 0,而在中心的数据,β 0对应于我的预测在X = ˉ X。那么,这是否意味着,然后我讲我在预测的不确定性X = 0比我对我的预测在不确定性较大的X = ˉ X?这似乎也是不合理的,对于所有x值,误差ϵ具有相同的方差β^0β^0\hat{\beta}_0x=0x=0x=0β^0β^0\hat{\beta}_0x=x¯x=x¯x=\bar{x}x=0x=0x=0x=x¯x=x¯x=\bar{x}ϵϵ\epsilonxxx,所以我对所有预测值的不确定性都应该相同。xxx 我敢肯定,我的理解存在差距。有人可以帮助我了解发生了什么吗?

3
改变偏斜的分布
假设我有一个变量,它的分布正偏斜到很高的程度,这样取对数将不足以使它在正态分布的偏斜范围内。目前我有什么选择?如何将变量转换为正态分布?

3
使用Lindsay Smith的教程逐步在R中实现PCA
我正在通过Lindsay I Smith撰写的出色PCA教程从事R的工作,并且陷入了最后阶段。下面的R脚本将带您进入阶段(第19页),该阶段是从(在此例中为单数)主成分重构原始数据的过程,这将产生沿PCA1轴的直线图(假设数据只有2个维度,其中第二个被有意删除)。 d = data.frame(x=c(2.5,0.5,2.2,1.9,3.1,2.3,2.0,1.0,1.5,1.1), y=c(2.4,0.7,2.9,2.2,3.0,2.7,1.6,1.1,1.6,0.9)) # mean-adjusted values d$x_adj = d$x - mean(d$x) d$y_adj = d$y - mean(d$y) # calculate covariance matrix and eigenvectors/values (cm = cov(d[,1:2])) #### outputs ############# # x y # x 0.6165556 0.6154444 # y 0.6154444 0.7165556 ########################## (e = eigen(cm)) ##### outputs ############## …
13 r  pca 


1
广义线性模型的几何解释
对于线性模型,我们可以有估计的模型的经由OLS一个很好的几何解释:Ý = X β + ë。ÿ是y的到空间跨越由x和残余投影ë是垂直于该空间跨越×。ÿ= X β+ eÿ=Xβ+Ëy=x\beta+eÿ^= X β^+ e^ÿ^=Xβ^+Ë^\hat{y}=x\hat{\beta}+\hat{e}ÿ^ÿ^\hat{y}Ë^Ë^\hat{e} 现在,我的问题是:广义线性模型是否有任何几何解释(逻辑回归,泊松,生存)?我如何解释估计的二值逻辑回归模型很好奇p = 物流(X β)几何,以类似的方式为线性模型。它甚至没有错误项。 p^=物流(X β^)p^=后勤(Xβ^)\hat{p} = \textrm{logistic}(x\hat{\beta}) 我发现了一个关于广义线性模型的几何解释的话题。http://statweb.stanford.edu/~lpekelis/talks/13_obs_studies.html#(7)。不幸的是,没有可用的数字,很难想象。 任何帮助,参考和建议将不胜感激!!!



3
对于非线性数据,是否应尽可能使用内核技巧?
我最近了解了内核技巧的用法,该技巧将数据映射到更高维度的空间,以尝试线性化那些维度中的数据。在任何情况下我都应避免使用此技术?仅仅是找到正确的内核功能的问题吗? 对于线性数据,这当然无济于事,但对于非线性数据,这似乎总是有用的。就训练时间和可伸缩性而言,使用线性分类器比非线性分类器容易得多。

1
线性高斯卡尔曼滤波器的LogLikelihood参数估计
我已经编写了一些代码,可以对n维状态向量进行线性高斯状态空间分析(使用许多不同的Kalman型滤波器[Information Filter等])。筛选器效果很好,我得到了一些不错的输出。但是,通过对数似然估计进行参数估计会使我感到困惑。我不是统计学家,而是物理学家,所以请保持友好。 让我们考虑线性高斯状态空间模型 yt=Ztαt+ϵt,yt=Ztαt+ϵt,y_t = \mathbf{Z}_{t}\alpha_{t} + \epsilon_{t}, αt+1=Ttαt+Rtηt,αt+1=Ttαt+Rtηt,\alpha_{t + 1} = \mathbf{T}_{t}\alpha_{t} + \mathbf{R}_{t}\eta_{t}, 其中是我们的观察向量,我们在时间步处的状态向量。粗体为状态空间模型的变换矩阵,这些变换矩阵是根据所考虑的系统的特性设置的。我们还有ytyty_{t}αtαt\alpha_{t}ttt η 吨〜Ñ 我d (0 ,Q 吨),α 1〜Ñ 我d (一个1,P 1)。ϵt∼NID(0,Ht),ϵt∼NID(0,Ht),\epsilon_{t} \sim NID(0, \mathbf{H}_{t}), ηt∼NID(0,Qt),ηt∼NID(0,Qt),\eta_{t} \sim NID(0, \mathbf{Q}_{t}), α1∼NID(a1,P1).α1∼NID(a1,P1).\alpha_{1} \sim NID(a_{1}, \mathbf{P}_{1}). 其中。现在,我已经通过猜测初始参数和方差矩阵和来推导并实现了该通用状态空间模型的Kalman滤波器的递归,我可以生成图喜欢H 1 Q 1t=1,…,nt=1,…,nt = 1,\ldots, nH1H1\mathbf{H}_{1}Q1Q1\mathbf{Q}_{1} 其中的点是100年1月的尼罗河水位,线是“卡拉姆估计”状态,虚线是90%的置信度。 现在,对于此一维数据集,矩阵和分别只是标量和。所以现在我想使用卡尔曼滤波器的输出和对数似然函数为这些标量获取正确的参数Q 吨 σ ε σ …




1
在相同数据上,ANOVA检验的值与多个检验的值相比可以小多少?
简介:注意到今天这个问题引起了人们的注意: “ 当成对t检验都不存在时,方差分析会很重要吗? ”,我认为我可能能够以一种有趣的方式对其进行重新构架,以得到自己的答案。 。 当将统计显着性理解为简单的二分法,并仅根据ppp或\ alpha的较高值来判断时,可能会出现各种不一致的结果(以面值计)αα\alpha。@Glen_b 对上述问题的回答提供了以下情况的有用示例: ANOVA FFF检验为具有四个水平的一个自变量(IV)产生pF&lt;.05pF&lt;.05p_F<.05,但是 pt&gt;.08pt&gt;.08p_t>.08对于所有两个样本ttt检验,p_t&gt; .08,用于比较与IV的每对四个水平对应的观测值之间相同因变量(DV)的差异。 尽管通过这个问题进行了事后成对比较的Bonferroni校正,但发生了类似的情况:Anova重复测量很重要,但是使用Bonferroni校正的所有多重比较都不是吗?前面提到的情况在多元回归中的检验也略有不同: 为什么有可能获得显着的F统计量(p &lt;.001)但无显着的回归t检验?:pF&lt;.001,pβt&gt;.09pF&lt;.001,pβt&gt;.09p_F<.001,p_{\beta t}>.09 回归如何显着但所有预测变量都不显着? 在@whuber的答案中,pF=.0003,pβt&gt;.09pF=.0003,pβt&gt;.09p_F=.0003,p_{\beta t}>.09 我打赌,在这样的情况下,一些(但不是全部)成对比较(或回归系数显着性检验)值必须相当接近如果相应综合测试可以实现。我看到@Glen_b的第一个示例就是这种情况,其中,,最大的成对差给出最小的。一般情况下必须这样吗?更具体地说:α p &lt; α pppαα\alphap&lt;αp&lt;αp <\alphap ˚F = 0.046 p 吨 = 0.054F(3,20)=3.19F(3,20)=3.19F_{(3,20)}=3.19pF=.046pF=.046p_F=.046pt=.054pt=.054p_t=.054 问题:如果ANOVA检验对连续DV的一个多静脉IV的影响产生,那么在比较每对IV水平的所有两个样本检验中,最低的值有多高?最小成对意义是否可以高达?p F = .05 p t p t = .50FFFpF=.05pF=.05p_F=.05ppptttpt=.50pt=.50p_t=.50 我欢迎仅解决此特定问题的答案。但是,为了进一步激发这个问题,我将详细阐述并提出一些潜在的反问。欢迎您也解决这些问题,甚至在您愿意时也可以忽略特定的问题,尤其是在特定问题得到明确答案的情况下。 重要性:考虑一下,如果用连续的无效假设证据的强度来判断统计显着性,那么和之间的差异的重要性降低了多少(我认为是罗恩·费舍尔的方法?),而不是用高于或低于阈值的二分法来表示在选择是否拒绝零批发时可接受的错误概率。“ hacking ”是一个已知的问题,部分原因是由于对的解释而引入了不必要的漏洞,因此臭名昭著p t = .06pF=.04pF=.04p_F=.04pt=.06pt=.06p_t=.06p p …

2
R中的Dunnett检验每次都返回不同的值
我正在使用R'multcomp'库(http://cran.r-project.org/web/packages/multcomp/)计算Dunnett的测试。我正在使用以下脚本: Group &lt;- factor(c("A","A","B","B","B","C","C","C","D","D","D","E","E","F","F","F")) Value &lt;- c(5,5.09901951359278,4.69041575982343,4.58257569495584,4.79583152331272,5,5.09901951359278,4.24264068711928,5.09901951359278,5.19615242270663,4.58257569495584,6.16441400296898,6.85565460040104,7.68114574786861,7.07106781186548,6.48074069840786) data &lt;- data.frame(Group, Value) aov &lt;- aov(Value ~ Group, data) summary(glht(aov, linfct=mcp(Group="Dunnett"))) 现在,如果我多次在R Console中运行此脚本,则每次得到的结果都会略有不同。这是一个例子: Simultaneous Tests for General Linear Hypotheses Multiple Comparisons of Means: Dunnett Contrasts Fit: aov(formula = Value ~ Group, data = data) Linear Hypotheses: Estimate Std. Error t value Pr(&gt;|t|) …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.