统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
何时在模型中包括随机效应
我是混合建模的新手,我对在进行分析时是否适合使用随机效应感到困惑。任何意见,将不胜感激。 我的研究正在测试新近开发的哺乳动物丰度指数如何预测已建立但劳动强度更高的指数的价值。我一直在多个森林补丁中测量这些指数,每个森林补丁中都有多个图。 因为我对森林补丁的效果并不直接感兴趣,并且因为我的样地嵌套在森林补丁中,所以我一直将森林补丁用作随机效果。但是,我对此有两个问题: 首先,我知道随机效应使您能够在所有可能水平的随机因子上,而不只是在抽样的水平上,对结果进行概括。但是在我看来,要进行这种推断,您的水平必须随机抽样吗?我的森林斑块不是随机取样的,所以我仍然可以将它们用作随机效果吗? 第二,我读过,您可以通过进行似然比检验来比较具有和没有效应的模型,从而检验是否有必要产生随机效应。我已经做到了,它表明随机效应模型不能解释数据,而只能解释固定效应模型。我的问题是我的地块仍然嵌套在森林斑块中,因此大概不是独立的。因此,我可以使用这种LRT方法来证明排除随机效应的合理性,还是我仍需要包括它来解决嵌套问题?如果我最终消除了随机效应,是否有办法验证森林斑块内的地块是否可以视为独立的? 谢谢你的帮助! 周杰伦


5
代表实验数据
我和我的顾问就数据可视化争论不休。他声称,当代表实验结果时,值应仅用“ 标记 ” 绘制,如下面的图像所示。虽然曲线只能代表“ 模型 ” 另一方面,我相信在许多情况下,为了提高可读性,曲线是不必要的,如下面的第二幅图所示: 我是错还是我的教授?如果是后者,我该如何向他解释。

1
未知的p值计算
我最近在调试R脚本时发现很奇怪,作者定义了自己的p值函数 pval <- function(x, y){ if (x+y<20) { # x + y is small, requires R.basic p1<- nChooseK(x+y,x) * 2^-(x+y+1); p2<- nChooseK(x+y,y) * 2^-(x+y+1); pvalue = max(p1, p2) } else { # if x+y is large, use approximation log_p1 <- (x+y)*log(x+y) - x*log(x) - y*log(y) - (x+y+1)*log(2); pvalue<-exp(log_p1); } return(pvalue) …

1
查找统计信息的分布
学习考试。无法回答这个问题。 令是iid随机变量。限定X1,i,X2,i,X3,i,i=1,…,nX1,i,X2,i,X3,i,i=1,…,nX_{1,i},X_{2,i},X_{3,i}, i=1,\ldots,nN(0,1)N(0,1)\mathcal{N}(0,1) Wi=(X1,i+X2,iX3,i)/1+X23,i−−−−−−−√,i=1,…,nWi=(X1,i+X2,iX3,i)/1+X3,i2,i=1,…,nW_i = (X_{1,i} + X_{2,i}X_{3,i})/\sqrt{1 + X_{3,i}^2}, i = 1, \ldots, n, 和,W¯¯¯¯¯n=n−1∑ni=1WiW¯n=n−1∑i=1nWi\overline{W}_n = n^{-1}\sum_{i=1}^nW_i S2n=(n−1)−1∑ni=1(Wi−W¯¯¯¯¯n)2,n≥2.Sn2=(n−1)−1∑i=1n(Wi−W¯n)2,n≥2.S_n^2 = (n-1)^{-1}\sum_{i=1}^n(W_i - \overline{W}_n)^2, n \ge 2. ,的分布是什么?W¯¯¯¯¯nW¯n\overline{W}_nS2nSn2S_n^2 当出现这样的问题时,如何获得最佳方法的想法?

1
生存分析以进行事件预测
对于数据集中的每条记录,我都有以下信息 (X1 ,… ,Xm ,δ ,T )(X1 ,… ,Xm ,δ ,T ) (X_1 \ , \dots \ , X_m \ , \delta \ , T \ ) 其中是要素,如果目标事件发生,为1,否则为0,为发生事件的时间戳。特别是,如果没有事件或未设定后续行动的时间,则可能会丢失。XiXiX_iδδ\deltaTTTTTT 我想为数据集中的每条记录计算一个风险指数。 我当时正在考虑使用功能来预测类的分类模型。但是,很重要:如果事件可能很快发生,则风险应该更高。XiXiX_iδδ\deltaTTTδδ\delta 这就是为什么生存分析应该适合这个问题的原因。我不需要的完整估计,而只需要一个代表单个记录风险的单个索引。S(t)=P(T>t)S(t)=P(T>t)S(t) = P(T>t) 可以为每条记录计算的平均生存时间似乎是一个不错的风险指数-风险越低越低。 我的问题是: 生存分析是否适合我的目的? 如何评估模型的性能? 关于问题(2):例如,我很想使用Harrell的 -index,但是我不确定要使用哪个预测结果来进行计算。从Harrell的书《回归建模策略》第247页:ccc 该指数[...]被拍摄到所有可能对这样一个主题作出回应,其他的都没有计算。该指数是这样的对的比例,其中响应者具有比非响应者更高的预测响应概率。ccc 如果发现生存分析是正确的选择,我认为使用某种标准方法引入时变协变量应该很容易。Xi(t)Xi(t)X_i(t)

2
贝叶斯环境中先验的“健忘”?
众所周知,随着您拥有更多的证据(例如,对于 nid个示例,以更大的的形式出现),贝叶斯先验被“遗忘”,并且大多数推论都受到证据(或可能性)的影响。nnnnnn 很容易在各种特定情况下看到它(例如带有Beta优先级的Bernoulli或其他类型的示例)-但是在和一些先前的?x1,…,xn∼p(x|μ)x1,…,xn∼p(x|μ)x_1,\ldots,x_n \sim p(x|\mu)p(μ)p(μ)p(\mu) 编辑:我猜想它不能在一般情况下显示任何先验(例如,先有先有质量将使后验有先有质量)。但是也许在某些情况下会忘记先验。 这是我正在考虑显示的“路径”类型: 假设参数空间为,并且令和为两个先验值,它们在所有上放置非零概率质量。因此,每个先验的两次后验计算为:ΘΘ\Thetap(θ)p(θ)p(\theta)q(θ)q(θ)q(\theta)ΘΘ\Theta p(θ|x1,…,xn)=∏ip(xi|θ)p(θ)∫θ∏ip(xi|θ)p(θ)dθp(θ|x1,…,xn)=∏ip(xi|θ)p(θ)∫θ∏ip(xi|θ)p(θ)dθp(\theta | x_1,\ldots,x_n) = \frac{\prod_i p(x_i | \theta) p(\theta)}{\int_{\theta} \prod_i p(x_i | \theta) p(\theta) d\theta} 和 q(θ|x1,…,xn)=∏ip(xi|θ)q(θ)∫θ∏ip(xi|θ)q(θ)dθq(θ|x1,…,xn)=∏ip(xi|θ)q(θ)∫θ∏ip(xi|θ)q(θ)dθq(\theta | x_1,\ldots,x_n) = \frac{\prod_i p(x_i | \theta) q(\theta)}{\int_{\theta} \prod_i p(x_i | \theta) q(\theta) d\theta} 如果将除以(后验),则得到:pppqqq p(θ|x1,…,xn)/q(θ|x1,…,xn)=p(θ)∫θ∏ip(xi|θ)q(θ)dθq(θ)∫θ∏ip(xi|θ)p(θ)dθp(θ|x1,…,xn)/q(θ|x1,…,xn)=p(θ)∫θ∏ip(xi|θ)q(θ)dθq(θ)∫θ∏ip(xi|θ)p(θ)dθp(\theta | x_1,\ldots,x_n)/q(\theta | x_1,\ldots,x_n) = \frac{p(\theta)\int_{\theta} \prod_i p(x_i | …
9 bayesian  prior 

1
对称分布的中心时刻
我试图证明对称分布的中心矩: 对于奇数是零。因此,例如,第三中心矩我首先尝试显示我不确定从这里去哪里,有什么建议吗?有没有更好的方法来证明这一点?fx(a+x)=fx(a−x)fx(a+x)=fx(a−x){\bf f}_x{\bf (a+x)} = {\bf f}_x{\bf(a-x)}E[(X−u)3]=0.E[(X−u)3]=0.{\bf E[(X-u)^3] = 0}.E [ (X − u)3] = E [X3] - 3 ù ë [X2] + 3ü2E [ X ] -ü3。E[(X−u)3]=E[X3]−3uE[X2]+3u2E[X]−u3.{\bf E[(X-u)^3] = E[X^3] -3uE[X^2] + 3u^2E[X] - u^3}.

1
这是使用贝叶斯定理不断更新概率的正确方法吗?
假设我正在尝试找出某人最喜欢的冰淇淋口味是香草的可能性。 我知道这个人也喜欢恐怖电影。 考虑到他们喜欢看恐怖电影,我想找出这个人最喜欢的冰淇淋是香草的可能性。 我知道以下几点: 5%5%5\%的人选择香草作为他们最喜欢的冰淇淋口味。(这是我的)P(A)P(A)P(A) 10%10%10\%最喜欢香草冰淇淋的人中,有的人也喜欢恐怖电影。(这是我的)P(B|A)P(B|A)P(B|A) 1%1%1\%最不喜欢香草冰淇淋的人中有的人也喜欢恐怖电影(这是我的)P(B|¬A)P(B|¬A)P(B|\lnot A) 因此,我这样计算: 我发现P(A|B)=0.05×0.1(0.05×0.1)+(0.01×(1−0.05))P(A|B)=0.05×0.1(0.05×0.1)+(0.01×(1−0.05))P(A|B)=\frac{0.05\times0.1}{(0.05 \times 0.1)+(0.01 \times(1-0.05))}P(A|B)=0.3448P(A|B)=0.3448P(A|B) = 0.3448(四舍五入到最接近的十分之一)。有一个34.48%34.48%34.48\% 恐怖电影迷最喜欢的冰淇淋口味是香草。 但是后来我得知该人在过去30天内看过一部恐怖电影。这是我所知道的: 34.48%34.48%34.48\% 是香草是该人最喜欢的冰淇淋口味的最新后验概率- P(A)P(A)P(A) 在下一个问题中。 20%20%20\% 在过去30天内,最喜欢香草冰淇淋的人中有一部看过恐怖片。 5 %5%5\% 在过去30天内,最不喜欢香草冰淇淋的人中有过看过恐怖片的人。 这给出: 0.3448 × 0.2(0.3448 × 0.2 )+ (0.05 × (1 − 0.3448 ))= 0.67790.3448×0.2(0.3448×0.2)+(0.05×(1−0.3448))=0.6779\frac{0.3448\times0.2}{(0.3448\times0.2)+(0.05\times(1-0.3448))} = 0.6779 四舍五入时。 所以现在我相信有一个 67.79 %67.79%67.79\% 鉴于过去30天内看过恐怖电影,恐怖电影迷很喜欢冰淇淋。 但是,等等,还有另一件事。我还了解到该人拥有一只猫。 这是我所知道的: 67.79 …

2
R中的间隔审查Cox比例风险模型
给定间隔审查的生存时间,我如何在中执行间隔审查的Cox PH模型R?随便搜索即可找到该软件包intcox,该软件包不再存在于R存储库中。我几乎肯定该包中的coxph功能survival无法处理间隔检查的生存数据。 另外,我不想插入数据然后使用该coxph函数。该方法低估了系数的标准误差,因为您忽略了间隔检查的不确定性。


1
与线性动力系统有关的混乱
我正在读Bishop的这本书《模式识别和机器学习》。我对线性动力学系统的推导感到困惑。在LDS中,我们假定潜变量是连续的。如果Z表示潜在变量,X表示观测变量 p (žñ|žn − 1)= N(žñ| 一个žn − 1,τ)p(žñ|žñ-1个)=ñ(žñ|一个žñ-1个,τ)p(z_n|z_{n-1}) = N(z_n|Az_{n-1},\tau) p (Xñ|žñ)= N(Xñ,Cžñ,Σ )p(Xñ|žñ)=ñ(Xñ,Cžñ,Σ)p(x_n|z_n) = N(x_n,Cz_n,\Sigma) p (ž1个)= N(ž1个|ü0,V0)p(ž1个)=ñ(ž1个|ü0,V0)p(z_1) = N(z_1|u_0,V_0) 在LDS中,也使用alpha beta前向后向消息传递来计算后向潜在分布,即p (žñ| X)p(žñ|X)p(z_n|X) α (žñ)= p (x 1 ... x n ,žñ)α(žñ)=p(X1 ...Xñ,žñ)\alpha(z_n)=p(x1...xn,z_n) α^(žñ)= α (žñ)/ P(x 1 .... x n )α^(žñ)=α(žñ)/P(X1 ....Xñ)\hat\alpha(z_n) = \alpha(z_n)/P(x1....xn) 我的第一个问题在书中给出为 α^(žñ)= …

2
具有纵向数据的SVM回归
我每个患者大约有500个变量,每个变量都有一个连续值,并在三个不同的时间点(两个月后和一年后)进行测量。通过回归,我想预测新患者的治疗结果。 是否可以对此类纵向数据使用SVM回归?

1
总的来说,负二项式的分布是什么
如果 x1,x2,…,xnx1,x2,…,xnx_1, x_2, \ldots, x_n 都是负二项式,那么分布是什么 (x1,x2,…,xn)(x1,x2,…,xn)(x_1, x_2, \ldots, x_n) 给定 x1+x2+…+xn=Nx1+x2+…+xn=Nx_1 + x_2 + \ldots + x_n = N\quad? NNN 是固定的。 如果 x1,x2,…,xnx1,x2,…,xnx_1, x_2, \ldots, x_n 然后以总泊松为条件, (x1,x2,…,xn)(x1,x2,…,xn)(x_1, x_2, \ldots, x_n)是多项式。我不确定负二项式是否成立,因为它是泊松混合函数。 如果您想知道,这不是作业问题。


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.