统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
MCMC / EM的局限性?EM上的MCMC?
我目前正在使用R中的JAGS学习分层贝叶斯模型,并使用Python(“黑客的贝叶斯方法”)学习pymc 。 我可以从这篇文章中得到一些直觉:“最终,您会得到一堆看起来像是在某种程度上设法从想要了解的复杂分布中提取独立样本的数字。” 就像我可以给出条件概率,然后我可以基于条件概率生成无记忆过程。当我生成过程足够长的时间时,联合概率可以收敛。然后我可以在生成的序列的末尾取一堆数字。就像我从复杂的联合分布中提取独立样本一样。例如,我可以制作直方图,它可以近似分布函数。 然后我的问题是,我是否需要证明MCMC是否针对某个模型收敛?我很高兴知道这一点,因为我以前学习了GMM和LDA(图形模型)的EM算法。如果我只使用MCMC算法而不证明它是否收敛,那么它可以比EM节省更多时间。由于我将必须计算预期的对数似然函数(必须计算后验概率),然后使预期的对数似然率最大化。它显然比MCMC麻烦(我只需要表述条件概率)。 我也想知道似然函数和先验分布是否共轭。这是否意味着MCMC必须收敛?我想知道MCMC和EM的局限性。

2
引用统计检验两个比值比之间的差异?
@gung 在这里发表评论,写道: 我相信它们可以重叠一点(也许〜25%),并且在5%的水平上仍然很重要。请记住,您看到的95%CI是针对单个OR,但是对2个OR的测试是关于它们之间的差异。但是,如果它们根本不重叠,那么它们肯定会明显不同;如果95%CI与其他OR点估计值重叠,则它们肯定不会重叠。 有没有人引用上述声明?审稿人要我计算两个比值比是否显着不同。

2
主成分分析输出的结论
我试图了解按以下方式进行的主成分分析的输出: > head(iris) Sepal.Length Sepal.Width Petal.Length Petal.Width Species 1 5.1 3.5 1.4 0.2 setosa 2 4.9 3.0 1.4 0.2 setosa 3 4.7 3.2 1.3 0.2 setosa 4 4.6 3.1 1.5 0.2 setosa 5 5.0 3.6 1.4 0.2 setosa 6 5.4 3.9 1.7 0.4 setosa > res = prcomp(iris[1:4], scale=T) > …
9 r  pca  interpretation 

1
EM算法是否始终如一地估计高斯混合模型中的参数?
我正在研究高斯混合模型,自己提出这个问题。 假设的基础数据从混合物产生高斯分布和他们每个人都有一个平均向量μ ķ ∈ [R p,其中1 ≤ ķ ≤ ķ和他们每个人都有相同的协方差矩阵Σ,并假定此Σ是对角矩阵。并假设混合比为1 / K,即每个簇具有相同的权重。ķKKμk∈Rpμk∈Rp\mu_k\in\mathbb{R}^p1≤k≤K1≤k≤K1\leq k\leq KΣΣ\SigmaΣΣ\Sigma1/K1/K1/K 因此,在这个理想的例子中,唯一的工作是估计均值向量μ ķ ∈ [R p,其中1 ≤ ķ ≤ ķ和共方差矩阵Σ。KKKμk∈Rpμk∈Rp\mu_k\in\mathbb{R}^p1≤k≤K1≤k≤K1\leq k\leq KΣΣ\Sigma 我的问题是:如果我们用EM算法,我们将能够始终如一地估计和Σ,即,当样本大小ñ →交通∞,将EM算法产生的估计实现的真正价值μ ķ和Σ?μkμk\mu_kΣΣ\Sigman→∞n→∞n\rightarrow\inftyμkμk\mu_kΣΣ\Sigma

1
如何生成正行列式的均匀随机正交矩阵?
ppp111−1−1-1det=−1det=−1\det=-1 我们可以通过将正交矩阵的的正负号更改为负号来更改它的任何一列(或更一般地,其任意奇数个列)。detdet\det 我的问题是:鉴于我们会反复生成这样的随机矩阵,如果每次我们选择只恢复特定列的符号(例如,始终为第一个或始终为最后一个),是否会在它们的统一随机性上引入一些偏差?还是我们必须随机选择列以使矩阵表示随机均匀分布的集合?

6
有什么好的例子可以向本科生展示?
我将在本学期下半学期向面向CS的本科生教授统计学。大多数参加该课程的学生没有动力去学习该学科,而只是出于主要要求而参加。我想让这个主题有趣且有用,而不仅仅是他们学习让B +通过的课程。 作为一名纯数学博士生,我在实际应用方面一无所知。我想问一些实际应用中的本科统计。我正在寻找的示例(在精神上)例如: 1)显示中心极限定理对于某些大型样本数据很有用。 2)提供一个反例,说明中心极限定理不适用(例如,遵循柯西分布的那些)。 3)使用Z检验,t检验或其他方法,说明假​​设检验在著名的现实生活示例中的工作原理。 4)显示过度拟合或错误的初始假设如何导致错误的结果。 5)展示p值和置信区间如何在(众所周知的)现实生活案例中发挥作用,以及在何处效果不佳。 6)类似地,I型,II型错误,统计功效,拒绝水平等。αα\alpha 我的麻烦是,尽管我在概率方面确实有很多示例(掷硬币,掷骰子,赌徒的废墟,mar,随机行走,三个囚犯悖论,蒙蒂霍尔问题,算法设计中的概率方法等),但我不知道在统计方面有很多规范的例子。我的意思是严肃的,有趣的例子,具有一定的教学价值,并且不是由人为地编造的,似乎与现实生活格格不入。我不想给学生错误的印象,即Z检验和t检验就是一切。但是由于我纯粹的数学背景,我没有足够的例子让课堂变得有趣和有用。因此,我正在寻求一些帮助。 我学生的水平大约是微积分I和微积分II。他们无法甚至显示标准正态分布的方差为1的定义,因为他们不知道如何评价高斯内核。因此,任何稍微理论化或动手的计算(例如超几何分布,一维随机游走中的反正弦定律)都将无法工作。我想展示一些例子,他们不仅可以理解“如何”,而且可以理解“为什么”。否则,我不确定是否会通过恐吓证明我的话。

2
在异方差下OLS渐近有效
我知道在线性回归设置下,OLS是无偏的,但在异方差下效率不高。 在维基百科 http://en.wikipedia.org/wiki/Minimum_mean_square_error MMSE估计量是渐近无偏的,并且其分布收敛到正态分布: ,其中I(x)是x的Fisher信息。因此,MMSE估计器是渐近有效的。n−−√(x^−x)→dN(0,I−1(x))ñ(X^-X)→dñ(0,一世-1个(X))\sqrt{n}(\hat{x} - x) \xrightarrow{d} \mathcal{N}\left(0 , I^{-1}(x)\right) MMSE被认为是渐近有效的。我在这里有些困惑。 这是否意味着OLS在有限样本中无效,但在异方差下渐近有效? 对当前答案的批评:到目前为止,提出的答案还没有解决限制分布的问题。 提前致谢

1
当L2是用于计算后验损失的良好损失函数时,将是一个例子?
L2损失以及L0和L1损失,是在通过最小后验预期损失进行后验总结时非常常用的三个“默认”损失函数。原因之一可能是它们相对容易计算(至少对于1d分布),L0导致众数,L1导致中位数,L2导致均值。在教学时,我可以提出L0和L1是合理的损失函数(而不仅仅是“默认”)的情况,但是我正在努力解决L2是合理的损失函数的情况。所以我的问题是: 出于教学目的,当L2是用于计算最小后验损失的良好损失函数时,将是一个示例吗? 对于L0,很容易想到下注的情况。假设您已经计算出了即将到来的足球比赛的进球总数的后验,并且如果您正确地猜到了进球数而输了,那么您将下注赢钱。那么L0是一个合理的损失函数。 我的L1示例有些人为。您正在遇见一个朋友,该朋友将到达许多机场之一,然后乘汽车旅行给您,问题是您不知道哪个机场(并且因为她在空中,所以无法给您的朋友打电话)。考虑到她可能进入哪个机场的后部,在哪里放置自己的好地方,以便当她到达时她和你之间的距离变小?在这里,如果简化假设她的汽车将以恒定的速度直接行驶到您的位置,那么使预期的L1损失最小化的观点似乎是合理的。也就是说,一小时的等待是30分钟等待的两倍。

2
回归结果具有意外的上限
我尝试预测平衡得分,并尝试了几种不同的回归方法。我注意到的一件事是,预测值似乎具有某种上限。也就是说,实际余额为,但我的预测顶部约0.8。下图显示了实际余额与预测余额(通过线性回归预测):[ 0.0 ,1.0 )[0.0,1.0)[0.0, 1.0)0.80.80.8 这是相同数据的两个分布图: 由于我的预测变量非常偏斜(具有幂律分布的用户数据),因此我应用了Box-Cox转换,将结果更改为以下内容: 尽管它改变了预测的分布,但仍然存在上限。所以我的问题是: 预测结果出现上限的可能原因是什么? 如何确定与实际值的分布相对应的预测? 奖励:由于Box-Cox转换后的分布似乎遵循转换后的预测变量的分布,因此这可能直接相关吗?如果是这样,我是否可以应用一种转换以使分布适合实际值? 编辑:我使用了5个预测变量的简单线性回归。

2
LeNet中神经元的感受野
我试图更好地了解CNN的接受领域。为此,我想计算LeNet中每个神经元的感受野。对于普通的MLP来说,它相当简单(请参阅http://deeplearning.net/tutorial/lenet.html#sparse-connectivity),但是要计算一个或多个卷积层和池层。 2.卷积层中神经元的感受野是什么?在下面的子采样/合并层中,它的大小是多少?计算这些的公式是什么?

1
具有二元混合物分布的EM算法的收敛
我有一个混合模型,我想要找到给定一组数据xxx和一组部分观测数据的最大似然估计量zzz。我已经实现两个E-步骤(计算的期望zzz给定xxx和电流参数θkθk\theta^k),和M-步骤,以减少给定的期望的负对数似然zzz。 据我了解,每次迭代的最大可能性都在增加,这意味着负对数似然性必须在每次迭代中都在减少吗?但是,正如我所进行的迭代,该算法实际上并未产生负对数似然率的递减值。相反,它可能同时在减少和增加。例如,这是直到收敛的负对数似然的值: 我在这里误解了吗? 另外,对于模拟数据,当我对真正的潜在变量(未观察到)执行最大似然法时,我的拟合度非常接近,表明没有编程错误。对于EM算法,它通常收敛到明显次优的解决方案,尤其是对于特定参数子集(即,分类变量的比例)。众所周知,该算法可以收敛到局部最小值或固定点,是否有常规的搜索试探法或同样地增加了找到全局最小值(或最大值)的可能性。对于这个特殊的问题,我相信会有很多未命中类别,因为对于双变量混合,两个分布之一采用概率为1的值(这是生命周期的混合,其中通过其中, z表示属于任一分布。指标 z当然在数据集中被检查。 T=zT0+(1−z)∞T=zT0+(1−z)∞T=z T_0 + (1-z)\inftyzzzzzz 我从理论解开始添加了第二个数字(应该接近最优值)。但是,可以看出,可能性和参数从该解决方案变为明显较差的解决方案。 xi=(ti,δi,Li,τi,zi)xi=(ti,δi,Li,τi,zi)\mathbf{x_i}=(t_i,\delta_i,L_i,\tau_i,z_i)titit_iiiiδiδi\delta_iLiLiL_iτiτi\tau_iziziz_i是观测值所属人群的指标(由于其二元变量,我们只需要考虑0和1)。 z=1z=1z=1fz(t)=f(t|z=1)fz(t)=f(t|z=1)f_z(t)=f(t|z=1)Sz(t)=S(t|z=1)Sz(t)=S(t|z=1)S_z(t)=S(t|z=1)z=0z=0z=0tttinfinf\inff(t|z=0)=0f(t|z=0)=0f(t|z=0)=0和。这还会产生以下完整的混合物分布:S(t|z=0)=1S(t|z=0)=1S(t|z=0)=1 f(t)=∑1i=0pif(t|z=i)=pf(t|z=1)f(t)=∑i=01pif(t|z=i)=pf(t|z=1)f(t) = \sum_{i=0}^{1}p_if(t|z=i) = pf(t|z=1)和 S(t)=1−p+pSz(t)S(t)=1−p+pSz(t)S(t) = 1 - p + pS_z(t) 我们继续定义可能性的一般形式: L(θ;xi)=Πif(ti;θ)δiS(ti;θ)1−δiS(Li)τiL(θ;xi)=Πif(ti;θ)δiS(ti;θ)1−δiS(Li)τi L(\theta;\mathbf{x_i}) = \Pi_i \frac{f(t_i;\theta)^{\delta_i}S(t_i;\theta)^{1-\delta_i}}{S(L_i)^{\tau_i}} 现在,当,只能部分观察到,否则未知。完全可能性变为zzzδ=1δ=1\delta=1 L(θ,p;xi)=Πi((pfz(ti;θ))zi)δi((1−p)(1−zi)(pSz(ti;θ))zi)1−δi((1−p)(1−zi)(pSz(Li;θ))zi)τiL(θ,p;xi)=Πi((pfz(ti;θ))zi)δi((1−p)(1−zi)(pSz(ti;θ))zi)1−δi((1−p)(1−zi)(pSz(Li;θ))zi)τi L(\theta,p;\mathbf{x_i}) = \Pi_i \frac{\big((p f_z(t_i;\theta))^{z_i}\big)^{\delta_i}\big((1-p)^{(1-z_i)}(p S_z(t_i;\theta))^{z_i}\big)^{1-\delta_i}}{\big((1-p)^{(1-z_i)}(p S_z(L_i;\theta))^{z_i}\big)^{\tau_i}} 其中是相应分布的权重(可能通过某些链接函数与某些协变量及其各自的系数相关联)。在大多数文献中,这简化为以下对数似然ppp ∑(ziln(p)+(1−p)ln(1−p)−τi(ziln(p)+(1−zi)ln(1−p))+δizifz(ti;θ)+(1−δi)ziSz(ti;θ)−τiSz(Li;θ))∑(ziln⁡(p)+(1−p)ln⁡(1−p)−τi(ziln⁡(p)+(1−zi)ln⁡(1−p))+δizifz(ti;θ)+(1−δi)ziSz(ti;θ)−τiSz(Li;θ))\sum \Big( z_i \ln(p) + (1-p) \ln(1-p) - \tau_i\big(z_i …

1
关于t检验的正态假设的问题
对于t检验,根据大多数文献,假设人口数据呈正态分布。我不知道为什么。t检验不是只要求样本均值的抽样分布是正态分布,而不是总体吗? 如果情况是t检验最终只要求样本分布具有正态性,那么总体可以看起来像任何分布,对吗?只要样本数量合理即可。那不是中央极限定理所陈述的吗? (我在这里指的是一个样本或独立样本的t检验)

3
R季节性时间序列
我在中使用该decompose函数,R并提出了我每月时间序列的3个组成部分(趋势,季节性和随机性)。如果我绘制图表或查看表格,则可以清楚地看到时间序列受季节的影响。 但是,当我将时间序列回归到11个季节性虚拟变量时,所有系数都不具有统计显着性,表明没有季节性。 我不明白为什么我要得出两个截然不同的结果。有人发生过这种事吗?难道我做错了什么? 我在这里添加一些有用的细节。 这是我的时间序列以及相应的每月更改。在两个图表中,您都可以看到有季节性(或者这就是我想评估的)。特别是,在第二张图表(该系列的每月变化)中,我可以看到一个反复出现的模式(一年中相同月份的高点和低点)。 下面是该decompose函数的输出。我很欣赏@RichardHardy所说的,该函数不会测试是否存在实际的季节性。但是分解似乎证实了我的想法。 但是,当我对11个季节性虚拟变量(1月至11月,不包括12月)的时间序列进行回归时,会发现以下内容: Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 5144454056 372840549 13.798 <2e-16 *** Jan -616669492 527276161 -1.170 0.248 Feb -586884419 527276161 -1.113 0.271 Mar -461990149 527276161 -0.876 0.385 Apr -407860396 527276161 -0.774 0.443 May -395942771 527276161 -0.751 0.456 Jun -382312331 527276161 -0.725 0.472 …

4
进行统计测试以区分两种产品
我有一个来自客户调查的数据集,我想部署一个统计测试以查看产品1和产品2之间是否存在显着差异。 这是客户评论的数据集。 速度是从很差,很差,可以,很好到非常好。 customer product1 product2 1 very good very bad 2 good bad 3 okay bad 4 very good okay 5 bad very good 6 okay good 7 bad okay 8 very good very bad 9 good good 10 good very good 11 okay okay 12 very good good …

1
如果是独立Beta,则显示也是beta
这是几年前在我们大学进行的学期考试中遇到的一个问题,我正在努力解决。 如果X1,X2X1,X2X_1,X_2是密度分别为\ beta(n_1,n_2)和\ beta(n_1 + \ dfrac {1} {2},n_2)的独立ββ\beta随机变量,则表明\ sqrt {X_1X_2}遵循\ beta(2n_1, 2n_2)。β(n1个,n2)β(ñ1个,ñ2)\beta(n_1,n_2)β(n1个+ 12,n2)β(ñ1个+1个2,ñ2)\beta(n_1+\dfrac{1}{2},n_2)X1个X2-----√X1个X2\sqrt{X_1X_2}β(2 n1个,2 n2)β(2ñ1个,2ñ2)\beta(2n_1,2n_2) 我使用Jacobian方法获得Y = \ sqrt {X_1X_2}的密度ÿ= X1个X2-----√ÿ=X1个X2Y=\sqrt{X_1X_2}如下: Fÿ(y)= 4 ÿ2 n1个乙(Ñ1个,n2)B (n1个+ 12,n2)∫1个ÿ1个X2(1 − x2)ñ2− 1(1 − y2X2)ñ2− 1dXFÿ(ÿ)=4ÿ2ñ1个乙(ñ1个,ñ2)乙(ñ1个+1个2,ñ2)∫ÿ1个1个X2(1个-X2)ñ2-1个(1个-ÿ2X2)ñ2-1个dXf_Y(y)=\dfrac{4y^{2n_1}}{B(n_1,n_2)B(n_1+\dfrac{1}{2},n_2)}\int_y^1\dfrac{1}{x^2}(1-x^2)^{n_2-1}(1-\dfrac{y^2}{x^2})^{n_2-1}dx 我实际上在这一点上迷路了。现在,在主文件中,我发现已经提供了提示。我尝试使用提示,但无法获得所需的表达式。提示逐字记录如下: 提示:根据给定的X_1和X_2密度,得出Y = \ sqrt {X_1X_2}的密度公式,并尝试使用z = \ dfrac {y ^ 2} {x}的变量更改。ÿ= X1个X2-----√ÿ=X1个X2Y=\sqrt{X_1X_2}X1个X1个X_1X2X2X_2ž= y2Xž=ÿ2Xz=\dfrac{y^2}{x} 因此,在这一点上,我尝试通过考虑变量的这种变化来利用此提示。因此我得到Fÿ(y)= …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.