统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
期望最大化澄清
我发现有关EM算法的非常有用的教程。 该示例和教程中的图片简直太棒了。 有关计算概率的相关问题,期望最大化如何工作? 关于如何将教程中描述的理论与示例联系起来,我还有另一个问题。 在E步中,EM选择一个函数,该函数所有位置下限,并且为此。gtgtg_tlogP(x;Θ)log⁡P(x;Θ)\log P(x;\Theta)gt(Θ^(t))=logP(x;Θ^(t))gt(Θ^(t))=log⁡P(x;Θ^(t))g_t( \hat{\Theta}^{(t)}) = \log P(x; \hat{\Theta}^{(t)}) 因此,在我们的示例中,看起来像每次迭代都应该有所不同。gtgtg_t 另外,在示例中和然后将它们应用于数据,我们得出和。对我来说,这看起来很不直观。我们有一些先前的假设,将其应用于数据并获得新的假设,因此数据以某种方式改变了这些假设。我不明白为什么不等于。Θ^(0)A=0.6Θ^A(0)=0.6\hat{\Theta}_A^{(0)} = 0.6Θ^(0)B=0.5Θ^B(0)=0.5\hat{\Theta}_B^{(0)} = 0.5Θ^(1)A=0.71Θ^A(1)=0.71\hat{\Theta}_A^{(1)} = 0.71Θ^(1)B=0.58Θ^B(1)=0.58\hat{\Theta}_B^{(1)} = 0.58Θ^(0)Θ^(0)\hat{\Theta}^{(0)}Θ^(1)Θ^(1)\hat{\Theta}^{(1)} 此外,当您看到本教程的补充说明1时,还会出现更多问题。例如,在我们的案例中,是什么。我不清楚,为什么当时,不等式变得很紧Q(z)Q(z)Q(z)Q(z)=P(z|x;Θ)Q(z)=P(z|x;Θ)Q(z)=P(z|x;\Theta) 谢谢。

3
纽曼的网络模块化是否适用于带符号的加权图?
图的模块性在其Wikipedia页面上定义。在另一篇文章中,有人解释说,可以轻松地为加权网络计算(并最大化)模块化,因为邻接矩阵也可以包含有价值的联系。但是,我想知道这是否也适用于带符号的,有价值的边缘(例如,从-10到+10)。您可以提供有关此问题的直觉,证据或参考吗?一种我Ĵ一种一世ĴA_{ij}


4
如何使用回归确定一个系数并拟合其他系数
我想手动固定某个系数,例如,然后将系数拟合到所有其他预测变量,同时在模型中保留。β1=1.0β1=1.0\beta_1=1.0β1=1.0β1=1.0\beta_1=1.0 如何使用R实现此目的?glmnet如果可能的话,我特别想与LASSO()合作。 或者,如何将这个系数限制在特定范围内,例如?0.5≤β1≤1.00.5≤β1≤1.00.5\le\beta_1\le1.0

1
当AIC值较低且大致相等时,我该怎么办?
克里斯·查特菲尔德(Chris Chatfield)在(1)中我喜欢阅读许多高质量的书籍和论文,并提出以下建议: 例如,应该在具有较低AIC值和近似相等AIC值的ARIMA时间序列模型之间进行选择,而不是在其上给出最小的AIC,而是在其上给出对最近一年数据的最佳预测。 这种建议的依据是什么?如果听起来不错,为什么Forecast :: auto.arima和其他预测例程不遵循它?尚未实施?它已经在这里讨论的是寻找那些刚好给最小的车型AIC可能不是一个好主意。为什么选择让n≥1n≥1n\ge1低ARIMA模型但大约相等于(内最小AIC的1点或2的值如)不太多的时间序列预测软件的默认? (1)Chatfield,C.(1991年)。避免统计上的陷阱。统计科学,6(3),240-252。可在线获取,URL:https : //projecteuclid.org/euclid.ss/1177011686。

2
统计上真实网络/图形中的所有边缘偶然发​​生的可能性是什么意思?
我一直在使用本文概述的骨干网提取方法:http : //www.pnas.org/content/106/16/6483.abstract 基本上,作者提出了一种基于统计的方法,该方法为图形中的每个边产生概率,该边可能只是偶然发生。我使用的典型统计显着性临界值为0.05。 我一直在将这种方法应用于多个现实世界的网络,有趣的是,某些网络最终没有任何重要的优势。我试图了解这对网络意味着什么。我将方法应用于网络并且没有出现任何明显边缘的唯一一次是当我将方法应用于生成的随机网络时,这正是我们所期望的。 作为一个现实世界网络的示例,您可能已经看到《经济学人》上最近的网络可视化,显示了过去25年美国参议院的两极分化:http://www.economist.com/news/united-states/21591190 -united态阿米巴原虫。我将骨干网提取方法应用于这些网络,并且没有出现明显的边缘。即使原始边缘显然显示出优先的附着和聚类,这仅仅是偶然吗?参议院投票网络基本上是随机的吗?


1
如何使用2个百分位数计算对数正态分布的均值和标准差
我正在尝试从2个百分位数计算对数正态分布的均值和标准差。 我成功地使用X = mean + sd * Z均值和标准差并求解了正态分布的计算。 当我尝试对数正态分布做同样的事情时,我想我错过了一个方程。我看了一下维基百科并尝试使用,ln(X) = mean + sd * Z但在这种情况下,均值和标准差是用于正态分布还是对数正态,我感到困惑。 我应该使用哪些方程式?我需要超过2个百分点来解决计算问题吗?
11 r  lognormal 

2
为什么使用横截面数据来推断/预测纵向变化是一件坏事?
我正在寻找希望存在的论文,但不知道是否存在。这可能是一组案例研究,和/或概率论的一个论据,关于为什么使用横截面数据来推断/预测纵向变化可能是一件坏事(即不一定如此,但可以如此)。 我已经从很多方面看到了这个错误:有人推断,由于英国的富人出行更多,所以随着社会的富裕起来,整个人口的出行也将增加。事实证明,这种推论在很长一段时间内都是不正确的-超过十年。这与家庭用电情况类似:横截面数据表明随着收入的增加而大量增加,这种增加不会随着时间的推移而显现。 有几件事发生,包括队列效应和供应方约束。 拥有一个参考文献来汇编这样的案例研究将非常有用;和/或使用概率论来说明为什么使用横截面数据来推断/预测纵向变化会产生非常非常的误导。 是否存在这样的论文,如果存在,那是什么?

2
T分布随机变量平方和的分布
我正在查看T分布随机变量平方和的分布,其尾指数为。其中X是RV,傅立叶变换为,给我的卷积之前为方形的溶液。 αα\alphaX2X2X^2F(t)F(t)\mathscr{F}(t)F(t)nF(t)n\mathscr{F}(t)^nF(t)=∫∞0exp(itx2)⎛⎝⎜⎜⎜(αα+x2)α+12α−−√ B(α2,12)⎞⎠⎟⎟⎟dxF(t)=∫0∞exp⁡(itx2)((αα+x2)α+12α B(α2,12))dx\mathscr{F}(t)=\int_0^{\infty } \exp \left(i\, t\, x^2\right)\left(\frac{\left(\frac{\alpha }{\alpha +x^2}\right)^{\frac{\alpha +1}{2}} }{\sqrt{\alpha }\ B\left(\frac{\alpha }{2},\frac{1}{2}\right)}\right) \, \mathrm{d}x 在,解决方案是可行的,但笨拙且不可能对傅立叶逆。因此,问题是:是否已对样本分布或T分布随机变量的标准偏差的分布进行了研究?(对于学生来说,卡方对高斯就是什么)。谢谢。α=3α=3\alpha=3F(t)nF(t)n\mathscr{F}(t)^n (可能的解决方案)我发现是Fisher分布的,因此将查看Fisher分布变量的总和。X2X2X^2F(1,α)F(1,α)F(1,\alpha) (可能的解决方案)根据特征函数,当求和的的平均值 存在分布时,它们的前两个矩相同。因此,利用u的平方根并在概率分布内进行变量的变化,可以用以下近似估计n个样本T变量的标准偏差的密度: n−n−n-X2X2X^2F(n,α)F(n,α)F(n,\alpha)g(u)=2αα/2nn/2un−1(α+nu2)−α2−n2B(n2,α2)g(u)=2αα/2nn/2un−1(α+nu2)−α2−n2B(n2,α2)g(u)=\frac{2 \alpha ^{\alpha /2} n^{n/2} u^{n-1} \left(\alpha +n u^2\right)^{-\frac{\alpha }{2}-\frac{n}{2}}}{B\left(\frac{n}{2},\frac{\alpha }{2}\right)}


4
逻辑回归和拐点
我们有带有二进制结果和一些协变量的数据。我使用逻辑回归对数据进行建模。只是简单的分析,没什么特别的。最终输出应该是剂量响应曲线,在该曲线中,我们显示了特定协变量的概率如何变化。像这样: 我们从内部审核员(不是纯粹的统计学家)那里收到一些批评,选择逻辑回归。逻辑回归假设(或定义)S形曲线在概率标度上的拐点处于概率0.5。他认为,没有理由假定拐点确实在0.5的概率上,我们应该选择一个不同的回归模型,该模型允许拐点发生变化,以使实际位置受数据驱动。 起初我因为他的论点而措手不及,因为我从未考虑过这一点。我没有任何论点说明为什么将拐点设为0.5是合理的。经过研究后,我仍然没有这个问题的答案。 我遇到了5参数逻辑回归,其中拐点是一个附加参数,但似乎在产生具有连续结果的剂量反应曲线时通常使用此回归模型。我不确定是否以及如何将其扩展为二进制响应变量。 我想我的主要问题是为什么或何时可以确定逻辑回归的拐点为0.5?有关系吗 我从未见过有人适合逻辑回归模型并明确讨论拐点问题。是否有其他方法可以创建拐点不一定为0.5的剂量反应曲线? 为了完整起见,用于生成上面图片的R代码: dat <- read.csv("http://www.ats.ucla.edu/stat/data/binary.csv") dat$rank <- factor(dat$rank) logit <- glm(admit ~ gre + gpa + rank, family = binomial(link = "logit"), data = dat) newdata <- data.frame(gre = seq(-2000,8000,1), gpa = 2.5, rank = factor(1,c(1,2,3,4))) pp <- predict(logit, newdata, type = "response", se.fit = …

1
用于集群验证的信息(VI)指标变化背后的直觉是什么?
对于像我这样的非统计学家来说,VI即使阅读了Marina Melia的相关论文“ Comparing clusters-an based based distance ”(多变量分析杂志,2007年),也很难把握度量(信息的变化)的概念。实际上,我不熟悉许多集群的术语。 以下是MWE,我想知道在使用的不同指标中输出的含义。我在R中具有这两个群集,并且具有相同的id顺序: > dput(a) structure(c(4L, 3L, 4L, 4L, 4L, 4L, 4L, 3L, 4L, 4L, 3L, 3L, 3L, 4L, 4L, 4L, 4L, 4L, 3L, 4L, 4L, 4L, 3L, 4L, 4L, 3L, 4L, 4L, 4L, 1L, 1L, 4L, 4L, 4L, 4L, 4L, 4L, 3L, 4L, …

2
估计中心删失正态样本的方差
我已经正态分布从中我得到小样本(进程ñ通常为10-30),我想用估计方差。但是,这些样本之间的距离常常如此之近,以至于我们无法测量中心附近的各个点。 我有一个模糊的理解,我们应该能够使用有序样本构建一个有效的估算器:例如,如果我知道样本包含20个点,并且10个点过于靠近中心而无法单独进行测量,但是我有离散的测量值尾巴上是否有5个,是否有一种标准/公式化的方法来估算最佳利用此类样本的过程差异? (请注意,我认为我不能加权中心平均值。例如,可能有7个样本紧密聚类,而另外3个样本不对称地偏向一侧,但足够接近,如果没有更繁琐的单次抽样,我们就无法断定) 如果答案很复杂,那么我应该研究的任何技巧都将不胜感激。例如,这是一个订单统计问题吗?可能会有一个公式化的答案,或者这是一个计算问题? 更新的详细信息:该应用程序是对射击目标的分析。单个基础样本是单个镜头对目标的影响点(x,y)。基本过程具有对称的双变量正态分布,但轴之间没有相关性,因此我们能够将{ x }和{ y }样本视为来自相同正态分布的独立绘制。(我们也可以说底层过程是瑞利分布的,但是我们无法测量样本瑞利变量,因为我们无法确定过程的“真实”中心的坐标,对于小n来说,这可以是显着的远离样品中心(,))。X¯x¯\bar{x}ÿ¯y¯\bar{y} 给我们一个目标和射入其中的镜头数量。问题在于,对于n >> 3支精确的枪,通常会发射出一个“参差不齐的孔”,周围是不同的射击。我们可以观察到孔的x-和y-宽度,但是我们不知道未区分的镜头在孔中的哪个位置受到了影响。 以下是一些有问题的目标的示例: (当然,在理想情况下,我们会在每次拍摄后更改/切换目标,然后汇总样本进行分析。尽管有可能,但有很多原因通常是不切实际的。) 注释中经过WHuber澄清后的其他说明:子弹产生的目标孔直径均匀且已知。当射击不在任何“参差不齐的群”之外时,我们知道了射弹半径,因此我们可以测量精确的中心。在每个“参差不齐的组”中,我们可以识别出一定数量的外围“球”,并根据已知的射弹半径再次标记这些外部射击的精确中心。这是剩下的 “中心审查”的镜头,我们只知道影响地方的“破烂组”的内部(通常是-如果有必要,让我们假设-一个目标一个)。X一世xix_i 为了简化求解,我相信将其最简单地从法线简化为一组一维样本,其中心间隔为w > d,其中d为弹丸直径,包含c < n个 “被检举”样本。


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.