统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


4
受限玻尔兹曼机器(RBM)的良好教程
我正在研究受限玻尔兹曼机(RBM),并且在理解有关RBM参数的对数似然计算时遇到一些问题。尽管已经发表了很多有关RBM的研究论文,但没有详细的衍生步骤。在线搜索后,我可以在此文档中找到它们: Fischer,A.和Igel,C.(2012)。受限玻尔兹曼机器概论。在L. Alvarez等人中。(编):CIARP,LNCS 7441,第14–36页,施普林格出版社:柏林-海德堡。(pdf) 但是,该文档的详细信息对我来说太高级了。有人可以指出我关于RBM的良好教程/一组讲义吗? 编辑:@David,令人困惑的部分如下所示(第26页的方程式29): ∂lnL(θ|v)∂wij=−∑hp(h|v)∂E(v,h)∂wij+∑v,hp(v,h)∂E(v,h)∂wij=∑hp(h|v)hivj−∑vp(v)∑hp(h|v)hivj=p(Hi=1|v)vj−∑vp(v)p(Hi=1|v)vj.(29)∂ln⁡L(θ|v)∂wij=−∑hp(h|v)∂E(v,h)∂wij+∑v,hp(v,h)∂E(v,h)∂wij=∑hp(h|v)hivj−∑vp(v)∑hp(h|v)hivj(29)=p(Hi=1|v)vj−∑vp(v)p(Hi=1|v)vj.\begin{align} \frac{\partial\ln\mathcal{L}(\theta|v)}{\partial w_{ij}} &= -\sum_h p(h|v)\frac{\partial E(v, h)}{\partial w_{ij}} + \sum_{v,h} p(v,h)\frac{\partial E(v,h)}{\partial w_{ij}} \\[5pt] &= \sum_h p(h|v)h_iv_j - \sum_v p(v) \sum_h p(h|v)h_iv_j \\[5pt] &= \color{orange}{\boxed{\color{black}{p(H_i=1|v)}}}v_j - \sum_v p(v) \color{orange}{\boxed{\color{black}{p(H_i=1|v)}}}v_j\; . \tag{29} \end{align}
10 references  rbm 

1
如何从具有多变量相关性的联合分布中找到边际分布?
我的教科书中的一个问题如下。二维随机连续向量具有以下密度函数: fX,Y(x,y)={15xy20if 0 &lt; x &lt; 1 and 0 &lt; y &lt; xotherwisefX,Y(x,y)={15xy2if 0 &lt; x &lt; 1 and 0 &lt; y &lt; x0otherwise f_{X,Y}(x,y)= \begin{cases} 15xy^2 & \text{if 0 < x < 1 and 0 < y < x}\\ 0 & \text{otherwise}\\ \end{cases} 证明边际密度函数和为:fXfXf_XfYfYf_Y fX(x)={5x40if 0 &lt; x &lt; …

1
奥巴马竞选中的数据挖掘技术
我在奥巴马的竞选活动中碰到了有关数据挖掘团队的文章。不幸的是,本文对统计算法的实际机制非常模糊。但是,听起来好像一般技术在社会和政治科学中都是众所周知的。既然这不是我的专业领域,那么谁能指出我有关此类技术的(概述)文献吗?

1
无限随机几何图中随机行走的机器人的密度
考虑一个无限随机的几何图,其中节点位置遵循密度为的泊松点过程,并且边距比更近。因此,边的长度遵循以下PDF:dρρ\rhoddd F(l )= { 2 ld2升≤ d0升&gt; dF(升)={2升d2升≤d0升&gt;d f(l)= \begin{cases} \frac{2 l}{d^2} \;\quad l \le d \\ 0 \qquad\; l > d \end{cases} 在上图中,考虑半径的圆内以原点为中心的节点。假设在时间,我们在每个提到的节点内放置了一个微型机器人。也就是说,飞机上机器人的密度由下式给出:吨= 0[R[Rrt = 0Ť=0t=0 G(l )= { ρ升≤ [R0升&gt; dG(升)={ρ升≤[R0升&gt;d g(l)= \begin{cases} \rho \quad l \le r \\ 0 \quad\; l > d \end{cases} ,其中是到原点的距离。下图显示了机器人初始放置的示例。升升l 在每个时间步上,机器人都会随机走近一个邻居。 现在,我的问题是:在,机器人的密度函数是多少?时可以计算密度函数吗?t …

3
如何交互查看大时间序列数据?
我经常处理合理数量的时间序列数据,将50-200百万的倍数与相关的时间戳关联起来,并希望对其进行动态可视化。 是否有现有软件可以有效地做到这一点?库和数据格式如何?缩放缓存是图书馆关注大型时间序列的一个示例。在“缩放缓存”中,数据以几种分辨率汇总,以便更轻松地查看不同分辨率的数据。 编辑:另外,如果还有其他地方我应该问这个问题或寻求答案,请告诉我。

2
Wilcoxon符号秩检验需要序数或区间数据吗?
看过多个在线资源后,我似乎无法得到一个直接的答案。有人可以为我澄清一下序数数据是否足以用于WSRT,如果不是,符号测试是否是合适的选择?最后,这是针对我在大学的学位论文项目,因此,如果可以在答案中包含任何参考文献/文献,那将不胜感激,因为我需要以任何一种方式证明我选择测试的理由,并且到目前为止仅从网站上找到了答案(无法参考!)

2
Gamma随机变量的差异
给定两个独立的随机变量和,差的分布是多少,即?ý 〜ģ 一米米一个(α Ý,β ÿ)d = X - ÿX∼Gamma(αX,βX)X〜G一个米米一个(αX,βX)X\sim \mathrm{Gamma}(\alpha_X,\beta_X)Y∼Gamma(αY,βY)ÿ〜G一个米米一个(αÿ,βÿ)Y\sim \mathrm{Gamma}(\alpha_Y,\beta_Y)D=X−Yd=X-ÿD=X-Y 如果结果不为人所知,我将如何得出结果?

2
有影响的残差与异常值
首先,我应该声明已经在该站点上搜索了答案。我或者没有找到可以回答我问题的问题,或者我的知识水平太低,以至于我没有意识到自己已经阅读了答案。 我正在为AP统计考试学习。我必须学习线性回归,主题之一是残差。它有一份第253页的统计和数据分析简介副本。 双变量数据集中的异常点是那些在方向或方向上与散点图中的大多数其他点都偏离的点Xxxyyy 如果观察值的值与其余数据(在方向上与其余数据分开)相距甚远,则可能是有影响的观察。为了确定该观察结果是否确实具有影响力,我们评估该观察结果的去除是否对最小二乘法斜率或截距的值有很大影响。xxxxxx 如果观察值具有较大的残差,则为异常值。离群值观察值在方向上远离最小二乘法线。yyy Stattreck.com列出了四种根据残差确定异常值的方法: 与整体模式差异很大的数据点称为离群值。有四种方法可以将数据点视为异常值。 与其他数据点相比,它可能具有极限X值。 与其他数据点相比,它可能具有极高的Y值。 它可能具有极高的X和Y值。 即使没有极高的X或Y值,也可能与其余数据相距甚远。 这两个来源似乎相互冲突。谁能帮我消除困惑。另外,如何定义极端。如果数据点位于(Q1-1.5IQR,Q3 + 1.5IQR)之外,则AP Statistics使用该规则,这是一个异常值。我不知道如何仅通过残差图来应用它。

1
如何计算共同信息?
我有点困惑。有人可以向我解释如何基于以二进制项出现为权重的项文档矩阵计算两个项之间的互信息吗? d ø Ç ù 米ë Ñ 吨1d ø Ç ù 米ë Ñ 吨2d ø Ç ù 米ë Ñ 吨3′w ^^ h ÿ′1个1个1个′HØ w ^′1个01个′w ^ħ È Ñ′1个1个1个′w ^^ h è [R é′1个00′w ^Hÿ′′HØw′′w ^HËñ′′w ^HË[RË′dØCü米ËñŤ1个1个1个1个1个dØCü米ËñŤ21个01个0dØCü米ËñŤ31个1个1个0 \begin{matrix} & 'Why' & 'How' & 'When' & 'Where' \\ Document1 & 1 & …

2
用逻辑函数转换的高斯随机变量的期望值
逻辑函数和标准差通常都表示为。我将使用和作为标准偏差。σσ\sigmaσ(x)=1/(1+exp(−x))σ(x)=1/(1+exp⁡(−x))\sigma(x) = 1/(1+\exp(-x))sss 我有一个逻辑输入随机输入的逻辑神经元,其均值和标准差我所知。我希望可以通过一些高斯噪声很好地估计出与平均值的差。因此,略微使用符号,假定它产生。的期望值是多少?与或相比,标准偏差可能大或小。理想值的良好闭合形式近似值几乎与闭合形式解决方案一样好。μμ\musssσ(μ+N(0,s2))=σ(N(μ,s2))σ(μ+N(0,s2))=σ(N(μ,s2))\sigma(\mu + N(0,s^2))=\sigma(N(\mu,s^2))σ(N(μ,s2))σ(N(μ,s2))\sigma(N(\mu,s^2))sssμμ\mu111 我认为不存在封闭形式的解决方案。这可以看作是卷积,并且逻辑密度的特征函数是已知的(),但是我不确定有什么帮助。该逆符号计算器无法识别密度物流配送的密度的卷积和标准正态分布,这说明,但并不能证明没有简单的基本积分。更多的间接证据:在一些将高斯输入噪声添加到具有逻辑神经元的神经网络的论文中,这些论文也未给出封闭形式的表达式。πt csch πtπt csch πt\pi t ~\text{csch} ~\pi t000 这个问题产生于试图了解玻尔兹曼机中平均场近似的误差。

2
PyMC中两个正态分布的拟合模型
由于我是一名试图学习更多统计信息的软件工程师,因此我什至在开始之前就必须原谅我,所以这是一个严重的问题。 我一直在学习PyMC,并通过一些(非常)简单的示例进行研究。我无法使用(并且无法找到任何相关示例)的一个问题是将模型拟合到由两个正态分布生成的数据。 假设我有1000个值;从a生成Normal(mean=100, stddev=20)500个,从a生成另一个500个Normal(mean=200, stddev=20)。 如果我想对它们拟合模型,即使用PyMC确定两个均值和单个标准差。我知道这有点像... mean1 = Uniform('mean1', lower=0.0, upper=200.0) mean2 = Uniform('mean2', lower=0.0, upper=200.0) precision = Gamma('precision', alpha=0.1, beta=0.1) data = read_data_from_file_or_whatever() @deterministic(plot=False) def mean(m1=mean1, m2=mean2): # but what goes here? process = Normal('process', mu=mean, tau=precision, value=data, observed=True) 也就是说,生成过程是正常的,但是mu是两个值之一。我只是不知道如何表示值来自m1还是之间的“决定” m2。 也许我只是完全采用了错误的方法来对此建模?谁能给我指出一个例子?我可以读BUGS和JAGS,所以真的没事。
10 modeling  python  pymc 

1
低轮廓宽度是否意味着数据几乎没有底层结构?
我是序列分析的新手,我想知道如果基于最优匹配的不相似矩阵的聚类分析的平均轮廓宽度(ASW)低(约25),您将如何应对?可以得出这样的结论:似乎几乎没有底层结构可以使序列聚类,这似乎很合适吗?您是否可能会忽略基于群集质量其他度量的较低的ASW(我在下面粘贴了一些内容)?还是在序列分析或后续聚类分析过程中做出的选择可能是造成低ASW数量的原因? 任何建议,将不胜感激。谢谢。 如果需要更多上下文: 我正在研究20多岁之间的624个工时不匹配序列(即,一个人喜欢在一周内工作的小时数与他们实际工作的小时数之间的不匹配)。我正在检查的所有序列的长度都为10。我的序列对象具有五个状态(M =想要更多的小时,S =想要相同的小时,F =想要更少的小时,O =劳动力不足,U =失业) )。 我没有对ASW结果如何随方法的不同组合而变化进行系统的说明。尽管如此,我还是尝试了中低indel成本(最大替代成本的.1和.6,我更关心事件的顺序,而不是它们的时间安排)和不同的聚类过程(病房,平均数和pam)。我的总体印象是ASW数量仍然很低。 较低的ASW结果可能是有道理的。我希望这些状态以各种不同的顺序出现,并且这些状态可以重复。删除重复的观测值只会将N从624降低到536。研究数据表明,确实存在很多变化和顺序,我认为这非常不同,例如,人们一直想要相同的时间,出现了不匹配的情况,解决了失配,并且在有失配与没有失配之间来回摆动。也许缺少清晰区分的集群与缺少有趣的变化不是一回事。但是,较弱的聚类结果似乎使我无法很好地总结序列。 Ward方法的结果,插入缺失设置为0.1的替代成本为2。这些统计数据似乎表明6聚类解决方案可能很好。但是,ASW很低-至少对于群集数量合理的解决方案(2或3太少)。 PBC HG HGSD ASW ASWw CH R2 CHsq R2sq HC cluster2 0.56 0.78 0.75 0.38 0.38 110.76 0.15 241.65 0.28 0.14 cluster3 0.51 0.68 0.65 0.27 0.27 108.10 0.26 237.60 0.43 0.17 cluster4 0.54 0.74 0.71 0.25 …


2
用ACF和PACF解释季节性
我有一个数据集,凭经验凭直觉说我应该期望每周都有季节性(即星期六和星期日的行为不同于一周的其余时间)。这个前提是否正确,自相关图是否应该让我以7的倍数倍数出现猝发? 这是数据示例: data = TemporalData[{{{2012, 09, 28}, 19160768}, {{2012, 09, 19}, 19607936}, {{2012, 09, 08}, 7867456}, {{2012, 09, 15}, 11245024}, {{2012, 09, 04}, 0}, {{2012, 09, 21}, 24314496}, {{2012, 09, 12}, 11233632}, {{2012, 09, 03}, 9886496}, {{2012, 09, 09}, 9122272}, {{2012, 09, 24}, 23103456}, {{2012, 09, 20}, 25721472}, {{2012, 09, …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.