统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
独立泊松过程超越另一个泊松过程的可能性
我之前已经在其他stackexchanges上以其他方式问过这个问题,因此对您的重新发布感到抱歉。 我问过我的教授和几个博士生,但没有确切的答案。我将首先陈述问题,然后陈述我的潜在解决方案以及我的解决方案所存在的问题,对不起。 问题: 假设两个独立的Poisson进程MMM和,和的间隔相同,但受。在任何时间点,随着时间趋于无穷大,流程的合计输出大于流程加的合计输出即的概率是多少。为了举例说明,假设有两个桥和,平均和汽车在桥和RRRλRλR\lambda_RλMλM \lambda_MλR>λMλR>λM\lambda_R>\lambda_MMMMRRRDDDP(M>R+D)P(M>R+D)P(M>R+D)RRRMMMλRλR\lambda_RλMλM\lambda_MRRRλ ř > λ 中号 d - [R 中号řMMM每个时间间隔和。辆汽车已经驶过桥,那么在任何时间点上总共有超过辆汽车驶过桥的概率是多少。λR>λMλR>λM\lambda_R>\lambda_MDDDRRRMMMRRR 解决这个问题的方法: 首先,我们定义两个泊松过程: M(I)∼Poisson(μM⋅I)R(I)∼Poisson(μR⋅I)M(I)∼Poisson⁡(μM⋅I)R(I)∼Poisson⁡(μR⋅I)M(I) \sim \operatorname{Poisson}(\mu_M\cdot I ) \\ R(I) \sim \operatorname{Poisson}(\mu_R\cdot I ) \\ 下一步是在给定数量的间隔之后找到描述的函数。这将在发生的情况下的条件上的输出,对于所有非负值。为了说明,如果总产是然后总产必须大于。如下所示。P(M>R+D)P(M>R+D)P(M>R+D)IIIM(I)>k+DM(I)>k+DM(I)>k+DR(I)=kR(I)=kR(I)=kkkkRRRXXXMMMX+DX+DX+D P(M(I))>R(I)+D)=∑k=0n[P(M(I)>k+D∪R(I)=k)]P(M(I))>R(I)+D)=∑k=0n[P(M(I)>k+D∪R(I)=k)]P(M(I))>R(I)+D)=\sum_{k=0}^n \bigg [P(M(I) >k+D\cup R(I)=k) \bigg] n→∞n→∞n\rightarrow \infty 由于独立性,可以将其重写为两个元素的乘积,其中第一个元素是Poisson分布的1-CDF,第二个元素是Poisson pmf: P(M(I)>R(I)+D)=∑k=0n[P(M(I)>k+D)1−Poisson CDF⋅P(R(I)=k)Poisson pmf]P(M(I)>R(I)+D)=∑k=0n[P(M(I)>k+D)⏟1−Poisson CDF⋅P(R(I)=k)⏟Poisson pmf]P(M(I)>R(I)+D)=\sum_{k=0}^n \bigg [\underbrace{P(M(I)> k+D)}_{1-\text{Poisson CDF}}\cdot \underbrace{P(R(I)=k)}_\text{Poisson pmf} \bigg] …

4
训练神经网络进行回归总是可以预测均值
我正在训练一个简单的卷积神经网络进行回归,其中的任务是预测图像中盒子的(x,y)位置,例如: 网络的输出有两个节点,一个用于x,一个用于y。网络的其余部分是标准的卷积神经网络。损失是盒子的预测位置和地面真实位置之间的标准均方误差。我正在训练10000张这些图像,并在2000年进行验证。 我的问题是,即使经过大量培训,损失也不会真正减少。观察网络的输出后,我注意到对于两个输出节点,网络都倾向于输出接近零的值。这样,盒子位置的预测始终是图像的中心。预测中存在一些偏差,但始终在零附近。下面显示了损失: 我已经运行了比此图所示更多的时期,并且损失仍然从未减少。有趣的是,损失实际上增加了一点。 因此,似乎网络只是在预测训练数据的平均值,而不是学习合适的数据。关于这可能是什么的任何想法?我使用Adam作为优化器,初始学习率为0.01,并将relus作为激活 如果您对我的某些代码(Keras)感兴趣,请参见以下代码: # Create the model model = Sequential() model.add(Convolution2D(32, 5, 5, border_mode='same', subsample=(2, 2), activation='relu', input_shape=(3, image_width, image_height))) model.add(Convolution2D(64, 5, 5, border_mode='same', subsample=(2, 2), activation='relu')) model.add(Convolution2D(128, 5, 5, border_mode='same', subsample=(2, 2), activation='relu')) model.add(Flatten()) model.add(Dense(100, activation='relu')) model.add(Dense(2, activation='linear')) # Compile the model adam = Adam(lr=0.01, beta_1=0.9, …

1
如何突出显示时间序列中的嘈杂补丁?
我有很多时间序列数据-水位和速度与时间的关系。它是水力模型仿真的输出。作为检查过程的一部分,以确认模型是否按预期运行,我必须绘制每个时间序列图,以确保数据中没有“摆动”(请参见下面的示例轻微摆动)。使用建模软件的UI是一种非常缓慢且费力的检查数据的方法。因此,我编写了一个简短的VBA宏,以将模型中的各种数据(包括结果)导入Excel并一次将其全部绘制出来。我希望编写另一个简短的VBA宏来分析时间序列数据并突出显示任何可疑的部分。 到目前为止,我唯一的想法就是可以对数据的斜率进行一些分析。在给定的搜索窗口内,斜率多次从正变为负的快速变化的任何地方都可以归类为不稳定。我是否缺少任何更简单的技巧?本质上,“稳定”模拟应提供非常平滑的曲线。任何突然的变化都可能是计算不稳定的结果。

1
为什么在论文中很少报道Anova结果中使用哪种平方和?
根据我短暂的统计经验,似乎用于获得方差分析结果的平方和类型(I,II,III,IV等)可能会极大地影响测试结果(尤其是存在相互作用且缺失的模型)数据)。但是,我还没有看到一篇报告它的论文。为什么会这样? 如果有人能提供一种示例文件以某种方式报告该报告(而不是统计信息本身),或者不常见的原因,我将不胜感激。

1
具有模拟功能的重要性抽样低于预期的覆盖率
我正在尝试回答R中的重要性抽样评估方法积分问题。基本上,用户需要计算 ∫π0f(x)dx=∫π01cos(x)2+x2dx∫0πf(x)dx=∫0π1cos⁡(x)2+x2dx\int_{0}^{\pi}f(x)dx=\int_{0}^{\pi}\frac{1}{\cos(x)^2+x^2}dx 使用指数分布作为重要性分布 q(x)=λ exp−λxq(x)=λ exp−λxq(x)=\lambda\ \exp^{-\lambda x} 并找到的值,该值可以更好地逼近积分(是)。我重铸问题,因为平均值的评价μ的˚F (X )超过[ 0 ,π ]:积分然后只是π μ。 λλ\lambdaself-studyμμ\muf(x)f(x)f(x)[0,π][0,π][0,\pi]πμπμ\pi\mu 因此,让是的PDF X 〜ù(0 ,π ),并且让ÿ 〜˚F (X ):现在的目标是估计p(x)p(x)p(x)X∼U(0,π)X∼U(0,π)X\sim\mathcal{U}(0,\pi)Y∼f(X)Y∼f(X)Y\sim f(X) μ=E[Y]=E[f(X)]=∫Rf(x)p(x)dx=∫π01cos(x)2+x21πdxμ=E[Y]=E[f(X)]=∫Rf(x)p(x)dx=∫0π1cos⁡(x)2+x21πdx\mu=\mathbb{E}[Y]=\mathbb{E}[f(X)]=\int_{\mathbb{R}}f(x)p(x)dx=\int_{0}^{\pi}\frac{1}{\cos(x)^2+x^2}\frac{1}{\pi}dx 使用重要性抽样。我在R中进行了仿真: # clear the environment and set the seed for reproducibility rm(list=ls()) gc() graphics.off() set.seed(1) # function to be integrated f <- function(x){ 1 …

2
在纵向研究中估计平均治疗效果的最佳方法是什么?
在一项纵向研究中,在时间点上重复测量了单位结果,总共有固定的测量时机(固定=单位测量同时进行)。我吨米Yitÿ一世ŤY_{it}i一世itŤtm米m 将单位随机分配给治疗或对照组。我想估计和测试平均治疗效果,即其中期望是跨时间和跨个人的。为此,我考虑使用固定时间的多层次(混合效果)模型:G = 0 A T E = E (Y | G = 1 )− E (Y | G = 0 ),G=1G=1个G=1G=0G=0G=0ATE=E(Y|G=1)−E(Y|G=0),ATE=E(Y|G=1)−E(Y|G=0),ATE=E(Y | G=1) - E(Y | G=0), Yit=α+βGi+u0i+eitYit=α+βGi+u0i+eitY_{it} = \alpha + \beta G_i + u_{0i} + e_{it} 与截距,的,横跨单元的无规截距,和残留。β 甲Ť é ù ëαα\alphaββ\betaATEATEATEuuueee 现在我正在考虑替代模型 Yit=β~Gi+∑j=1mκjdij+∑j=1mγjdijGi+u~0i+e~itYit=β~Gi+∑j=1mκjdiĴ+∑Ĵ=1个米γĴd一世ĴG一世+ü〜0一世+Ë〜一世ŤY_{it} = \tilde{\beta} G_i + \sum_{j=1}^m …


2
线性回归:*为什么*可以划分平方和?
这篇文章引用了一个二元线性回归模型。我一直将基于信度的总平方和(SSTO)分为误差平方和(SSE)和模型的平方和(SSR),但是一旦我开始认真考虑,我就不明白为什么起作用...Yi=β0+β1xiYi=β0+β1xiY_i = \beta_0 + \beta_1x_i 我的部分不理解: yiyiy_i:y的观测值 y¯y¯\bar{y}:所有观测到的 s 的平均值yiyiy_i y^iy^i\hat{y}_i:给定观察值x的y的拟合/预测值 yi−y^iyi−y^iy_i - \hat{y}_i:残差/误差(如果平方和加总为所有观察值,则为SSE) y^i−y¯y^i−y¯\hat{y}_i - \bar{y}:模型拟合值与平均值相差多少(如果对所有观察值进行平方和加和,则为SSR) yi−y¯yi−y¯y_i - \bar{y}:观测值与平均值相差多少(如果对所有观测值进行了求和,则为SSTO)。 我可以理解为什么,对于一次观察,不求平方,。我能理解为什么,如果要将所有观测值相加,则必须将它们平方,否则它们的总和将为0。(yi−y¯)=(y^i−y¯)+(yi−y^i)(yi−y¯)=(y^i−y¯)+(yi−y^i)(y_i - \bar{y}) = (\hat{y}_i - \bar{y}) + (y_i - \hat{y}_i) 我不明白的部分是为什么(例如,SSTO = SSR + SSE)。看来,如果您遇到,那么,而不是。为什么这里不是这种情况?(yi−y¯)2=(y^i−y¯)2+(yi−y^i)2(yi−y¯)2=(y^i−y¯)2+(yi−y^i)2(y_i - \bar{y})^2 = (\hat{y}_i - \bar{y})^2 + (y_i - \hat{y}_i)^2A=B+CA=B+CA = B + CA2=B2+2BC+C2A2=B2+2BC+C2A^2 …

1
根据数学理论从“倾斜均匀分布”生成随机数
出于某种目的,我需要从“倾斜均匀”分布中生成随机数(数据)。该分布的“斜率”可能会在某个合理的间隔内变化,然后我的分布应基于该斜率从均匀变为三角形。这是我的推论: 让我们简化一下,生成数据格式为到000(蓝色,红色是均匀分布)。为了获得蓝线的概率密度函数,我只需要那条线的方程式。从而:乙BB F(x )= t g(φ )X + ÿ(0 )f(x)=tg(φ)x+Y(0)f(x) = tg(\varphi)x + Y(0) 由于(图片): Ť g ^(φ )ÿ(0 )= 1 / B - Y(0 )B / 2= 1乙- 吨克(φ )B2tg(φ)=1/B−Y(0)B/2Y(0)=1B−tg(φ)B2\begin{align} tg(\varphi) &= \frac{1/B - Y(0)}{B/2} \\[5pt] Y(0) &= \frac{1}{B} - tg(\varphi)\frac{B}{2} \end{align} 我们有: F(x )= t g(φ )X + …

1
了解LSTM拓扑
和其他许多人一样,我发现这里和这里的资源对于理解LSTM单元非常有用。我确信我了解值是如何流动和更新的,并且我也有足够的信心添加上述“窥孔连接”等。 在我的示例中,每个时间步长都有一个输入向量length i和一个输出向量length in o,其中o < i。 这两页都没有真正涵盖的是如何安排和培训这些内容。 我有两个问题: 在我的训练数据中,我有很多输入/输出向量对,它们对应许多很多时间单位。假设我用所有数据训练LSTM。然后可以通过它运行任意长度的输入集吗?我的意思是,如果我有整个2015年和2016年的培训数据,那么我可以通过网络运行2017年的数据吗?还是从2017年到2020年? 根据我所读的内容,感觉每个时间单位都有一个LSTM单元,因此,如果我有很多时间单位,那么我会有许多链接的LSTM单元。由于链的长度取决于我要通过网络运行的数据的长度,并且大概是任意的,所以我看不到如何训练它,除非我只训练一个LSTM单元,然后将其复制为一个数字次。因此,似乎我将训练一个LSTM单元,然后n将它们链接在一起以获得给定长度的输入矢量列表n?即使单个LSTM单元包含许多元素和功能,也感觉不足以在这么小的事物中捕获这么多的信息吗? 谢谢。我还有其他(相对较快)可以消耗的资源可以帮助我理解实施细节吗?上面的2个链接给出了正在发生的事情的高级概述,但未能捕获这些更详细的信息。

1
引导程序样本与原始样本完全相同的机会
只想检查一些推理。 如果我的原始样本大小为并且我对其进行引导,那么我的思考过程如下:nnn 1n1n\frac{1}{n}是从原始样本中提取任何观察值的机会。为了确保下一次绘制不是先前采样的观测值,我们将样本大小限制为。因此,我们得到以下模式:n − 1n−1n-1 1n⋅1n−1⋅1n−2⋯1n−(n−1)=1n!.1个ñ⋅1个ñ-1个⋅1个ñ-2⋯1个ñ-(ñ-1个)=1个ñ!。 \frac{1}{n} \cdot \frac{1}{n-1} \cdot \frac{1}{n-2} \cdots \frac{1}{n-(n-1)} = \frac{1}{n!}. 它是否正确?我偶然发现了为什么不能。(1n)n(1个ñ)ñ(\frac{1}{n})^n

1
Kruskal-Wallis内置的R函数与手动计算之间略有不一致
我对以下内容感到困惑,并且无法在其他地方找到答案。 我试图在做一些统计的同时学习R,并且作为练习,我尝试通过像在R中一样“手动”执行这些内置R函数的结果来仔细检查。 ,对于Kruskal-Wallis考试,我一直得到不同的结果,但我不知道为什么。 例如,我正在查看练习中分发的以下数据 activity <- c(2, 4, 3, 2, 3, 3, 4, 0, 4, 3, 4, 0, 0, 1, 3, 1, 2, 0, 3, 1, 0, 3, 4, 0, 1, 2, 2, 2, 3, 2) group <- c(rep("A", 11), rep("B", 10), rep("C", 9)) group <- factor(group) data.raw <- data.frame(activity, …


1
skipgram word2vec的渐变
我正在研究斯坦福大学NLP深度学习班的书面作业问题,网址为http://cs224d.stanford.edu/assignment1/assignment1_soln 我试图了解3a的答案,他们正在寻找中心词向量的导数。 假设你被给予预测的字向量对应于中心字Ç为skipgram,和字预测与在word2vec模型中发现的功能SOFTMAX制成。vcvcv_{c} y^o=p(o|c)=exp(uTovc)∑Ww=1exp(uTwvc)y^o=p(o|c)=exp(uoTvc)∑w=1Wexp(uwTvc)\hat{y}^{o} = p(o | c) = \frac {exp(u_{o}^{T} v_{c})}{\sum_{w=1}^{W}exp(u_{w}^{T} v_{c})} 其中w表示第w个单词,而(w = 1,...,W)是词汇表中所有单词的“输出”单词向量。假定将交叉熵成本应用于此预测,并且单词o是预期单词。uwuwu_w 其中是所有的输出向量的矩阵,并让ÿ是词的SOFTMAX预测的列向量,并且ÿ是独热标签,该标签也是列向量。U=[u1,u2,⋅⋅⋅,uW]U=[u1,u2,···,uW]U = [u_1,u_2, · · · ,u_W ]y^y^\hat{y} 其中交叉熵是CE(y,y^)=−∑iyilog(y^i)CE(y,y^)=−∑iyilog⁡(y^i)CE(y, \hat{y}) = − \sum_iy_i\log(\hat{y}_i) 所以对于梯度为中心矢量答案是∂J∂vc=UT(y^−y).∂J∂vc=UT(y^−y).\frac{∂J}{∂v_c}= U^T(\hat{y} − y). 有人可以告诉我实现此目标的步骤吗?我一直用这个问题作为参考在word2vec交叉熵损失的衍生,但我特别想知道表示。UT(y^−y).UT(y^−y).U^T(\hat{y} − y).

2
为什么不能通过XX'和X'X的特征值分解来获得X的有效SVD?
我正在尝试手工制作SVD: m<-matrix(c(1,0,1,2,1,1,1,0,0),byrow=TRUE,nrow=3) U=eigen(m%*%t(m))$vector V=eigen(t(m)%*%m)$vector D=sqrt(diag(eigen(m%*%t(m))$values)) U1=svd(m)$u V1=svd(m)$v D1=diag(svd(m)$d) U1%*%D1%*%t(V1) U%*%D%*%t(V) 但是最后一行不会返回m。为什么?似乎与这些特征向量的迹象有关...还是我误解了该过程?
9 r  svd  eigenvalues 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.