统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
从样本中分离出两个总体
我正在尝试从单个数据集中分离出两组值。我可以假设其中一个总体是正态分布的,并且至少是样本大小的一半。第二个的值都低于或高于第一个的值(分布未知)。我要尝试做的是找到上限和下限,以将正常分布的人群与其他人群隔离开来。 我的假设为我提供了起点: 样本四分位数范围内的所有点均来自正态分布的总体。 我正在尝试测试是否将异常值从样本的其余部分中提取出来,直到它们不适合正态分布总体的第3个标准差。这不是理想的,但似乎会产生足够的结果。 我的假设在统计上合理吗?有什么更好的方法来解决这个问题? ps请修复某人的标签。

2
使用时间序列分析来分析/预测暴力行为
这是一个很简单的问题,但是我对答案很感兴趣。我在精神病院工作,我有三年的数据,每天从每个病房收集有关该病房暴力程度的信息。 显然,适合这些数据的模型是时间序列模型。为了使它们更加正常,我不得不改变分数。我用差异数据拟合ARMA模型,而我认为最合适的模型是滞后2时具有一阶差分和一阶自相关的模型。 我的问题是,该模型到底可以用于什么?关于野兔数量和油价,时间序列在教科书中似乎总是非常有用,但是现在我已经做了我自己的研究,结果似乎是如此抽象以至于完全不透明。得分的差异在第二个滞后时彼此相关,但是我不能真正建议所有人在所有严重事件发生后的第二天都保持高度警惕。 可以吗

5
何时使用多个模型进行预测?
这是一个相当普遍的问题: 我通常发现,在尝试从样本中预测时间序列时,使用多个不同的模型要优于一个模型。有没有好的论文证明模型的组合将胜过单个模型?结合多个模型是否有最佳实践? 一些参考: Hui Zoua,Yuhong Yang “结合时间序列模型进行预测” International Journal of Forecasting 20(2004)69– 84

2
GLM族代表响应变量或残差的分布?
我一直在与几个实验室成员讨论这个问题,我们已经到了多个来源,但仍然没有答案: 当我们说一个GLM有一个泊松族时,我们说的是在谈论残差或响应变量的分布吗? 争论点 阅读此文章也指出,GLM的假设是观察的统计独立性,链接和方差函数的正确规范(这让我想起了残差,不响应变量),计量正确的比例为响应变量且缺乏单点的不当影响 这个问题有两个答案,每个答案都有两点,出现的第一个是关于残差的,第二个是关于响应变量的,是吗? 在此博客文章中,当谈到假设时,他们说“ 残差的分布可以是其他分布,例如二项式 ” 在年初这一章他们说,错误的结构必须是泊松,但残差必将有积极和消极的价值观,怎么可能泊松? 这个问题经常在诸如此类的问题中被引用,以使它们重复,但没有公认的答案 这个问题的答案谈论的是回应而不是残差 在这个从Pensilvania大学课程说明他们谈论的假设,而不是残差响应变量

1
在“随机森林”中,为什么在节点级别而不是树级别上选择特征的随机子集?
我的问题:为什么随机森林会考虑特征的随机子集,以便在每棵树的节点级别而不是树级别进行拆分? 背景:这是一个历史问题。田锦镐(Tin Kam Ho)于1998年发表了有关构建“决策森林”的论文,该文章随机选择了用于生长每棵树的特征子集。几年后,在2001年,Leo Breiman发表了他的开创性的《随机森林》论文,其中特征子集是随机的。在每个树内的每个节点上选择,而不是在每个树上选择。尽管Breiman引用了Ho,但他没有具体说明从树级到节点级随机特征选择的过程。 我想知道是什么推动了这一发展。似乎在树级别选择特征子集仍会完成树的所需解相关。 我的理论:我在其他地方都没有看到过这种说法,但是就获得特征重要性的估计而言,随机子空间方法似乎效率较低。为了获得重要程度的估计值,对于每棵树,将特征一一随机排列,并记录袋外观察结果的错误分类增加或错误增加。因这种随机排列而导致错误分类或错误增加的变量很高,是那些具有最高重要性的变量。 如果我们用随机子空间的方法,每棵树,我们只考虑的功能。可能要花几棵树才能考虑所有预测变量。另一方面,如果我们在每个节点上考虑特征的不同子集,则在更少的树之后我们将考虑每个特征更多次,从而使我们对特征重要性的估计更加可靠。mmmppppppmimim_ippp 到目前为止,我所看的是:到目前为止,我已经阅读了Breiman的论文和Ho的论文,并进行了广泛的在线搜索以比较方法,而没有找到确切的答案。请注意,之前曾问过类似的问题。通过将我的推测/工作纳入可能的解决方案,这个问题进一步扩大了。我会对比较这两种方法的任何答案,相关引文或模拟研究感兴趣。如果没有结果,我计划比较两种方法来运行自己的仿真。

1
在二进制分类设置中,准确性是否是不正确的评分规则?
我最近一直在学习针对概率分类器的正确评分规则。该网站上的多个主题强调了准确性是不正确的评分规则,不应将其用于评估概率模型(如逻辑回归)生成的预测的质量。 但是,我阅读的许多学术论文都给出了误分类的损失,以此作为二进制分类设置中(非严格)正确评分规则的一个示例。我能找到的最清晰的解释是在本文的第7页底部。据我所知,使分类错误的损失最小化等于使准确性最大化,并且本文中的方程式很直观。 例如:使用本文的表示法,如果感兴趣类别的真实条件概率(给定某些特征向量x)为η= 0.7,则任何预测q > 0.5的预期损失R(η| q)= 0.7(0)+ 0.3(1)= 0.3,则任何q 0.5都将具有0.7的预期损失。因此,损失函数在q =η= 0.7时将最小化,因此是适当的;从那里到真正条件概率和预测整个范围的泛化似乎很简单。≤≤\leq 假设以上计算和陈述正确无误,那么最小值的缺点就很明显,所有高于0.5的预测均具有相同的最小预期损失。我仍然没有理由在诸如log得分,Brier得分等传统方法上使用准确性。但是,在二进制环境中评估概率模型时,说准确性是一个正确的评分规则是正确的吗?错误-是我对分类错误的理解,还是将其等同于准确性?

2
将回归系数平均以建立模型是否存在任何理论问题?
我想构建一个回归模型,该模型是多个OLS模型的平均值,每个模型都基于完整数据的子集。其背后的思想是基于本文的。我创建k个折叠并建立k个OLS模型,每个模型都基于没有折叠之一的数据。然后,我平均回归系数以获得最终模型。 这让我印象深刻,类似于随机森林回归,其中建立了多个回归树并将其平均。但是,平均OLS模型的性能似乎比仅在整个数据上构建一个OLS模型差。我的问题是:为多个OLS模型求平均有理论上的错误或不合需要的理由吗?我们可以期望平均多个OLS模型来减少过度拟合吗?下面是一个R示例。 #Load and prepare data library(MASS) data(Boston) trn <- Boston[1:400,] tst <- Boston[401:nrow(Boston),] #Create function to build k averaging OLS model lmave <- function(formula, data, k, ...){ lmall <- lm(formula, data, ...) folds <- cut(seq(1, nrow(data)), breaks=k, labels=FALSE) for(i in 1:k){ tstIdx <- which(folds==i, arr.ind = TRUE) tst <- …

1
对Halmos-Savage定理的直觉理解
所述Halmos-野蛮定理说,对一个主导统计模型(Ω ,A,P)(Ω,A,P)(\Omega, \mathscr A, \mathscr P)的统计T:(Ω,A,P)→(Ω′,A′)T:(Ω,A,P)→(Ω′,A′)T: (\Omega, \mathscr A, \mathscr P)\to(\Omega', \mathscr A')是足够的,如果(且仅当)的所有{P∈P}{P∈P}\{P \in \mathscr{P} \} 有一个TTT氡Nikodym导衍生物的-measurable版本dPdP∗dPdP∗\frac{dP}{dP*},其中dP∗dP∗dP*是特权的措施,使得P∗=∑∞i=1PiciP∗=∑i=1∞PiciP*=\sum_{i=1}^\infty P_i c_i 为ci>0,∑∞i=1ci=1ci>0,∑i=1∞ci=1c_i >0, \sum _{i=1}^\infty c_i =1个Pi∈PPi∈PP_i \in \mathscr P。 我试图直观地理解为什么该定理成立,但我没有成功,所以我的问题是是否存在一种直观的方法来理解该定理。

11
标准偏差完全错误吗?如何计算高度,计数等(正数)的std?
假设我正在计算高度(以厘米为单位),并且数字必须大于零。 这是示例列表: 0.77132064 0.02075195 0.63364823 0.74880388 0.49850701 0.22479665 0.19806286 0.76053071 0.16911084 0.08833981 Mean: 0.41138725956196015 Std: 0.2860541519582141 在此示例中,根据正态分布,值的99.7%必须在平均值的标准偏差的±3倍之间。但是,即使两次标准偏差也变为负值: -2 x std calculation = 0.41138725956196015 - 0.2860541519582141 x 2 = -0,160721044354468 但是,我的数字必须为正。因此它们必须大于0。我可以忽略负数,但是我怀疑这是使用标准差计算概率的正确方法。 有人可以帮助我了解我是否以正确的方式使用它吗?还是我需要选择其他方法? 老实说,数学就是数学。是否为正态分布都没有关系。如果它适用于无符号数字,那么它也应适用于正数!我错了吗? 编辑1:添加直方图 更清楚地说,我添加了我的真实数据的直方图 EDIT2:一些值 Mean: 0.007041500928135767 Percentile 50: 0.0052000000000000934 Percentile 90: 0.015500000000000047 Std: 0.0063790857035425025 Var: 4.06873389299246e-05

1
高斯混合模型的不同协方差类型
在这里尝试使用高斯混合模型时,我发现了这4种协方差。 'full' (each component has its own general covariance matrix), 'tied' (all components share the same general covariance matrix), 'diag' (each component has its own diagonal covariance matrix), 'spherical' (each component has its own single variance). 我在Google上进行了大量搜索,以找到有关每种类型的更多详细信息,但仅找到了非常高级的描述(例如this)。 欣赏有人可以帮助我理解这些内容,或者至少将我引导到可以阅读这些内容的地方。

1
R中二项式glm中响应的输入格式
在中R,有三种方法可以使用glm函数来格式化输入数据以进行逻辑回归: 对于每个观察,数据可以采用“二进制”格式(例如,对于每个观察,y = 0或1); 数据可以采用“ Wilkinson-Rogers”格式(例如y = cbind(success, failure)),每一行代表一种治疗;要么 数据可以是每个观测值的加权格式(例如,y = 0.3,权重= 10)。 这三种方法均产生相同的系数估计值,但自由度以及由此产生的偏差值和AIC分数不同。后两种方法具有较少的观测值(因此也具有自由度),因为它们将每种处理用于观测值的数量,而第一种方法将每种观测值用作观测值的数量。 我的问题:使用一种输入格式比使用另一种输入格式有数字或统计优势吗?我看到的唯一好处是不必重新格式化数据R即可与模型一起使用。 我查看了glm文档,在网络上搜索了该站点,发现了一个与切向相关的帖子,但没有有关该主题的指导。 这是一个模拟示例,演示了此行为: # Write function to help simulate data drc4 <- function(x, b =1.0, c = 0, d = 1, e = 0){ (d - c)/ (1 + exp(-b * (log(x) - log(e)))) } # …

2
为什么带有LSTM单位的RNN也会遭受“爆炸梯度”的困扰?
我对RNN(尤其是LSTM单元)的工作方式有基本的了解。我对LSTM单元的体系结构有一个构想,即一个单元和几个门,它们调节值的流动。 但是,显然,我还没有完全理解LSTM如何解决“消失梯度和爆炸梯度”问题,该问题是在训练中使用常规RNN通过时间进行反向传播而发生的。我没有机会阅读论文以完全理解数学。 该答案简要说明了具有LSTM单位的RNN如何解决“消失梯度”问题。从数学上讲,原因似乎是不存在的导数不存在,即不趋于零。因此,作者指出:“至少存在一条不消失梯度的路径”。恕我直言,这种解释有点含糊。 同时,我正在阅读论文《使用神经网络进行序列学习》(作者:Ilya Sutskever,Oriol Vinyals,Quoc V. Le),在该论文的“ 3.4培训细节”部分中有说明 尽管LSTM往往不会遭受梯度消失的困扰,但它们可能会出现爆炸梯度。 我一直认为,带有LSTM单元的RNN可以解决“消失”和“爆炸梯度”的问题,但是,显然,带有LSTM单元的RNN也会遭受“爆炸梯度”的困扰。 凭直觉,为什么?从数学上讲,原因是什么?

5
为什么大数据集的梯度下降效率不高?
假设我们的数据集包含一百万个示例,即,并且我们希望使用梯度下降对这些数据集执行逻辑或线性回归。x1,…,x106x1,…,x106x_1, \ldots, x_{10^6} 梯度下降法使效率低下是什么? 回想一下在时间处的梯度下降步长为:ttt wt+1=wt+ηt∇f(x)wt+1=wt+ηt∇f(x)w_{t+1} = w_{t} + \eta_t \nabla f(x) 其中是损失函数。fff 我没有发现上述步骤导致算法效率低下的任何异常情况。它是的计算吗?不能预先计算此操作,即已经计算出每个,并只是在每个数据点对其求值∇f(x)∇f(x)\nabla f(x)∂f∂x∂f∂x\frac{\partial f}{\partial x}xi?xi?x_i?

3
了解MCMC:替代方案是什么?
第一次学习贝叶斯统计;作为理解MCMC的一个角度,我想知道:这是做根本上无法通过其他方式完成的事情,还是只是比其他方法更有效? 通过说明的方式,假设在给定数据P(x,y,z|D)P(x,y,z|D)P(x,y,z|D)的模型的情况下,我们正在尝试计算参数的概率,给定一个计算相反参数P(D|x,y,z)P(D|x,y,z)P(D|x,y,z)。为了直接用贝叶斯定理计算,我们需要这里指出的分母。但是我们可以通过积分来计算它,如下所示:P(D)P(D)P(D) p_d = 0. for x in range(xmin,xmax,dx): for y in range(ymin,ymax,dy): for z in range(zmin,zmax,dz): p_d_given_x_y_z = cdf(model(x,y,z),d) p_d += p_d_given_x_y_z * dx * dy * dz 那会行得通吗(尽管使用大量变量时效率很低),还是有其他原因会使这种方法失败?
13 bayesian  mcmc 

2
SpaCy中的.similarity方法如何计算?
如果这是正确的堆栈站点,则不能确定,但​​是可以。 .similiarity方法如何工作? 哇,太棒了!它的tfidf模型可能更容易,但是只有一行代码的w2v? 在他的 关于spaCy和 razhribernik的10行教程中,向我们展示了可以在令牌,发送,词块和文档上运行的.similarity方法。 之后nlp = spacy.load('en'),doc = nlp(raw_text) 我们可以在令牌和块之间进行.likeness查询。但是,此.similarity方法在后台计算了什么? SpaCy已经非常简单.vector,可以根据GloVe模型的训练来计算w2v向量(a .tfidf或.fasttextmethod会有多酷?)。 模型是简单地计算这两个w2v,.vector,向量之间的余弦相似度还是比较其他矩阵?具体细节在文档中不清楚; 任何帮助表示赞赏!

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.