统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


2
平稳性的直观解释
我在脑海里挣扎了一段时间,这是您的想法吗?任何意见或进一步的想法将不胜感激。 平稳过程是一种生成时间序列值的过程,以使分布平均值和方差保持恒定。严格来说,这称为平稳性的弱形式或协方差/平均平稳性。 平稳性的弱形式是时间序列在整个时间中具有恒定的均值和方差。 简单地说,从业者说,平稳时间序列是没有趋势的-围绕恒定均值波动并且具有恒定方差。 不同滞后之间的协方差是恒定的,它不依赖于时间序列中的绝对位置。例如,t和t-1之间的协方差(一阶滞后)应始终相同(1960-1970年期间与1965-1975年期间或其他任何时期相同)。 在非平稳过程中,该序列不会恢复长期运行。因此,我们说非平稳时间序列并不意味着还原。在那种情况下,方差取决于时间序列中的绝对位置,并且随着时间的流逝方差变为无穷大。从技术上讲,自相关不会随时间衰减,但是在小样本中自相关确实会消失-尽管缓慢。 在固定过程中,冲击是暂时的,并且会随着时间的流逝消散(失去能量)。一段时间后,它们不会对新的时间序列值有所贡献。例如,第二次世界大战之前发生的事件(足够长的时间)产生了影响,但是今天的时间序列就像第二次世界大战从未发生过一样,我们可以说震撼失去了能量或消散。平稳性尤其重要,因为许多经典的计量经济学理论都是在平稳性的假设下得出的。 平稳性的一种强烈形式是,时间序列的分布与波谷时间完全相同。换句话说,原始时间序列的分布与滞后时间序列(有任何数量的滞后)甚至时间序列的子段完全相同。例如,强形式还表明,即使对于子细分市场1950-1960、1960-1970甚至是重叠的时期(如1950-1960和1950-1980),分布也应该相同。这种平稳形式称为强,因为它不假设任何分布。它只说概率分布应该相同。在平稳性较弱的情况下,我们通过均值和方差定义分布。我们可以简化一下,因为我们隐式地假设正态分布,正态分布完全由均值,方差或标准差定义。这只是说序列(在时间序列内)的概率测度与相同时间序列内值的滞后/移位序列的概率测度相同。

3
偏相关大于零阶相关是否有意义?
这可能表明根本缺乏对部分相关的工作原理的理解。 我有3个变量,x,y,z。当我控制z时,x和y之间的相关性会比不控制z时x和y之间的相关性增加。 这有意义吗?我倾向于认为,当控制第三个变量的效果时,相关性应该降低。 谢谢您的帮助!


7
短时间序列值得建模吗?
这是一些背景。我有兴趣确定两个环境变量(温度,营养水平)如何影响11年内响应变量的平均值。每年,都有超过10万个位置的数据。 目的是确定在11年的时间段内,响应变量的平均值是否已响应环境变量的变化(例如,温度升高+更多养分将=更大响应)。 不幸的是,由于响应是平均值(不看平均值,只有规则的年际变化会淹没信号),因此回归将是11个数据点(每年1个平均值),并带有2个解释变量。在我看来,即使数据集非常小,线性正回归也很难被认为是有意义的(除非关系非常强,否则甚至不满足名义上的40点/变量)。 我做这个假设对吗?谁能提供我可能会缺少的其他想法/观点? PS:一些警告:没有等待更多年就无法获取更多数据。因此,可用数据是我们真正需要处理的。

1
什么时候要使用AdaBoost?
正如我听说AdaBoost分类器在工作中反复提到的那样,我想对它的工作原理以及何时使用它有更好的了解。我已经继续阅读了许多在Google上找到的关于它的论文和教程,但是分类器的某些方面仍然难以理解: 我见过的大多数教程都将AdaBoost视为找到许多分类器的最佳加权组合。这对我来说很有意义。没有意义的是AdaBoost似乎只接受一个弱学习者的实现(即MALLET)。这有什么意义?如果只有一个分类器提供给AdaBoost,是否不应该返回权重为1的相同分类器?它如何从第一个分类器产生新的分类器? 何时真正要使用AdaBoost?我已经读过它应该是最好的即用型分类器,但是当我尝试提升MaxEnt分类器时,我得到的f分数达到70%以上,AdaBoost谋杀了它,并给了我f-得分大约是15%,而召回率却很高,而精度却很低。所以现在我很困惑。我什么时候想使用AdaBoost?如果可能的话,我正在寻找更多的直观而不是严格的统计答案。

1
低差异序列中的加扰和相关(Halton / Sobol)
我目前正在一个项目中,在其中使用低差异/准随机点集(例如Halton和Sobol点集)生成随机值。这些本质上是维向量,它们模仿d维均匀(0,1)变量,但分布较好。从理论上讲,它们应该有助于减少项目另一部分中我的估算值的差异。dddddd 不幸的是,我一直在与他们合作时遇到问题,关于它们的许多文献都很密集。因此,我希望从有经验的人那里获得一些见识,或者至少想出一种凭经验评估发生了什么的方法: 如果您曾与他们合作: 到底是什么?它对生成的点流有什么影响?特别是,当生成的点的尺寸增加时,会产生影响吗? 为什么如果我通过MatousekAffineOwen加扰生成两个Sobol点流,则会得到两个不同的点流。当我对Halton点使用反基数加扰时,为什么不是这种情况?这些点集是否还存在其他加扰方法-如果是,是否有MATLAB实现? 如果您尚未与他们合作: 假设我有个假设为随机数的序列S 1,S 2,... ,S n,那么我应该使用哪种类型的统计数据来表明它们之间没有关联?我需要证明什么n才是统计上有意义的?另外,我怎么会做同样的事情,如果我有ň序列小号1,s ^ 2,... ,小号ñ的d维随机[ 0 ,1 ]的载体?nnnS1,S2,…,SnS1,S2,…,SnS_1, S_2, \ldots,S_nnnnnnnS1,S2,…,SnS1,S2,…,SnS_1, S_2, \ldots,S_nddd[0,1][0,1][0,1] 红衣主教回答的后续问题 从理论上讲,我们可以将任何加扰方法与任何低差异序列配对吗?MATLAB只允许我对Halton序列应用反基数加扰,并且想知道这仅仅是实现问题还是兼容性问题。 我正在寻找一种方法,使我可以生成彼此不相关的两个(t,m,s)网。MatouseAffineOwen可以允许我这样做吗?如果我使用确定性加扰算法并简单地决定选择每个以k为质数的'kth'值,该怎么办?

4
比较具有不同因变量的模型的逻辑系数?
这是我几天前问的一个后续问题。我觉得它在这个问题上有不同的倾向,因此列出了一个新问题。 问题是:我可以比较具有不同因变量的模型之间的系数大小吗?例如,我只想说一个例子,就是想知道经济是在众议院还是在总统选举中更能预测投票结果。在这种情况下,我的两个因变量将是众议院的投票(民主党代表1,共和党代表0)和总统投票(民主党代表1,共和党代表0),而我的独立变量是经济。我希望两个办公室都能取得统计上的显著成果,但是我如何评估它在两个方面的作用是否更大?这可能不是一个特别有趣的示例,但是我很好奇是否有一种比较方法。我知道不能只看系数的“大小”。所以,有可能比较具有不同因变量的模型上的系数吗?而且,如果是这样,怎么做? 如果这没有任何意义,请告诉我。所有建议和评论表示赞赏。

2
合并/减少序数或名义数据类别的方法?
我正在努力寻找一种方法来减少名义或有序数据中的类别数量。 例如,假设我要在具有多个名义和有序因素的数据集上构建回归模型。尽管此步骤没有问题,但我经常遇到这样的情况:名义特征在训练集中没有观测值,但随后存在于验证数据集中。当模型出现(到目前为止)看不见的情况时,这自然会导致错误。我想要合并类别的另一种情况是,当类别过多而观察不到时。 所以我的问题是: 虽然我认识到最好根据它们代表的先前真实世界的背景信息来组合许多名义(和次序)类别,但是否有系统的方法(R最好是软件包)可用? 您将针对阈值等提出什么指导和建议? 文学中最受欢迎的解决方案是什么? 除了将较小的名义类别合并为新的“ OTHERS”类别之外,还有其他策略吗? 如果您还有其他建议,请随时输入。

3
将两个直方图按相同比例放置的最佳方法?
假设我有两个分布要详细比较,即以使形状,比例和偏移容易看到的方式比较。做到这一点的一种好方法是绘制每个分布的直方图,将它们放在相同的X比例尺上,然后在另一个下方堆叠。 执行此操作时,应如何进行装箱?即使一个分布比另一个分布更分散,两个直方图是否也应使用​​相同的bin边界,如下面的图像1所示?是否应在缩放之前针对每个直方图分别进行合并,如下面的图像2所示?在这方面是否有很好的经验法则?

6
R中获取由标识符分组的数据帧的第一行的快速方法
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 2年前关闭。 有时,我只需要按标识符将数据集的第一行获取,例如当每个人有多个观察值时检索年龄和性别时。在R中最快(或最快)的方法是什么?我在下面使用了aggregate(),并怀疑还有更好的方法。在发布此问题之前,我在Google上进行了一些搜索,发现并尝试了ddply,但感到惊讶的是它运行速度极慢,并给我数据集上的内存错误(400,000行x 16列,7,000个唯一ID),而aggregate()版本相当快。 (dx <- data.frame(ID = factor(c(1,1,2,2,3,3)), AGE = c(30,30,40,40,35,35), FEM = factor(c(1,1,0,0,1,1)))) # ID AGE FEM # 1 30 1 # 1 30 1 # 2 40 0 # 2 40 0 # 3 35 1 # 3 35 1 ag <- data.frame(ID=levels(dx$ID)) ag <- …
14 r  dataset  aggregation  plyr 

4
我可以在不影响马尔可夫性的情况下更改随机行走MH MCMC中的提案分配吗?
具有对称建议的随机漫步都会区 具有接受概率的性质q(x | y)= 克(| y− x | )q(X|ÿ)=G(|ÿ-X|)q(x|y)= g(|y-x|) P(一个ç ç ë p 吨ÿ )= min { 1 ,f(y)/ f(x )}P(一种CCËpŤ ÿ)=分{1个,F(ÿ)/F(X)}P(accept\ y) = \min\{1, f(y)/f(x)\} 不依赖提案 。G(⋅ )G(⋅)g(\cdot) 这是否意味着我可以更改 根据链的先前性能 g (⋅ ),而不会影响链的马尔可夫性?G(⋅ )G(⋅)g(\cdot) 我特别感兴趣的是根据接受率调整普通提案的比例。 如果有人可以指出在实践中用于此类问题的适应算法,也将不胜感激。 非常感谢。 [编辑:从robertsy和wok给出的参考开始,我发现了以下关于MH自适应算法的参考: Andrieu,Christophe和ÉricMoulines。2006。 一些自适应MCMC算法的遍历性。应用概率年鉴16,第。3:1462-1505。http://www.jstor.org/stable/25442804。 Andrieu,Christophe和Johannes Thoms。 2008年。有关自适应MCMC的教程。统计与计算18,没有。4(12):343-373。doi:10.1007 / s11222-008-9110-y。http://www.springerlink.com/content/979087678366r78v/。 Y.Atchadé,G。Fort,E。Moulines和P. Priouret。2009。 自适应马尔可夫链蒙特卡洛:理论与方法。预印本。 …

3
在玻尔兹曼机器中学习权重
我试图了解Boltzmann机器的工作原理,但是我不太确定如何学习权重,也无法找到清晰的描述。以下正确吗?(此外,指向任何好的玻尔兹曼机器解释的指针也将很棒。) 我们有一组可见单元(例如,对应于图像中的黑色/白色像素)和一组隐藏单元。权重以某种方式初始化(​​例如,统一从[-0.5,0.5]开始),然后我们在以下两个阶段之间交替,直到达到某个停止规则: 固定阶段-在此阶段,所有可见单位的值都是固定的,因此我们仅更新隐藏单位的状态(根据Boltzmann随机激活规则)。我们更新直到网络达到平衡。一旦达到平衡,我们将继续更新ññN次(对于一些预定义的),同时跟踪的平均值(其中是节点和j的状态)。在这N个均衡更新之后,我们更新w_ij = w_ij + \ frac {1} {C}平均(x_i x_j),其中CññNX一世XĴX一世XĴx_i x_jX一世,XĴX一世,XĴx_i, x_j一世一世iĴĴjññNw一世j = w一世j + 1C甲v Ë ř 一个克È (X一世XĴ)w一世Ĵ=w一世Ĵ+1个C一种vË[R一种GË(X一世XĴ)w_ij = w_ij + \frac{1}{C} Average(x_i x_j)CCC是一定的学习速度。(或者,不是在最后进行批量更新,而是在均衡步骤之后进行更新?) 自由阶段-在此阶段,将更新所有单元的状态。一旦达到平衡,我们类似地会继续更新N'次,但是除了在末尾添加相关性之外,我们减去:。w我Ĵ= w我Ĵ− 1C一种v Ë ř 一个克È (X一世XĴ)w一世Ĵ=w一世Ĵ-1个C一种vË[R一种GË(X一世XĴ)w_{ij} = w_{ij} - \frac{1}{C} Average(x_i x_j) 所以我的主要问题是: 每当我们处于固定阶段时,我们都将可见单位重置为我们要学习的模式之一(以某种频率表示该模式的重要性),还是将可见单位保持在它们处于的状态在免费阶段结束时? 我们是在每个阶段结束时批量更新权重,还是在阶段的每个平衡步骤中更新权重?(或者,可以吗?)

1
修正的Dirichlet分布的期望值是多少?(整合问题)
使用具有相同比例参数的Gamma变量很容易产生具有Dirichlet分布的随机变量。如果: Xi∼Gamma(αi,β)Xi∼Gamma(αi,β) X_i \sim \text{Gamma}(\alpha_i, \beta) 然后: (X1∑jXj,…,Xn∑jXj)∼Dirichlet(α1,…,αn)(X1∑jXj,…,Xn∑jXj)∼Dirichlet(α1,…,αn) \left(\frac{X_1}{\sum_j X_j},\; \ldots\; , \frac{X_n}{\sum_j X_j}\right) \sim \text{Dirichlet}(\alpha_1,\;\ldots\;,\alpha_n) 问题 如果比例参数不相等会怎样? Xi∼Gamma(αi,βi)Xi∼Gamma(αi,βi) X_i \sim \text{Gamma}(\alpha_i, \beta_i) 那么这个变量的分布是什么? (X1∑jXj,…,Xn∑jXj)∼?(X1∑jXj,…,Xn∑jXj)∼? \left(\frac{X_1}{\sum_j X_j},\; \ldots\; , \frac{X_n}{\sum_j X_j}\right) \sim \; ? 对我来说,知道这种分布的期望值就足够了。 我需要一个可以由计算机非常快速地求值的近似封闭代数公式。 假设精度为0.01就足够了。 您可以假设: αi,βi∈Nαi,βi∈N \alpha_i, \beta_i \in \mathbb{N} 注意简而言之,任务是找到该积分的近似值: f(α⃗ ,β⃗ )=∫Rn+x1∑jxj⋅∏jβαjjΓ(αj)xαj−1je−βjxjdx1…dxnf(α→,β→)=∫R+nx1∑jxj⋅∏jβjαjΓ(αj)xjαj−1e−βjxjdx1…dxn f(\vec{\alpha}, \vec{\beta}) = …

2
根据任意分布计算p值
我希望这不是一个愚蠢的问题。假设我有一些任意的连续分布。我也有一个统计信息,我想使用此任意分布来获取此统计信息的p值。 我意识到,只要您的发行版适合内置发行版之一,就可以很容易地在R中执行此操作,就像正常情况一样。但是,是否有一种简单的方法可以对任何给定的分布执行此操作,而无需进行这种假设?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.