统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
R?中的非参数重复测量多方方差分析
以下问题是一段时间以来对我而言最神圣的问题之一,我希望有人能够提供很好的建议。 我希望使用R执行非参数重复测量多方方差分析。 我已经在网上进行了一段时间的搜索和阅读,到目前为止,仅能找到以下几种情况的解决方案:Friedman测试单向非参数重复测量方差分析,有序回归与{car} Anova函数用于多路非参数方差分析等。部分解决方案不是我在此问题线程中寻找的。我在一段时间前发布的一篇文章中总结了到目前为止的发现(标题为:重复测量R的方差分析(函数和教程),以防万一。 如果我在网上阅读的内容是正确的,则可以使用混合序数回归模型(又称比例赔率模型)来完成此任务。 我发现了两个看似相关的软件包,但找不到关于该主题的任何插图: http://cran.r-project.org/web/packages/repolr/ http://cran.r-project.org/web/packages/ordinal/ 因此,对于这个主题来说,我是新手,我希望这里的人们能提供一些指导。 是否有关于该主题的任何教程/建议阅读的内容?甚至更好的是,有人可以建议一个简单的示例代码来说明如何在R中运行和分析此代码(例如:“非参数重复测量多方方差分析”)吗?

5
均值绝对偏差和大数据集的在线算法
我有一个小问题使我感到恐惧。我必须为多元时间序列的在线获取过程编写程序。在每个时间间隔(例如1秒),我都会得到一个新样本,该样本基本上是大小为N的浮点向量。我需要做的操作有些棘手: 对于每个新样本,我计算该样本的百分位数(通过对向量进行归一化,以使元素总和为1)。 我以相同的方式计算平均百分比矢量,但使用过去的值。 对于每个过去的值,我使用在步骤2中计算的全局平均百分比矢量来计算与该样本相关的百分比矢量的绝对偏差。这样,绝对偏差始终为0(当矢量等于平均值​​)之间的数字。向量)和2(当完全不同时)。 使用所有先前样本的偏差平均值,我计算出平均绝对偏差,该平均值也是0到2之间的一个数字。 我使用平均绝对偏差来检测新样本是否与其他样本兼容(通过将其绝对偏差与在步骤4计算的整个集合的平均绝对偏差进行比较)。 由于每次收集一个新样本时,全局平均值都会发生变化(因此平均绝对偏差也会发生变化),有没有一种方法可以计算此值而无需多次扫描整个数据集?(一次用于计算总体平均百分比,一次用于收集绝对偏差)。好的,我知道在不扫描整个集合的情况下计算全局平均值绝对容易,因为我只需要使用一个临时矢量来存储每个维的和,那么平均绝对偏差呢?它的计算包括abs()运算符,因此我需要访问所有过去的数据! 谢谢你的帮助。

7
术语“最佳匹配”和交叉验证中使用的“最佳”的定义是什么?
如果将非线性函数拟合到一组点(假设每个横坐标只有一个纵坐标),则结果可以是: 残差很小的非常复杂的函数 具有大量残差的非常简单的函数 交叉验证通常用于在这两个极端之间找到“最佳”折衷方案。但是“最佳”是什么意思?是“最有可能”吗?您甚至将如何证明最可能的解决方案是什么? 我内心的声音告诉我,简历正在寻找某种最低限度的能源解决方案。这让我想到了熵,我隐约知道它在统计和物理学中都会发生。 在我看来,“最佳”拟合是通过最小化复杂度和误差函数的总和而产生的,即 minimising m where m = c(Complexity) + e(Error) 这有意义吗?函数c和e是什么? 请您能用非数学语言来解释,因为我对数学不太了解。

5
比较配对观测值的方差
我有成对的观测值(,),它们来自一个共同的未知分布,该分布具有有限的第一和第二矩,并且围绕均值对称。X i Y iNNNXiXiX_iYiYiY_i 令为的标准偏差(对无条件),对于为。我想检验一下假设 X ÿ σ ÿσXσX\sigma_XXXXYYYσYσY\sigma_Y H0H0H_0:σX=σYσX=σY\sigma_X = \sigma_Y H1H1H_1:σX≠σYσX≠σY\sigma_X \neq \sigma_Y 有人知道这样的测试吗?我可以在第一分析中假定分布是正态的,尽管一般情况更有趣。我正在寻找一种封闭形式的解决方案。Bootstrap永远是不得已的手段。


4
损失函数的全面概述?
我试图对机器学习中的一些基本思想有一个整体的认识,我想知道是否对不同的损失概念(平方,对数,铰链,代理等)进行了全面的处理。我正在按照约翰·兰福德(John Langford)关于损失函数语义学的出色文章进行更全面,正式的介绍来考虑一些问题。

1
EM,有一个直观的解释吗?
EM程序对初学者来说或多或少是黑魔法。使用监督数据估计HMM的参数(例如)。然后解码未加标签的数据,使用向前或向后“计数”事件,就好像该数据已被加标签一样。为什么这会使模型更好?我确实对数学有所了解,但我一直希望对数学有所了解。


5
将不重要的结果解释为“趋势”
最近,两个不同的同事对条件之间的差异使用了一种论点,这对我来说似乎是不正确的。这两个同事都使用统计信息,但他们不是统计学家。我是统计学的新手。 在这两种情况下,我都认为,由于实验中两个条件之间没有显着差异,因此就操纵对这些组做出一般性主张是不正确的。请注意,“提出一般性主张”的含义类似于写:“ A组比B组更频繁地使用X”。 我的同事反驳说:“即使没有显着差异,趋势仍然存在”和“即使没有显着差异,也仍然存在差异”。对我来说,这两种声音听起来都是模棱两可的,也就是说,它们将“差异”的含义从“可能是除偶然性以外的结果(即统计意义)的差异”更改为“任何非组之间的测量差异为零”。 我的同事的回答正确吗?我没有接受他们,因为他们比我高。

1
斯坦
我正在浏览Stan文档,可以从此处下载。我对他们实施Gelman-Rubin诊断程序特别感兴趣。最初的论文Gelman&Rubin(1992)定义了潜在的水垢减少因子(PSRF)如下: 令为第个采样的马尔可夫链,并让整个独立的链采样。假设为第链的均值,而为整体均值。定义 其中 并定义Xi,1,…,Xi,NXi,1,…,Xi,NX_{i,1}, \dots , X_{i,N}iiiMMMX¯i⋅X¯i⋅\bar{X}_{i\cdot}iiiX¯⋅⋅X¯⋅⋅\bar{X}_{\cdot \cdot}W=1M∑m=1Ms2m,W=1M∑m=1Msm2,W = \dfrac{1}{M} \sum_{m=1}^{M} {s^2_m}, s2m=1N−1∑t=1N(X¯mt−X¯m⋅)2.sm2=1N−1∑t=1N(X¯mt−X¯m⋅)2.s^2_m = \dfrac{1}{N-1} \sum_{t=1}^{N} (\bar{X}_{m t} - \bar{X}_{m \cdot})^2\,. BBB B=NM−1∑m=1M(X¯m⋅−X¯⋅⋅)2.B=NM−1∑m=1M(X¯m⋅−X¯⋅⋅)2.B = \dfrac{N}{M-1} \sum_{m=1}^{M} (\bar{X}_{m \cdot} - \bar{X}_{\cdot \cdot})^2 \,. 定义 使用估算PSRF ,其中 其中。V^=(N−1N)W+(M+1MN)B.V^=(N−1N)W+(M+1MN)B.\hat{V} = \left(\dfrac{N-1}{N} \right)W + \left( \dfrac{M+1}{MN} \right)B\,. [R= VR^−−√R^\sqrt{\hat{R}}d ˚F = 2 V / …

1
高维回归:为什么
我正在尝试阅读有关高维回归领域的研究;当大于,即。似乎经常出现在回归估计量的收敛速度方面。Ñ p > > Ñ 日志p / Ñpppnnnp>>np>>np >> nlogp/nlog⁡p/n\log p/n 例如,这里的等式(17)表示套索拟合满足 1β^β^\hat{\beta}1n∥Xβ^−Xβ∥22=OP(σlogpn−−−−−√∥β∥1).1n‖Xβ^−Xβ‖22=OP(σlog⁡pn‖β‖1). \dfrac{1}{n}\|X\hat{\beta} - X \beta\|_2^2 = O_P \left(\sigma \sqrt{\dfrac{\log p}{n} } \|\beta\|_1\right)\,. 通常,这还意味着logplog⁡p\log p应该小于nnn。 关于\ log p / n的比例为何logp/nlog⁡p/n\log p/n如此突出,是否有任何直觉? 而且,从文献中看来,当\ log p \ geq n时,高维回归问题变得复杂logp≥nlog⁡p≥n\log p \geq n。为什么会这样呢? 有没有很好的参考资料来讨论ppp和nnn应增长多快的问题?

3
多层感知器与深度神经网络
这是一个术语问题。有时我看到人们将深度神经网络称为“多层感知器”,这是为什么呢?我教过的感知器是一种单层分类器(或回归器),它使用特定的权重训练方法(不是反向传播)具有二进制阈值输出。如果感知器的输出与目标输出不匹配,则将输入矢量添加或减去权重(取决于感知器给出的是假阳性还是假阴性)。这是一种非常原始的机器学习算法。训练过程似乎无法推广到多层案例(至少并非没有修改)。深度神经网络是通过反向传播训练的,它使用链规则通过网络的所有权重传播成本函数的梯度。 所以,问题是。“多层感知器”与“深度神经网络”是否一样?如果是这样,为什么要使用该术语?似乎不必要地造成混淆。另外,假设术语在某种程度上是可互换的,那么当我指的是由完全连接的层(无卷积层或递归连接)组成的前馈网络时,我仅看到术语“多层感知器”。这个术语有多广泛?例如,当提到Inception网络时,会使用术语“多层感知器”吗?使用NLP中使用的LSTM模块的循环网络怎么样?

2
如何按时间序列填写缺失的数据?
我有大量的污染数据,在过去的2年中,每10分钟记录一次,但是数据中存在很多空白(其中一些空白一次出现几个星期)。 数据似乎确实是季节性的,与夜间相比,白天的变化很大,在夜间,值没有太大的变化,并且数据点较低。 我考虑过将黄土模型分别适合于白天和晚上的子集(因为它们之间存在明显的差异),然后预测缺失数据的值并将这些点填入。 我想知道这是否是解决此问题的合适方法,是否还需要在预测点中添加局部变化。

3
Beta分布与逻辑回归模型之间有什么关系?
我的问题是:Beta分布与逻辑回归模型的系数之间的数学关系是什么? 为了说明: logistic(Sigmoid)函数由下式给出 f(x)=11+exp(−x)f(x)=11+exp⁡(−x)f(x) = \frac{1}{1+\exp(-x)} 它用于对逻辑回归模型中的概率进行建模。设为二分式评分结果,为设计矩阵。逻辑回归模型由下式给出AAA(0,1)(0,1)(0,1)XXX P(A=1|X)=f(Xβ).P(A=1|X)=f(Xβ).P(A=1|X) = f(X \beta). 注意XXX的第一列为常数111(截距),ββ\beta为回归系数的列向量。例如,当我们有一个(标准正态)回归变量xxx并选择β0=1β0=1\beta_0=1(拦截)和β1=1β1=1\beta_1=1,我们可以模拟所得的“概率分布”。 此图使人想起了密度由下式给出的Beta分布(与其他选择的图一样)。ββ\beta g(y;p,q)=Γ(p)Γ(q)Γ(p+q)y(p−1)(1−y)(q−1).g(y;p,q)=Γ(p)Γ(q)Γ(p+q)y(p−1)(1−y)(q−1)。g(y;p,q) = \frac{\Gamma(p)\Gamma(q)}{\Gamma(p+q)} y^{(p-1)} (1-y)^{(q-1)}. 使用最大似然或矩量方法,可以根据的分布估算和。因此,我的问题归结为:与和选择之间是什么关系?首先,这解决了上面给出的双变量情况。q P (甲= 1 | X )β p qpppqqqP(A = 1 |X)P(一种=1|X)P(A=1|X)ββ\betapppqqq

2
马尔可夫链与马尔可夫过程有什么区别?
马尔可夫链与马尔可夫过程有什么区别? 我正在阅读有冲突的信息:有时,定义是基于状态空间是离散的还是连续的,有时是基于时间是连续的还是离散的。 本文档的幻灯片20: 如果状态空间是离散的(即有限的或可数的空间)是离散的(即有限的或可数的),则马尔可夫过程称为马尔可夫链。 http://www.win.tue.nl/~iadan/que/h3.pdf: 马尔可夫过程是马尔可夫链的连续时间版本。 或者可以同义地使用马尔可夫链和马尔可夫过程,规定时间参数是连续的还是离散的,以及状态空间是连续的还是离散的。 2017年3月4日更新:https://www.quora.com/Can-I-use-the-words-Markov-process-and-Markov-chain-interchangeably提出了相同的问题

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.