统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
更新贝叶斯因子
在贝叶斯假设检验和贝叶斯模型选择中,贝叶斯因子是通过两个边际可能性的比率来定义的:给定iid样本以及各自的采样密度和,具有相应的先验和,用于比较两个模型的贝叶斯因子为 一书,我目前正在审查有奇怪的声明,上面的贝叶斯因子(x1,…,xn)(x1,…,xn)(x_1,\ldots,x_n)f1(x|θ)f1(x|θ)f_1(x|\theta)f2(x|η)f2(x|η)f_2(x|\eta)π1π1\pi_1π2π2\pi_2B12(x1,…,xn)=defm1(x1,…,xn)m2(x1,…,xn)=def∫∏ni=1f1(xi|θ)π1(dθ)∫∏ni=1f2(xi|η)π2(dη)B12(x1,…,xn)=defm1(x1,…,xn)m2(x1,…,xn)=def∫∏i=1nf1(xi|θ)π1(dθ)∫∏i=1nf2(xi|η)π2(dη)\mathfrak{B}_{12}(x_1,\ldots,x_n)\stackrel{\text{def}}{=}\frac{m_1(x_1,\ldots,x_n)}{m_2(x_1,\ldots,x_n)}\stackrel{\text{def}}{=}\frac{\int \prod_{i=1}^n f_1(x_i|\theta)\pi_1(\text{d}\theta)}{\int \prod_{i=1}^n f_2(x_i|\eta)\pi_2(\text{d}\eta)}B12(x1,…,xn)B12(x1,…,xn)\mathfrak{B}_{12}(x_1,\ldots,x_n)是“通过将各个[贝叶斯因子]相乘而形成的”(第118页)。如果使用分解 但我看不到此分解的计算优势,因为需要与的原始计算相同的计算量B12(x1,…,xn)=m1(x1,…,xn)m2(x1,…,xn)=m1(xn|x1,…,xn−1)m2(xn|x1,…,xn−1)×m1(xn−1|xn−2,…,x1)m2(xn−1|xn−2,…,x1)×⋯⋯×m1(x1)m2(x1)B12(x1,…,xn)=m1(x1,…,xn)m2(x1,…,xn)=m1(xn|x1,…,xn−1)m2(xn|x1,…,xn−1)×m1(xn−1|xn−2,…,x1)m2(xn−1|xn−2,…,x1)×⋯⋯×m1(x1)m2(x1)\begin{align*}\mathfrak{B}_{12}(x_1,\ldots,x_n)&=\frac{m_1(x_1,\ldots,x_n)}{m_2(x_1,\ldots,x_n)}\\&=\frac{m_1(x_n|x_1,\ldots,x_{n-1})}{m_2(x_n|x_1,\ldots,x_{n-1})}\times \frac{m_1(x_{n-1}|x_{n-2},\ldots,x_1)}{m_2(x_{n-1}|x_{n-2},\ldots,x_1)}\times\cdots\\&\qquad\cdots\times\frac{m_1(x_1)}{m_2(x_1)}\end{align*}m1(xn|x1,…,xn−1)m2(xn|x1,…,xn−1)m1(xn|x1,…,xn−1)m2(xn|x1,…,xn−1)\frac{m_1(x_n|x_1,\ldots,x_{n-1})}{m_2(x_n|x_1,\ldots,x_{n-1})}m1(x1,…,xn)m2(x1,…,xn)m1(x1,…,xn)m2(x1,…,xn)\frac{m_1(x_1,\ldots,x_n)}{m_2(x_1,\ldots,x_n)}外面的人造玩具的例子。 问题:是否存在将Bayes因子从B12(x1,…,xn)B12(x1,…,xn)\mathfrak{B}_{12}(x_1,\ldots,x_n)为 B12(x1,…,xn+1)B12(x1,…,xn+1)\mathfrak{B}_{12}(x_1,\ldots,x_{n+1})的通用且计算有效的方法{n + 1})不需要重新计算整个边际m1(x1,…,xn)m1(x1,…,xn)m_1(x_1,\ldots,x_n)和 m2(x1,…,xn)m2(x1,…,xn)m_2(x_1,\ldots,x_n)? 我的直觉是,除了粒子滤波器实际上确实是在估计贝叶斯因子B12(x1,…,xn)B12(x1,…,xn)\mathfrak{B}_{12}(x_1,\ldots,x_n)中进行一次,没有一个自然的方法可以回答这个问题。

2
如何使用tsoutliers软件包和auto.arima解释和进行预测
我有1993年至2015年的月度数据,并希望对这些数据进行预测。我使用tsoutliers包检测异常值,但是我不知道如何继续使用我的数据集进行预测。 这是我的代码: product.outlier<-tso(product,types=c("AO","LS","TC")) plot(product.outlier) 这是我从tsoutliers包的输出 ARIMA(0,1,0)(0,0,1)[12] Coefficients: sma1 LS46 LS51 LS61 TC133 LS181 AO183 AO184 LS185 TC186 TC193 TC200 0.1700 0.4316 0.6166 0.5793 -0.5127 0.5422 0.5138 0.9264 3.0762 0.5688 -0.4775 -0.4386 s.e. 0.0768 0.1109 0.1105 0.1106 0.1021 0.1120 0.1119 0.1567 0.1918 0.1037 0.1033 0.1040 LS207 AO237 TC248 AO260 AO266 0.4228 …

3
如何判断PCA结果中没有模式?
我有19个变量的1000多个样本数据集。我的目标是根据其他18个变量(二进制和连续变量)预测一个二进制变量。我非常有信心6个预测变量与二进制响应相关联,但是,我想进一步分析数据集并寻找我可能会缺少的其他关联或结构。为了做到这一点,我决定使用PCA和群集。 当对归一化的数据运行PCA时,为了保留85%的差异,需要保留11个组件。 通过绘制对图,我得到了: 我不确定下一步是什么...我在pca中看不到明显的模式,我想知道这是什么意思,以及它是否可能是由于某些变量是二进制变量而引起的。通过运行具有6个聚类的聚类算法,我得到以下结果,尽管有些斑点看起来比较突出(黄色斑点),但这并不是一个确切的改进。 您可能会说,我不是PCA方面的专家,但是我看到了一些教程,以及如何了解高维空间中的结构是多么强大。使用著名的MNIST数字(或IRIS)数据集,效果很好。我的问题是:我现在应该怎么做才能使PCA更加有意义?聚类似乎没有任何用处,我如何判断PCA中没有模式,或者接下来我该怎么做才能在PCA数据中找到模式?
9 pca 

1
一个骰子有多少面?JAGS中的贝叶斯推断
问题 我想对类似于死边数未知的系统进行一些推断。模具被轧制了几次,然后我想推断出与模具具有的边数θ相对应的参数的概率分布。 直觉 如果在40次滚动后您观察到10个红色,10个蓝色,10个绿色和10个黄色,似乎θ应该在4处达到峰值,并且每侧滚动的偏差都是以1/4为中心的分布。 θ有一个很小的下限,即在数据中观察到的不同边的数量。 上限仍然未知。可能存在第五个方面,可能具有较低的偏见。您观察到的缺少第五类的数据越多,θ= 4的后验概率越高。 方法 我已经使用JAGS解决了类似的问题(通过R和rjags),这在这里似乎很合适。 关于数据,可以说obs <- c(10, 10, 10, 10)对应于以上示例中的观察结果。 我认为观测值应该用多项式分布建模obs ~ dmulti(p, n),其中p ~ ddirch(alpha)和n <- length(obs)。 θ与所隐含的类别数量相关联alpha,那么如何建模alpha以涵盖不同的可能类别数量? 备择方案? 我对贝叶斯分析还很陌生,因此可能完全是在树错了树,是否有替代模型可以对这个问题提供不同的见解? 非常感谢!大卫

1
如何在R中使用Lmer设置自定义对比度
我在R中使用lmer来检查条件(cond)对某些结果的影响。这是一些组成的数据,其中s是主题标识符a,b和c是条件。 library("tidyr") library("dplyr") set.seed(123) temp <- data.frame(s = paste0("S", 1:30), a = rnorm(30, -2, 1), b = rnorm(30, -3, 1), c = rnorm(30, -4, 1)) 我想比较 级别a的平均水平b,并c与 逐级b升级c。 我的问题是,如何设置对比度以使截距反映三个条件的均值,而两个计算出的估计值直接反映1.和2中定义的差异? 我尝试过 c1 <- cbind(c(-0.5, 0.25, 0.25), c(0, -0.5, 0.5)) gather(temp, cond, result, a, b, c) %>% lmer(result ~ cond + (1|s), …

7
使用稀疏向量在非常高的维空间中找到紧密对
我有NNN(约一百万个)特征向量。有(〜一百万)个二元特征,但是在每个向量中,只有(〜一千)为,其余为。我正在寻找具有至少(〜一百)个共同特征(两个都为)的向量对。此类对的数量与(〜一百万)相似。K 1 0 L 1 NMMMKKK111000LLL111NNN 我认为这可以在非常高维的空间中寻找闭合点对来解决。距离函数可以基于两个向量共有多少个特征。但这对于更常规的距离度量(例如欧几里得)可能也很有用。 哪些知名算法对解决此问题有用?或二次方都是不切实际的。中号NNNMMM 问题的现实表达示例是考虑个人在多个位置之间移动。如果两个人同时在同一地点,我们说他们会面。(存在至少1个人的位置时间组合的数量为)我们正在寻找朋友:至少遇到次的人。M LNNNMMMLLL

3
如何证明
我一直在尝试建立不平等 |Ti|=∣∣Xi−X¯∣∣S≤n−1n−−√|Ti|=|Xi−X¯|S≤n−1n\left| T_i \right|=\frac{\left|X_i -\bar{X} \right|}{S} \leq\frac{n-1}{\sqrt{n}} 其中X¯X¯\bar{X}是样品平均值和SSS样本标准差,即 S=∑ni=1(Xi−X¯)2n−1−−−−−−−−−√S=∑i=1n(Xi−X¯)2n−1S=\sqrt{\frac{\sum_{i=1}^n \left( X_i -\bar{X} \right)^2}{n-1}}。 很容易看到∑ni=1T2i=n−1∑i=1nTi2=n−1\sum_{i=1}^n T_i^2 = n-1 ,因此|Ti|&lt;n−1−−−−−√|Ti|&lt;n−1\left| T_i \right| < \sqrt{n-1}但这与我一直在寻找的目标不是很接近,也不是一个有用的界限。我已经试验了柯西-舒瓦兹(Cauchy-Schwarz)和三角形不等式,但没有成功。我必须在某个地方缺少一个微妙的步骤。谢谢您的帮助。


1
全都在家里;但是我们也包括姻亲吗?
假设我有两个或更多因素的实验。构造了一个整体方差分析,然后我们进行了两组或更多组事后测试,即多次比较。我的问题是,应该使用多少个家庭,以及多少个家庭作为这些事后测试的多重性调整的基础。 一个例子是Tukey关于EDA的书中的翘曲断裂数据集。有两个因素:(wool两个级别)和tension(三个级别)。方差分析表为: Source Df Sum Sq Mean Sq F value Pr(&gt;F) wool 1 450.7 450.67 3.7653 0.0582130 tension 2 2034.3 1017.13 8.4980 0.0006926 wool:tension 2 1002.8 501.39 4.1891 0.0210442 Residuals 48 5745.1 119.69 显然,模型中需要交互。因此,我们决定比较每个因素的水平,同时保持另一个因素不变。结果如下,其中一些注释将在以后引用: *** Pairwise comparisons of tension for each wool *** *** All combined: Family T *** wool …

2
多项式逻辑损失vs(交叉熵vs平方误差)
我观察到Caffe(深度学习框架)使用Softmax损失层 SoftmaxWithLoss作为大多数模型样本的输出层。 据我所知,Softmax损失层是多项逻辑损失层和Softmax层的组合。 他们从Caffe说 Softmax损失层梯度计算在数值上更稳定 但是,这种解释不是我想要的答案,它只是比较多项逻辑损失层和Softmax损失层的组合,而不是逐层进行比较。但是不能与其他类型的损失函数相比较。 但是,我想更多地了解在监督学习的角度来看这3个误差函数(即多项式Lo​​gistic损失,交叉熵(CE)和平方误差(SE))的区别/优点/缺点是什么?有支持文章吗?

1
为什么要增加一个反向文档频率?
我的课本将idf列为,其中log(1+Nnt)log(1+Nnt)log(1+\frac{N}{n_t}) NNN:文件数 ntntn_t:包含术语的文档数ttt 维基百科将此公式列为实际的平滑版本。我了解的一个:范围从到,看起来很直观。 但是从到似乎太奇怪了…… 我对语言建模的平滑知识有所了解,但是您会在分子中添加一些东西以及分母中,因为您担心概率质量。但是,只加对我来说没有意义。我们要在这里完成什么?log(Nnt)log(Nnt)log(\frac{N}{n_t})log(NN)=0log(NN)=0log(\frac{N}{N})=0∞∞\inftylog(1+Nnt)log(1+Nnt)log(1+\frac{N}{n_t})log(1+1)log(1+1)log(1+1)∞∞\infty111


1
不当的线性模型什么时候才能变得强大美观?
问题: 是在实践中使用了不正确的线性模型,还是在科学期刊中不时描述了某种好奇心?如果是这样,它们在哪些领域使用? 还有其他此类模型的例子吗? 最后,对于此类模型,从OLS提取的标准误差,,R ^ 2等是否正确,还是应该以某种方式进行纠正?pppR2R2R^2 背景:文献中不时描述了不正确的线性模型。通常,此类模型可以描述为 y=a+b∑iwixi+εy=a+b∑iwixi+ε y = a + b \sum_i w_i x_i + \varepsilon 是什么让他们回归不同的是,的是没有在模型中估计系数,但权重是wjwjw_j 等于每个变量(单位加权回归),wi=1wi=1w_i = 1 基于相关性(Dana and Dawes,2004),wi=ρ(y,xi)wi=ρ(y,xi)w_i = \rho(y, x_i) 随机选择(Dawes,1979年), −1−1-1变量负相关,为正相关的变量(Wainer,1976)。1 yyyy111yyy 使用某种特征缩放也很常见,例如将变量转换为分数。因此,这种模型可以简化为单变量线性回归ZZZ y=a+bv+εy=a+bv+ε y = a + b v + \varepsilon 其中,并且可以使用OLS回归简单地估算。v=∑wixv=∑wixv = \sum w_i x 参考: Dawes,Robyn M.(1979)。决策中不适当线性模型的鲁棒性。美国心理学家,第34卷,第 571-582页。 …

1
梯度提升如何像梯度下降一样?
我正在阅读有关梯度增强的有用的Wikipedia条目(https://en.wikipedia.org/wiki/Gradient_boosting),并尝试了解如何/为什么我们可以通过最陡峭的下降步骤(也称为伪梯度)来近似残差)。谁能给我关于最陡峭的下降如何联系/类似于残差的直觉?帮助非常感谢!

4
从中提取without时,其概率分布是否会发生变化,而无需平均替换?
假设我的骨灰盒包含N种不同颜色的球,每种颜色可以出现不同的次数(如果有10个红色球,那么也不必有10个蓝色球)。如果在绘制之前知道know的确切内容,我们可以形成离散的概率分布,该分布告诉我们绘制每种颜色的球的概率。我想知道的是,平均没有从骨灰盒上取下k个球后,分布如何变化。我了解到,随着我们从骨灰盒中提取物品,我们可以根据已取出的知识更新分布,但是我想知道的是,在移除k个球之后,我们期望分布的形状是什么。分布是平均变化还是保持不变?如果不保持相同,是否可以写出一些公式,以便在进行k次绘制后,我们期望新分布的平均外观如何?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.