统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

6
R或Python中在无监督学习中执行特征选择的方法
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 2年前关闭。 R / Python中有哪些可用的方法/实现来丢弃/选择数据中不重要/重要的功能?我的数据没有标签(无监督)。 数据具有约100种混合类型的要素。一些是数字的,而另一些是二进制的(0/1)。

1
对峰度的可靠估计?
我使用的是峰度的常用估计量,,但是我注意到经验分布中即使是很小的“离群值” ,即远离中心的小峰,对其产生巨大影响。是否有一个更稳健的峰度估计器?ķ^= μ^4σ^4ķ^=μ^4σ^4\hat{K}=\frac{\hat{\mu}_4}{\hat{\sigma}^4}

3
在线性回归中使用百分比结果有什么问题?
我有一项研究,其中许多结果都以百分比表示,并且我正在使用多个线性回归来评估某些类别变量对这些结果的影响。 我想知道,由于线性回归假设结果是连续分布,因此将这种模型应用于百分比(限制在0到100之间)是否存在方法上的问题?

1
PCA和PLS中的“负荷”和“相关负荷”有什么区别?
做主成分分析(PCA)时,要做的一件事是相互绘制两个载荷以研究变量之间的关系。在随附的用于进行主成分回归和PLS回归的PLS R软件包的论文中,有一个不同的图,称为相关负荷图(请参见本文中的图7和第15页)。的相关性装载,因为它是解释的,是分数之间和实际观察到的数据的相关性(从PCA或PLS)。 在我看来,加载和相关加载非常相似,只是它们的缩放比例有所不同。使用内置数据集mtcars的R中的可重现示例如下: data(mtcars) pca <- prcomp(mtcars, center=TRUE, scale=TRUE) #loading plot plot(pca$rotation[,1], pca$rotation[,2], xlim=c(-1,1), ylim=c(-1,1), main='Loadings for PC1 vs. PC2') #correlation loading plot correlationloadings <- cor(mtcars, pca$x) plot(correlationloadings[,1], correlationloadings[,2], xlim=c(-1,1), ylim=c(-1,1), main='Correlation Loadings for PC1 vs. PC2') 这些图的解释有什么区别?哪种曲线图(如果有的话)最适合在实践中使用?

2
实际实践中关于机器学习的全部内容是什么?
我是机器学习(还包括一些统计数据)的新手,一段时间以来一直在学习知识(有监督/无监督学习算法,相关的优化方法,正则化,一些哲学(例如偏差方差折衷?))。我知道,没有任何实际练习,我将不会对这些机器学习知识有深入的了解。 因此,我首先从真实数据的分类问题开始,例如手写数字分类(MNIST)。令我惊讶的是,在没有任何特征学习/工程设计的情况下,使用原始像素值作为输入的随机森林分类器,精度达到0.97。我还尝试了其他学习算法,例如支持参数调整的SVM,LR。 然后我迷路了,这太容易了还是我在这里错过了任何东西?只是从工具箱中选择学习算法并调整一些参数? 如果在实践中将全部与机器学习有关,那么我将对该领域失去兴趣。我思考并阅读了一些博客几天,然后得出一些结论: 机器学习在实践中最重要的部分是特征工程,即在给定数据的情况下,找出特征的更好表示。 使用哪种学习算法也很重要,参数调整也很重要,但最终选择更多是关于实验。 我不确定我是否理解正确,希望任何人都可以纠正我,并给我一些有关实践中机器学习的建议。

1
贝叶斯定理错误应用的例子
这个Math Overflow社区问题询问“错误论证的例子,这些论证涉及在非数学环境中应用数学定理”,并产生了一系列有趣的病理学应用数学。 我想知道类似的贝叶斯推断在病理学上的应用实例。有没有人遇到学术文章,古怪的博客文章,这些文章以怪异的方式使用贝叶斯方法。
11 bayesian 

3
ARIMA干预传递函数-如何可视化效果
我有一个干预措施的每月时间序列,我想量化此干预措施对结果的影响。我意识到该系列非常短,效果尚未得出结论。 数据 cds <- structure(c(2580L, 2263L, 3679L, 3461L, 3645L, 3716L, 3955L, 3362L, 2637L, 2524L, 2084L, 2031L, 2256L, 2401L, 3253L, 2881L, 2555L, 2585L, 3015L, 2608L, 3676L, 5763L, 4626L, 3848L, 4523L, 4186L, 4070L, 4000L, 3498L), .Dim=c(29L, 1L), .Dimnames=list(NULL, "CD"), .Tsp=c(2012, 2014.33333333333, 12), class="ts") 方法论 1)该auto.arima功能使用了干预前系列(直到2013年10月)。建议的模型为ARIMA(1,0,0),均值非零。ACF图看起来不错。 pre <- window(cds, start=c(2012, 01), end=c(2013, 09)) …

1
ARMA模型的拟合值
我试图了解如何为ARMA(p,q)模型计算拟合值。我已经在这里找到有关ARMA流程的拟合值的问题,但还没有弄清这一点。 如果我有一个ARMA(1,1)模型,即 XŤ= α1个Xt − 1+ ϵŤ- β1个ϵt − 1XŤ=α1个XŤ-1个+ϵŤ-β1个ϵŤ-1个X_t = \alpha_1X_{t-1}+\epsilon_t - \beta_1 \epsilon_{t-1} 并给出了一个(固定的)时间序列,我可以估计这些参数。我将如何使用这些估算值来计算拟合值。对于AR(1)模型,拟合值由下式给出: XŤ^= α1个^Xt − 1。XŤ^=α1个^XŤ-1个。\hat{X_t} = \hat{\alpha_1}X_{t-1} . 由于无法观察到ARMA模型的创新,我将如何使用MA参数的估计值?我是否会忽略MA零件并计算AR零件的拟合值?
11 arma 

2
随机拦截模型与GEE
考虑一个随机截距线性模型。这等效于具有可交换工作相关矩阵的GEE线性回归。假设预测变量为和,这些预测变量的系数为,和。随机截距模型中系数的解释是什么?除了在个人层面上,它是否与GEE线性回归相同?x1,x2,x1,x2,x_1, x_2,x3x3x_3β1β1\beta_1β2β2\beta_2β3β3\beta_3

1
如果“ .632规则”中的概率不相等怎么办?
此问题源于有关“ .632规则”的问题。我在编写时特别参考了user603的回答/表示,以简化事情。 该答案以大小为的样本开始并从集合(称为)N的不同项中进行替换。第样本与N 的特定元素不同的概率为n,n,n,nnnithithi^{th}sisis_immm(1−1/n).(1−1/n).(1 - 1/n). 在该答案中,N的所有元素都有被随机抽取的同等机会。 我的问题是:假设在上面的问题中要绘制的项目是按正态分布的。也就是说,我们将标准正态曲线从细分为,细分为(例如)100个等长子区间。N中的100个项目中的每一个都有被绘制的概率,该概率等于曲线在其相应间隔中所占的面积。Z=−4Z=−4Z = -4Z=4Z=4Z = 4 我的想法如下: 我的推理与链接答案中的推理类似。的概率,与 N的元素,是其中是绘制的概率si≠msi≠ms_i \ne mmmmP(si≠m)=(1−Fi)P(si≠m)=(1−Fi)P(s_i \neq m) = (1 - F_i)FiFiF_isi.si.s_i. 特定元素m在大小为n的样本S中的概率为 P(m∈S)=1−P(m∉S)=1−∏1nP(si≠m)P(m∈S)=1−P(m∉S)=1−∏1nP(si≠m)P(m \in S) = 1 - P(m \notin S) = 1 - \prod_1^n P(s_i \neq m) =1−∏1n(1−Fi).=1−∏1n(1−Fi). = 1 - \prod_1^n(1 - F_i). 计算似乎表明,随着子间隔的长度变小,答案收敛到与第一种情况相同的数字(概率都相等)。sisis_i (对我而言)这似乎是违反直觉的,因为该构造似乎会抛出N的元素,而这些元素很少见,因此我希望数字小于.632。 而且,如果这是正确的,我想我们会 …

1
伊辛模型的吉布斯抽样
作业问题: 考虑一维伊辛模型。 令。x_i为-1或+1x=(x1,...xd)x=(x1,...xd)x = (x_1,...x_d)xixix_i π(x)∝e∑39i=1xixi+1π(x)∝e∑i=139xixi+1\pi(x) \propto e^{\sum_{i=1}^{39}x_ix_{i+1}} 设计一个gibbs采样算法,以大致根据目标分布\ pi(x)生成样本π(x)π(x)\pi(x)。 我的尝试: 随机选择值(-1或1)以填充向量x=(x1,...x40)x=(x1,...x40)x = (x_1,...x_{40})。所以x=(−1,−1,1,1,1,−1,1,1,...,1)x=(−1,−1,1,1,1,−1,1,1,...,1)x = (-1, -1, 1, 1, 1, -1, 1, 1,...,1)。所以这是x0x0x^0。 因此,现在我们需要继续进行第一次迭代。我们必须分别为x ^ 1绘制40个不同的x x1x1x^1。所以... 从\ pi(x_1 | x_2 ^ 0,...,x_ {40} ^ 0)中绘制x11x11x_1^1π(x1|x02,...,x040)π(x1|x20,...,x400)\pi(x_1 | x_2^0,...,x_{40}^0) 从\ pi(x_2 | x_1 ^ 1,x_3 ^ 0,...,x_ {40} ^ 0)中绘制x12x21x_2^1π(x2|x11,x03,...,x040)π(x2|x11,x30,...,x400)\pi(x_2 | …

3
统计的未来
当我在关于数学中尚未解决的问题的公开演讲中时,我想到了这个问题。众所周知,仍然存在许多未解决的数学问题。这让我开始思考统计中尚未解决的问题。在花了一些时间在Google上搜索此主题之后,我认为对此问题没有相对详细的讨论。因此,我真的很想听听人们对此的看法。统计作为一门学科去哪里了?我们应该花更多的时间来改进理论还是应该专注于如何分析从各种科学实验中收集的特定数据?任何对此的想法将不胜感激。谢谢!

1
测试两个回归系数是否显着不同(理想情况下为R)
如果这是一个重复的问题,请指出正确的方法,但是我在这里发现的相似问题还不够相似。假设我估计模型Y=α+βX+uY=α+βX+uY=\alpha + \beta X + u 并找到。但是,事实证明,我怀疑,尤其是。因此,我估计了模型并找到了重要证据。然后如何测试是否?我考虑过运行另一个回归并测试。这是最好的方法吗?X = X 1 + X 2 ∂ ý / ∂ X 1 ≠ ∂ ý / ∂ X 2 ∂ ý / ∂ X 1 > ∂ ý / ∂ X 2 Ŷ = α + β 1 X 1 + β 2 …

1
工具变量如何解决选择偏见?
我想知道工具变量如何解决回归中的选择偏差。 这是我正在尝试的示例:在“ 大多数无害计量经济学”中,作者讨论了与服役和晚年收入有关的IV回归。问题是,“服兵役会增加还是减少未来的收入?” 他们在越南战争的背景下调查了这个问题。我知道不能随机分配兵役,这是因果推理的问题。 为了解决这个问题,研究人员使用了征兵资格(如“您的征兵号码被称为”)作为实际服兵役的工具。这是有道理的:越南选秀大会随机分配了年轻的美国士兵入伍(从理论上讲,选秀者是否真的对我的问题有所帮助)。我们的其他IV条件似乎是可靠的:征兵资格和实际服兵役之间有着密切的正相关关系。 这是我的问题。似乎您会出现自我选择偏见:也许较富有的孩子可以退出越南服务,即使他们的选秀号码被打电话了。(如果实际并非如此,为我的问题,让我们假装)。如果这种自我选择在我们的样本中造成系统性偏见,那么我们的工具变量如何解决这一偏见?我们是否必须将推论范围缩小到“无法逃脱草案的人的类型?” 还是IV以某种方式挽救了我们推论的那一部分?如果有人能解释它是如何工作的,我将非常感谢。

2
通过重新运行实验来验证Web A / B测试-这有效吗?
某天,一家a / b测试公司举行的网络研讨会上,其驻地“数据科学家”解释说,您应该通过重新运行实验来验证结果。前提是,如果您选择95%的置信度,则有5%(1/20)的假阳性机会。如果您以相同的约束条件重新运行实验,那么现在会有1/400(我假设他们将其确定为0.05 ^ 2 = 1/400) 这是有效的声明吗?(即“两次运行,两次统计显着性获胜=假阳性概率的1/400”)?这是提高您的显着性水平的更好方法吗? 从业务的角度来看,我所关心的是通过重新运行实验,使更多的用户接触到劣等的页面(处理),从而失去了潜在的销售额。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.