统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
具有概率估计值的重复10倍交叉验证的平均ROC
我计划使用机器学习算法对大约10,000个案例使用重复(10次)分层10倍交叉验证。每次重复将使用不同的随机种子进行。 在此过程中,我为每种情况创建了10个概率估计实例。10倍交叉验证的10次重复中的每一次重复的概率估计的1个实例 我是否可以为每种情况平均10个概率,然后创建新的平均ROC曲线(代表重复10倍CV的结果),可以通过配对比较将其与其他ROC曲线进行比较?
15 roc 

1
附带参数问题
我总是在努力获取偶发参数问题的真正实质。我读过几次,非线性面板数据模型的固定效果估计量可能由于“众所周知的”附带参数问题而严重偏倚。 当我要求对此问题进行清晰的解释时,典型的答案是:假设面板数据在T个时间段内有N个人。如果T是固定的,则随着N的增长,协变量估计将变得有偏差。发生这种情况的原因在于,随着N的增加,干扰参数的数量会快速增长。 我将不胜感激 更精确但仍然简单的解释(如果可能) 和/或我可以使用R或Stata进行计算的具体示例。

2
如何在神经网络的批量学习方法中更新权重?
有人可以告诉我如何使用批处理方法构建神经网络吗? 我已经读到,在批处理模式下,对于训练集中的所有样本,我们计算网络中每个神经元的误差,增量和增量权重,然后而不是立即更新权重,而是对其进行累加,然后再开始在下一个时期,我们将更新权重。 我还在某处读到,批处理方法类似于在线方法,但区别在于,只需要对训练集中所有样本的误差求和,然后取其平均值,然后像更新权重一样使用它即可像这样在在线方法中做(差异只是那个平均值): for epoch=1 to numberOfEpochs for all i samples in training set calculate the errors in output layer SumOfErrors += (d[i] - y[i]) end errorAvg = SumOfErrors / number of Samples in training set now update the output layer with this error update all other previous layers go …

3
评估排名算法的指标
我有兴趣查看几种不同的算法排名指标-“学习排名”维基百科页面上列出了一些指标,包括: •平均平均精度(MAP); •DCG和NDCG; •Precision @ n,NDCG @ n,其中“ @n”表示仅对前n个文档评估度量; •平均倒数排名; •肯德尔的牛头 •斯皮尔曼的罗 •预期的相互排名 •Yandex的缺点 但是我不清楚每种方法都有哪些优缺点,或者何时可以选择一种方法而不是另一种方法(或者说一种算法在NDGC上的性能优于另一种算法,而在用MAP评估时更糟,这意味着什么)。 我有什么地方可以了解有关这些问题的更多信息?

1
在随机森林中包括交互项
假设我们有一个响应Y和预测变量X1,...,Xn。如果我们试图通过X1,...,Xn的线性模型拟合Y,并且恰好发生了Y和X1,...,Xn之间的真实关系不是线性的,那么我们也许可以通过以某种方式转换X,然后拟合模型来修复模型。而且,如果恰好碰巧X1,...,XN不会独立于其他特征影响y,我们还可以通过包含交互项x1 * x3或x1 * x4 * x7来改善模型或类似的东西。因此,在线性情况下,交互项可以通过固定响应和特征之间的非线性或独立性冲突来带来价值。 但是,随机森林并没有真正做出这些假设。在拟合“随机森林”时,包括交互项是否重要?还是仅包括各个术语并选择适当的参数,即可使随机森林捕获这些关系?

1
什么是“目标最大可能性期望”?
我正在尝试了解Mark van der Laan的一些论文。他是伯克利大学的理论统计学家,致力于解决与机器学习显着重叠的问题。对我来说(除深层数学运算之外)一个问题是,他经常最终会使用完全不同的术语来描述熟悉的机器学习方法。他的主要概念之一是“目标最大可能性期望”。 TMLE用于分析非对照实验中的删失观测数据,即使存在混杂因素也可以进行效果评估。我强烈怀疑许多相同的概念在其他领域以其他名称存在,但是我对它的理解还不够深入,无法直接将其与任何事物匹配。 尝试将差距缩小到“计算数据分析”的方法是: 进入数据科学时代:目标学习和统计与计算数据分析的集成 这里是统计学家的简介: 基于目标最大似然的因果推断:第一部分 从第二个开始: 在本文中,我们针对多个时间点干预的因果效应开发了一种特定的针对性最大似然估计器。这涉及使用基于损失的超级学习来获得G计算公式的未知因子的初始估计,然后将目标参数特定的最佳波动函数(最不利的参数子模型)应用于每个估计因子,用最大似然估计来估计波动参数,并迭代初始因子的此更新步骤,直到收敛为止。这个迭代目标最大似然更新步骤使得因果效应的最终估计量在初始估计量是否一致的情况下也是一致的,因此具有两倍的鲁棒性,或最佳波动函数的估计值是一致的。如果正确地指定了因果图中所介入的节点的条件分布,则可以正确地指定最佳波动函数。 用他的术语来说,“超级学习”是具有理论上合理的非负加权方案的整体学习。但是他的意思是“将目标参数特定的最佳波动函数(最不利的参数子模型)应用于每个估计因子”。 或将其分为三个不同的问题,TMLE在机器学习中是否具有并行性?什么是“最不利的参数子模型”?其他领域的“波动函数”是什么?

2
Top-n精度的定义是什么?
我正在阅读有关图像分类的科学论文。在实验结果中,他们提到了top-1和top-5的准确性,但我从未听说过该术语,也无法使用google找到它。 有人可以给我一个定义或指向我某个地方吗?:)

4
哪些变量解释了哪些PCA组件,反之亦然?
使用此数据: head(USArrests) nrow(USArrests) 我可以这样进行PCA: plot(USArrests) otherPCA <- princomp(USArrests) 我可以在中获得新组件 otherPCA$scores 和方差的比例由组件解释 summary(otherPCA) 但是,如果我想知道哪些变量主要由哪些主要成分来解释?反之亦然:例如PC1或PC2是否主要由解释murder?我怎样才能做到这一点? 例如,我可以说PC1是由murder或解释的80%assault吗? 我认为载荷在这里对我有帮助,但它们显示的是方向性,而不是我理解的方差,例如 otherPCA$loadings Loadings: Comp.1 Comp.2 Comp.3 Comp.4 Murder 0.995 Assault -0.995 UrbanPop -0.977 -0.201 Rape -0.201 0.974

1
如何解释负ACF(自相关函数)?
因此,我绘制了回油的ACF / PACF,并期望看到一些正的自相关,但令我惊讶的是,我只得到了负的显着自相关。我应该如何解释上图?他们似乎表明,当石油收益率先前下降时,有回升的趋势,反之亦然,从而出现了振荡行为。如果我错了,请纠正我。



3
排名列表比较
假设由和组成的两组分别对从最重要到最不重要的25个项目进行排名。比较这些排名的最佳方法是什么?n 2ñ1个n1n_1ñ2n2n_2 显然,可以进行25个Mann-Whitney U测试,但这将导致需要解释的25个测试结果太多(并且在严格使用中会带来多重比较的问题)。对我来说,还不是很清楚,排名是否满足该测试的所有假设。 我也会对有关评级与排名的文献的指针感兴趣。 背景:这25个项目都与教育有关,并且这两组是不同类型的教育者。两组都很小。 编辑以响应@ttnphns: 我并不是要比较第1组和第2组中项目的总排名-就像@ttnphns指出的那样,这是一个常数。但是第1组和第2组的排名会有所不同;也就是说,第1组的项目1排名可能高于第2组。 我可以逐项比较它们,获取每个项目的均值或中位数排名,并进行25次测试,但是我想知道是否有更好的方法可以做到这一点。

2
Stan中没有定义先验的参数
我刚刚开始学习使用Stan和rstan。除非一直对JAGS / BUGS的工作方式感到困惑,否则我一直认为您必须为要从中提取模型的每个参数定义某种先验分布。似乎您不必根据Stan的文档在Stan中执行此操作。这是他们在此处提供的示例模型。 data { int<lower=0> J; // number of schools real y[J]; // estimated treatment effects real<lower=0> sigma[J]; // s.e. of effect estimates } parameters { real theta[J]; real mu; real<lower=0> tau; } model { theta ~ normal(mu, tau); y ~ normal(theta, sigma); } 既mu没有tau定义先验也没有。在将我的一些JAGS模型转换为Stan时,我发现如果我对许多参数(大多数)具有未定义的先验值,它们将起作用。 问题是,当我有没有定义的先验的参数时,我不理解Stan在做什么。是否默认为统一分布?这是HMC的特殊属性之一,它不需要为每个参数都定义一个先验吗?

9
引用具有各种属性的分布
我经常发现自己问这样的,“我知道这个变量的问题 之处在于(0 ,1 )和大多数群众的谎言在(0 ,0.20 ),然后持续下降朝1.我可以使用哪些分布模型呢? ”Xxx(0 ,1 )(0,1)(0,1)(0 ,.20 )(0,.20)(0,.20) 在实践中,由于我了解它们,所以一次又一次地使用相同的几个分布。相反,我想以更系统的方式查找它们。我如何才能获得概率论者在开发所有这些分布方面所做的大量工作? 理想情况下,我希望按属性(支撑区域等)进行组织的参考,因此我可以根据其特征找到分布,然后根据pdf / cdf的可处理性以及理论推导的拟合程度来了解每种分布的更多信息我正在研究的问题。 是否存在这样的参考?如果不存在,如何选择发行版?

1
距离相关与互信息
我已经使用共同信息一段时间了。但是我发现“关联世界”中有一个非常新的度量,也可以用来度量分布独立性,即所谓的“距离相关”(也称为布朗相关):http : //en.wikipedia.org/wiki/Brownian_covariance。我检查了引入此措施的论文,但没有发现对相互信息的任何暗示。 因此,我的问题是: 他们解决完全相同的问题吗?如果不是,那么这些问题有何不同? 并且,如果可以肯定地回答上一个问题,那么使用一个或另一个有什么好处?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.