统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
为什么要在beta回归中使用logit链接?
最近,我对实现beta回归模型感兴趣,其结果是成比例的。请注意,此结果将不适合二项式上下文,因为在此上下文中没有有意义的离散“成功”概念。实际上,结果实际上是持续时间的一部分。分子是某个条件处于活动状态时的秒数,在该条件有资格处于活动状态的总秒数。我为这些变化感到抱歉,但我不想过多地关注这个精确的上下文,因为我意识到,除了beta回归外,还有多种方法可以对这种过程进行建模,而现在我对理论更加感兴趣我在尝试实施这种模型时遇到的问题(尽管我当然是, 无论如何,我能够找到的所有资源都表明,使用logit(或probit / cloglog)链接通常适合使用beta回归,并且将参数解释为对数奇数。但是,我还没有找到一个引用,该引用实际上提供了为什么要使用此链接的任何真实理由。 Ferrari&Cribari-Neto(2004)的原始论文没有提供依据。他们仅注意到logit函数“特别有用”,这是因为对指数参数进行了比值比解释。其他来源则暗示了从区间(0,1)到实线的映射的愿望。但是,考虑到我们已经假设了beta分布,我们是否一定需要链接函数来进行这种映射?链接功能除了假设开始使用beta分布所施加的约束之外,还能提供什么好处?我已经进行了几次快速模拟,即使使用概率分布很大程度上集中在0或1附近的beta分布进行模拟,也没有看到具有(identity)链接的(0,1)区间之外的预测。还不够全面,无法捕捉到某些病理。 在我看来,基于个人在实践中如何根据Beta回归模型(即,比值比)解释参数估计值,即他们隐含地推断出“成功”的几率;也就是说,他们正在使用Beta回归代替二项式模型。考虑到beta和二项式分布之间的关系,这也许在某些情况下是适当的,但是在我看来,这应该是比一般情况更特殊的情况。在这个问题中,提供了一个答案来解释相对于连续比例而不是结果的优势比,但是在我看来,尝试以这种方式解释事物比使用日志等不必要的麻烦或身份链接,并解释百分比变化或单位偏移。 那么,为什么我们将logit链接用于beta回归模型?仅仅是为了方便起见,将其与二项式模型相关联?

1
瓶颈层在神经网络中意味着什么?
我正在阅读FaceNet论文,在导言的第3段中说: 基于深度网络的先前的面部识别方法使用在一组已知面部身份上训练的分类层,然后采用中间瓶颈层作为表示,用于对训练中使用的一组身份以外的识别进行概括。 我想知道中间瓶颈层是什么意思?

3
如何在机器学习管道中对特征选择和超参数优化进行排序?
我的目标是对传感器信号进行分类。到目前为止,我的解决方案的概念是:i)从原始信号中获取工程特征ii)使用ReliefF和聚类方法选择相关特征iii)应用NN,Random Forest和SVM 但是我陷入了困境。在ii)和iii)中,存在用于ReliefF的k-最近的Neigbours或窗口长度的超参数,对其进行评估的传感器信号,或NN的每一层中的隐藏单位数 我在这里看到3个问题:1)调整特征选择参数会影响分类器的性能2)优化分类器的超参数会影响特征的选择。3)评估配置的每种可能组合都是很困难的。 所以我的问题是:a)我可以做一个简化的假设,可以将st调整特征选择参数与调整分类器参数解耦吗?b)还有其他可能的解决方案吗?


2
k倍交叉验证如何适合训练/验证/测试集的背景?
我的主要问题是试图了解k倍交叉验证在具有训练/验证/测试集的情况下的适合度(如果完全适合这种情况)。 通常,人们会谈论将数据分为训练,验证和测试集-例如,每幅吴安德(Andrew Ng)课程的比例为60/20/20-验证集用于识别模型训练的最佳参数。 但是,如果希望在数据量相对较小的情况下使用k折交叉验证以希望获得更具代表性的准确性度量,那么在这种60/20/20拆分中,进行k折交叉验证的确切含义是场景? 例如,这是否意味着我们实际上将训练和测试集(数据的80%)组合在一起,并对它们进行k倍交叉验证,以获取我们的准确性指标(通过具有明确的“测试集”有效地丢弃)?如果是这样,我们在生产中使用a)和b)对验证集使用哪种训练模型并确定最佳训练参数?例如,a和b的一个可能答案可能是使用最佳折叠模型。



2
CNN Xavier权重初始化
在一些教程中,我发现有人说“ Xavier”权重初始化(论文:了解训练深度前馈神经网络的难度)是初始化神经网络权重的有效方法。 对于完全连接的层,这些教程中有一条经验法则: V一个[R (W ^)= 2ñ我ñ+ nØ ü Ť,更简单的选择:V一个[R (W ^)= 1ñ我ñV一种[R(w ^)=2ñ一世ñ+ñØüŤ,更简单的选择:V一种[R(w ^)=1个ñ一世ñVar(W) = \frac{2}{n_{in} + n_{out}}, \quad \text{simpler alternative:} \quad Var(W) = \frac{1}{n_{in}} 其中是图层的权重方差,使用正态分布进行初始化,,是父图层和当前图层中神经元的数量。ñ 我ñ Ñ Ò ù 吨V一个[R (W ^)V一种[R(w ^)Var(W)ñ我ññ一世ñn_{in}ñØ ü ŤñØüŤn_{out} 卷积层有类似的经验法则吗? 我正在努力找出最适合初始化卷积层权重的方法。例如在权重形状为的层中(5, 5, 3, 8),即内核大小为5x5,过滤三个输入通道(RGB输入)并创建8特征图...是否将被3视为输入神经元的数量?或者说75 = 5*5*3,因为输入是5x5每个颜色通道的色标? 我既可以接受一个明确的问题答案,也可以接受一个更“通用”的答案,这可以解释找到正确的权重初始化并最好链接源的一般过程。

3
如何得出AUC的概率解释?
为什么ROC曲线下的面积使分类器(从检索到的预测中)对随机选择的“正”实例进行排序的概率高于(从原始正分类中)随机选择的“正”实例的概率?如何用积分从数学上证明这一说法,使CDF和PDF具有真实的正负类分布?
14 probability  roc  auc 




6
MLE vs MAP估计,什么时候使用?
MLE =最大似然估计 MAP =最大后验 MLE是直观/天真的,因为它仅从给定参数(即似然函数)的观察概率开始,并尝试找到与观察最相符的参数。但是它没有考虑先验知识。 MAP似乎更合理,因为它确实考虑了贝叶斯规则中的先验知识。 这是一个相关的问题,但答案并不彻底。 /signals/13174/differences-using-maximum-likelihood-or-maximum-a-posteriori-for-deconvolution-d 因此,我认为MAP更好。那正确吗?那我什么时候该使用呢?

2
逻辑回归中的过度分散
我正在尝试处理逻辑回归中过度分散的概念。我已经读到过度分散是指观察到的响应变量方差大于二项式分布的预期值。 但是,如果一个二项式变量只能具有两个值(1/0),那么它如何具有均值和方差? 我可以通过x次数的Bernoulli试验来计算成功的均值和方差。但是我无法将只能具有两个值的变量的均值和方差的概念笼罩在脑海中。 任何人都可以提供以下内容的直观概述: 只能有两个值的变量的均值和方差的概念 只能有两个值的变量中的超分散概念

1
将标准化的beta转换回原始变量
我意识到这可能是一个非常简单的问题,但是在搜索后找不到所需的答案。 我有一个需要标准化变量的问题,需要运行(岭回归)来计算beta的岭估计。 然后,我需要将它们转换回原始变量比例。 但是我该怎么做呢? 我找到了双变量情况的公式 β∗= β^小号X小号ÿ。β∗=β^SxSy. \beta^* = \hat\beta \frac{S_x}{S_y} \>. 这在D. Gujarati的《基本计量经济学》第175页,公式(6.3.8)中给出。 凡是在标准化的变量从回归运行的估计和是一样的估计转换回原来的规模,是因变量的样本标准差,以及是样本标准差。* β小号ÿ 小号Xβ∗β∗\beta^*β^β^\hat\beta小号ÿSyS_y小号XSxS_x 不幸的是,这本书没有涵盖多元回归的类似结果。 另外我不确定我是否理解双变量情况?简单的代数运算以原始比例给出的公式:β^β^\hat\beta β^=β∗小号ÿ小号Xβ^=β∗SySx \hat\beta=\beta^* \frac{S_y}{S_x} 在我看来,对已经由放气的变量计算的必须再次由放气才能转换回去吗?(加上为什么不重新添加平均值?)小号X小号Xβ^β^\hat\beta小号XSxS_x小号XSxS_x 因此,有人可以在理想情况下通过推导解释多变量案例的处理方法,以便我可以理解结果吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.