统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
是否有关于统计学的高引用论文实际上散布了不良的统计实践?
显然有许多方法可以滥用统计方法。您是否知道在公认的学术期刊上首先作为显式建议(例如,“您应使用此方法...”)发表过一些不良统计实践的例子? 一个示例可能是每个预测变量规则的10个事件,通常会在logistic或Cox PH回归模型(LINK)中调用该事件。 需要明确的是,我并不是指被引用次数很高的论文碰巧使用了不良的统计方法-不幸的是,这些论文很少见。

1
根据“ 2.5倍RMSE”剔除异常值
在Kahneman and Deaton(2010),作者写道:††^\dagger 该回归解释了37%的方差,均方根误差(RMSE)为0.67852。为了消除异常值和不合理的收入报告,我们删除了一些观察结果,即原木收入与其预测之间的差异的绝对值超过了RMSE的2.5倍。 这是惯例吗?这样做的直觉是什么?根据一开始可能未明确指定的模型定义离群值似乎有些奇怪。异常值的确定是否应该基于构成合理值的某些理论依据,而不是模型对实际值的预测能力如何? ††\dagger:丹尼尔·卡尼曼(Daniel Kahneman),安格斯·迪顿(Angus Deaton)(2010年):高收入可以改善人们对生活的评估,但不能改善情感幸福感。美国国家科学院院刊,2010年9月,107(38)16489-16493;DOI:10.1073 / pnas.1011492107



2
决策阈值是逻辑回归中的超参数吗?
通过使用由模型生成的类成员资格概率的阈值来确定(二进制)逻辑回归的预测类。据我了解,默认情况下通常使用0.5。 但是改变阈值将改变预测的分类。这是否意味着阈值是超参数?如果是这样,为什么(例如)为什么无法使用scikit-learn的GridSearchCV方法轻松地在阈值网格中进行搜索(就像对正则化参数所做的那样C)。

4
在多元回归之前单变量回归的意义是什么?
我目前正在研究一个问题,我们的数据集很小,并且对治疗对结果的因果关系感兴趣。 我的顾问指示我对每个预测变量执行单变量回归,以结果作为响应,然后以治疗分配作为响应。即,要求我一次将一个变量与一个回归拟合,并制作结果表。我问“为什么要这么做?”,答案是“我们对哪些预测因素与治疗分配和结果相关感兴趣,因为这很可能表明混杂因素”。我的顾问是一位训练有素的统计学家,而不是其他领域的科学家,因此,我倾向于信任他们。 这是有道理的,但尚不清楚如何使用单变量分析的结果。这样做是否会导致模型选择的选择导致估计值的显着偏差和狭窄的置信区间?为什么有人要这样做?我很困惑,我的顾问在提出这个问题时还不太清楚。有人在这项技术上有资源吗? (注意:我的顾问曾说过,我们不会将p值用作临界值,而是我们要考虑“一切”。)

1
给定单个样本的概率为0,为什么MLE有意义?
我在回顾一些旧的统计数据时有一种奇怪的想法,由于某种原因,我似乎无法想到答案。 连续的PDF告诉我们在任何给定范围内的观测值的密度。即,如果X〜ñ(μ ,σ2)X∼N(μ,σ2)X \sim N(\mu,\sigma^2),例如,则概率一个实现落在之间一种aa和bbb是简单地∫b一种ϕ (x )dX∫abϕ(x)dx\int_a^{b}\phi(x)dx,其中ϕϕ\phi是标准正态的密度。 当我们考虑对参数(例如μμ\mu进行MLE估计时,我们写出了ñNN(随机变量X1个。。XñX1..XNX_1 .. X_N的联合密度。。X N并将对数似然比wrt区分为μμ\mu,设置为0并求解μμ\mu。通常给出的解释是“给定数据,该参数使该密度函数最合理”。 让我烦恼的部分是:我们的密度为ñNN rv,我们的样本表示,获得特定实现的概率恰好为0。在给定数据的情况下,为什么最大化关节密度甚至有意义(因为再次观察到我们实际样本的概率恰好是0)? 我能想到的唯一合理化方法是,我们希望使PDF 在我们观察到的样本周围尽可能达到峰值,以使该区域中的积分(从而观察该区域中的东西的概率)最高。

8
如何对待不合逻辑的调查答复
我已经向艺术家样本进行了调查。问题之一是要说明以下各项所产生的收入百分比:艺术活动,政府支持,私人养老金,与艺术无关的活动。大约有65%的人回答说百分数之和是100。其他人则没有:例如,有人回答说,他们收入的70%来自他/她的艺术活动,而60%来自收入政府。 , 等等。我的问题是:我应该如何对待这些观察?我应该删除,修改或保留它们吗?谢谢!
13 survey  bias 




2
为什么与套索相比,最好的子集选择不受欢迎?
我正在阅读《统计学习的元素》一书中有关最佳子集选择的内容。如果我有3个预测变量,则创建个子集:2 3 = 8x1,x2,x3x1,x2,x3x_1,x_2,x_323=823=82^3=8 无预测子集 具有预测变量子集x1x1x_1 具有预测变量子集x2x2x_2 具有预测值子集x3x3x_3 具有预测变量子集x1,x2x1,x2x_1,x_2 具有预测变量子集x1,x3x1,x3x_1,x_3 具有预测变量子集X2,X3x2,x3x_2,x_3 具有预测变量子集X1个,X2,X3x1,x2,x3x_1,x_2,x_3 然后,我在测试数据上测试所有这些模型,以选择最佳模型。 现在我的问题是为什么与套索相比,最好的子集选择不受欢迎? 如果我比较最佳子集和套索的阈值函数,我会看到最佳子集将某些系数设置为零,例如套索。但是,其他系数(非零)仍将具有ols值,它们将是无偏的。而在套索中,一些系数将为零,而其他系数(非零)将具有一些偏差。下图更好地显示了它: 从图片中,最佳子集情况下的红线部分位于灰色部分。另一部分位于x轴上,其中某些系数为零。灰线定义了无偏解。在套索中,引入了一些偏差。从该图可以看出,最好的子集比套索更好!使用最佳子集的缺点是什么?λλ\lambda

1
当我们比较控制变量的组时,是否应该使用等效检验?
在许多考虑治疗和结果的论文中,我看到了可能被称为令人讨厌的变量的表(通常是“表1”)(通常是人口统计信息,有时是医疗状况),并带有显着性检验和文字测试,例如“各组大致相似,在XXXXX上没有明显差异,请参见表”。因此,明确的目标是表明分配给不同治疗方法的组是相似的。 但是,在我看来,这似乎是“接受空值”,而我们应该做的(或要求完成的)是对等的检验。 这可能适用于随机试验或观察性研究。我在这里想念什么吗?


5
分布范围是0到1,并且它们之间有峰值?
是否有一个发行版,或者我可以与其他发行版一起创建一个下图所示的发行版(对不好的图纸表示歉意)? 在这里我给出一个数字(在示例中为0.2、0.5和0.9),以表示峰值应位于的位置以及使函数变宽或变窄的标准偏差(sigma)。 PS:当给定数字为0.5时,分布为正态分布。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.