统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
是否可以推荐Burnham-Anderson关于多模型推理的书?
出于最近R预测包中的默认模型选择统计从AIC更改为AICc的动机,我很好奇后者在任何地方都适用的情况下是否确实适用。在这方面,我有一系列问题,这是第一个。 我知道,Burnham和Anderson(非统计学家)在(1)中所著的著名著作(在此处进行了总结)建议采用随处可见的AICc来代替AICc 。有时候,年轻的统计学家会不加批判地提及这本书,例如,参见Rob Hyndman对本博客文章的评论,但统计学家Brian Ripley提出了一种截然不同的建议: “Burnham and Anderson (2002) is a book I would recommend people NOT read until they have read the primary literature. I see no evidence that the authors have actually read Akaike’s papers." [quoted from [AIC MYTHS AND MISUNDERSTANDINGS][4] by Burnham-Anderson] 确实是根据里普利(Ripley)在AIC和相关理论上所写的内容,应认真对待警告。我既有大量的Akaike自己的论文集,也有Burnham-Anderson的书。我最终将对本书的质量有自己的看法,但这也将有助于了解统计人员(无论年龄大小)对此的看法。特别是,是否有统计学教授(或其他统计学的优秀学生)明确推荐这本书作为使用AIC进行模型选择的知识的有用总结? 参考: (1)Burnham,KP&Anderson,DR模型选择和多模型推理:实用的信息理论方法Springer,2002年 PS。在回答最近的“答案”时指出“ Burnham博士是统计学博士”时,我想补充一下。是的,他本人是统计学家,是ASA的会员,并且获得了许多专业奖项,包括ASA的杰出成就奖章。但是谁说他不是?我上面所说的是,作为两位作者,他们不是统计学家,而这本书反映了这一事实。

3
估计优惠券收集者问题中的n
在优惠券收集者问题的一个变体中,您不知道优惠券的数量,必须根据数据确定该数量。我将其称为幸运饼干问题: 给定未知数量的不同幸运饼干消息,通过一次采样一个cookie并计算每个幸运出现多少次来估算。还确定在此估计上获得所需置信区间所需的样本数量。nñnnñn 基本上,我需要一种算法,该算法只需采样足够的数据即可达到给定的置信区间,例如,置信度为。为简单起见,我们可以假设所有的命运都以相同的概率/频率出现,但是对于更普遍的问题而言并非如此,因此也欢迎对此提出解决方案。n±5ñ±5n \pm 595%95%95\% 这似乎类似于德国的坦克问题,但是在这种情况下,幸运饼干没有按顺序贴上标签,因此没有排序。

4
从贝叶斯概率角度来看,为什么95%的置信区间不包含具有95%概率的真实参数?
从Wikipedia页面上的置信区间: ...如果在重复(可能不同)实验的许多单独数据分析中构建置信区间,则包含参数真实值的此类区间的比例将与置信度匹配... 并在同一页面上: 置信区间不能预测给定实际获得的数据,参数的真实值具有置信区间内的特定概率。 如果我理解正确的话,那么最后的陈述是考虑到概率论的频繁性解释。但是,从贝叶斯概率角度来看,为什么95%的置信区间不包含具有95%概率的真实参数?如果不是,则以下推理出了什么问题? 如果我知道某个过程在95%的时间内都能给出正确的答案,则下一个答案正确的可能性为0.95(假设我没有有关该过程的任何额外信息)。同样,如果有人向我展示了由某个过程创建的置信区间,该过程将在95%的时间内包含真实参数,那么根据我所知,我是否应该说它包含0.95概率的真实参数? 这个问题类似于但不相同,为什么95%CI并不意味着95%的机会包含均值?这个问题的答案一直集中在为什么从经常性的角度来看,95%CI并不意味着95%的机会包含均值。我的问题是相同的,但是从贝叶斯概率角度来看。

1
似然比测试-LMER R-非嵌套模型
我目前正在审查一些工作,遇到了以下问题,这对我来说似乎是错误的。使用lmer拟合了两个混合模型(在R中)。这些模型是非嵌套的,并通过似然比测试进行比较。简而言之,这是我拥有的可复制示例: set.seed(105) Resp = rnorm(100) A = factor(rep(1:5,each=20)) B = factor(rep(1:2,times=50)) C = rep(1:4, times=25) m1 = lmer(Resp ~ A + (1|C), REML = TRUE) m2 = lmer(Resp ~ B + (1|C), REML = TRUE) anova(m1,m2) 据我所知,它lmer被用来计算对数似然,并且该anova语句使用具有通常自由度的卡方来测试模型之间的差异。这对我来说似乎不正确。如果是正确的话,有人知道有什么参考可以证明这一点吗?我知道依赖模拟的方法(Lewis等人的论文,2011年)和Vuong(1989年)开发的方法,但是我不认为这是在这里产生的。我认为该anova陈述的使用不正确。

4
证明以下两个公式的等价性为Spearman相关
从维基百科中,通过将变量XiXiX_i和YiYiY_i转换为排名变量和,然后计算排名变量之间的皮尔逊相关性,来计算Spearman的排名相关性:xixix_iyiyiy_i 但是,本文继续指出,如果变量和之间没有联系,则上式等于XiXiX_iYiYiY_i 其中di=yi−xidi=yi−xid_i = y_i - x_i,在行列的差异。 有人可以证明这一点吗?我无权访问维基百科文章所引用的教科书。

3
在随机森林模型中加权最近的数据
我正在使用随机森林训练一个分类模型,以区分6个类别。我的交易数据大约有6万多个观察值和35个变量。这是一个大致的示例。 _________________________________________________ |user_id|acquisition_date|x_var_1|x_var_2| y_vay | |-------|----------------|-------|-------|--------| |111 | 2013-04-01 | 12 | US | group1 | |222 | 2013-04-12 | 6 | PNG | group1 | |333 | 2013-05-05 | 30 | DE | group2 | |444 | 2013-05-10 | 78 | US | group3 | |555 | 2013-06-15 | …

3
我可以根据样本大小以及最小值和最大值重建正态分布吗?我可以使用中点来代表均值
从统计上讲,我知道这可能有些困难,但这是我的问题。 我有很多范围数据,即变量的最小,最大和样本大小。对于其中一些数据,我也有一个平均值,但并不多。我想将这些范围相互比较,以量化每个范围的变异性,并比较均值。我有充分的理由假设分布在均值周围是对称的,并且数据将具有高斯分布。因此,我想我可以证明在没有均值时使用分布的中点作为均值的代理。 我想做的是为每个范围重建一个分布,然后使用该分布为该分布提供标准偏差或标准误差。我仅有的信息是从样本中观察到的最大值和最小值,以及将中点作为平均值的代表。 这样,我希望能够基于我拥有的范围数据和我的假设(对称分布和正态分布)来计算每组的加权均值,并计算出每组的变异系数。 我打算使用R来做到这一点,因此任何代码帮助也将不胜感激。


2
样本数量不相等:何时退出
我正在同peer审查一篇学术期刊文章,作者写了以下内容作为不报告任何推论统计数据的理由(我确定了这两组的性质): 总共的2349(1.1%)的受访者25报道X。我们适当地避免提供将X组与Y组(其他2,324名参与者)进行统计学比较的分析,因为这些结果可能是偶然性所驱动,而这种结果很少见。 我的问题是,这项研究的作者是否有理由在比较群体方面有所作为?如果没有,我会向他们推荐什么?

4
可以将随机森林方法论应用于线性回归吗?
随机森林通过创建决策树的集合来工作,其中每棵树都是使用原始训练数据的引导样本(输入变量和观察值的样本)创建的。 可以将类似的过程应用于线性回归吗?使用随机引导样本为k个回归中的每一个创建k个线性回归模型 不创建类似模型的“随机回归”的原因是什么? 谢谢。如果有什么我只是从根本上误会了,请告诉我。

3
如何从Cox PH模型获得生存时间的预测?
我想针对所有(几乎)全部在随访结束时(例如一年)死亡的参与者建立一个全因死亡率的预测模型(Cox PH)。 我不想预测某个时间点的绝对死亡风险,而是想预测每个人的生存时间(以月为单位)。 是否有可能在R中获得这样的预测(例如从一个coxph对象),如果可以,我该怎么做? 提前谢谢了!

3
通过多项式回归了解置信带
我试图理解我在下面的图中看到的结果。通常,我倾向于使用Excel并获得线性回归线,但在以下情况下,我使用R并通过以下命令获得多项式回归: ggplot(visual1, aes(ISSUE_DATE,COUNTED)) + geom_point() + geom_smooth() 所以我的问题可以归结为: 蓝色回归线周围的灰色区域(箭头1)是什么?这是多项式回归的标准偏差吗? 我可以说灰色区域(箭头2)外部的任何东西都是“离群值”,而灰色区域(箭头3)内部的所有东西都在标准偏差之内吗?

3
p = 5.0%有意义吗?
今天有人问我,是否认为p值为0.05(精确)是有意义的(给定的alpha = 5%)。我不知道答案,而Google给出了两个答案:(a)如果p小于5%,则结果显着;(b)如果p小于5%或等于5%,则结果显着。 当然,这些网站都没有引用任何人。为什么要选一个-这是常识,而5%是任意的。但这无助于我告诉我的学生要记住的事情。 因此,这是我关于检验假设的绝望问题:如果p值恰好是alpha,我认为结果是否重要?在这种情况下,权威引用是什么? 非常感谢你

1
如何正确评估序数和连续变量之间的相关性?
我想估算以下两者之间的相关性: 一个序数变量:要求受试者以1-5的等级(从非常恶心到非常美味)对6种类型的水果进行偏好评分。平均而言,受试者仅使用该等级的3分。 连续变量:要求相同的对象快速识别这些水果,从而得出6个水果的平均准确度。 Spearman rho是分析这些数据的最佳方法和/或我可以考虑其他好的方法吗?

3
每叶具有线性回归模型的回归树算法
简短版:我正在寻找可以构建决策树的R包,而决策树中的每个叶子都是完整的线性回归模型。AFAIK,该库rpart创建决策树,其中因变量在每个叶子中都是恒定的。是否存在rpart可以构建此类树的另一个库(或我不知道的设置)? 加长版:我正在寻找一种基于训练数据集构建决策树的算法。树中的每个决策根据自变量之一的条件将训练数据集分为两部分。树的根包含完整的数据集,并且数据集中的每一项仅包含在一个叶节点中。 该算法如下所示: 从完整的数据集开始,该数据集是树的根节点。选择这个节点,并调用它。NNN 在的数据上创建线性回归模型。NNN 如果的的线性模型比某个阈值更高,那么我们已处理完毕的,所以标记作为叶并跳转到步骤5。R2R2R^2NNNθR2θR2\theta_{R^2}NNNNNN 尝试随机决策,然后选择在子节点中产生最佳决策: nnnR2R2R^2 选择一个随机独立变量,以及一个随机阈值θ 我。viviv_iθiθi\theta_i 决定拆分所述数据集的Ñ成两个新节点,Ñ和〜Ñ。vi≤θivi≤θiv_i \leq \theta_iNNNN^N^\hat{N}N~N~\tilde{N} 创建两个线性回归模型Ñ和〜Ñ,并计算它们的- [R 2(它们调用ř和〜- [R )。N^N^\hat{N}N~N~\tilde{N}R2R2R^2r^r^\hat{r}r~r~\tilde{r} 从所有这些元组(v 我,θ 我,- [R , 〜 - [R )中,选择一个具有最大米我Ñ ([R , 〜 - [R )。 这就产生了树一个新的决定,并ñ有两个新的子节点ñ和〜ñ。nnn(vi,θi,r^,r~)(vi,θi,r^,r~)(v_i, \theta_i, \hat{r}, \tilde{r})min(r^,r~)min(r^,r~)min(\hat{r}, \tilde{r})NNNN^N^\hat{N}N~N~\tilde{N} 我们已经完成了处理。选择一个尚未处理的新节点N,然后返回步骤2。如果所有节点均已处理,则算法结束。NNNNNN 这将以递归方式建立决策树,将数据分成较小的部分,并在每个部分上计算线性模型。 步骤3是退出条件,可以防止算法过度拟合。当然,还有其他可能的退出条件: 出口如果的树中的深度为上述θ d Ë p 吨ħNNNθdepthθdepth\theta_{depth} 出口如果在数据集中小于θ d 一吨一个小号ë 吨NNNθdatasetθdataset\theta_{data …
14 r  regression  rpart  cart 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.