统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
多元回归和多重比较
说我适合p个解释变量的多元回归。t检验将允许我检查如果这些中的任意单个是显著()。我可以进行部分F检验,以检查其中的某些子集是否有意义()。H0:β一世= 0H0:β一世=0H_0: \beta_i = 0H0:β一世= βĴ= 。。。= βķ= 0H0:β一世=βĴ=。。。=βķ=0H_0: \beta_i=\beta_j=...=\beta_k=0 我经常看到的是,某人从5个t检验中获得了5个p值(假设他们有5个协变量),而仅保持p值<0.05。这似乎有点不正确,因为确实应该进行多重比较检查吗?说像和是有意义的但不是,和这样的东西真的很公平吗?β1个β1个\beta_1β2β2\beta_2β3β3\beta_3β4β4\beta_4β5β5\beta_5 在相关说明中,假设我对2个独立模型(不同结果)进行了2个回归。是否需要对两个结果之间的重要参数进行多重比较检查? 编辑: 为了与类似的问题区分开,对p值是否还有其他解释:“在对所有其他协变量进行调整时,B_i是(有效的)”?似乎这种解释并不能让我查看每个B_i并将那些小于0.5的B_i删除(这与另一篇文章类似)。 在我看来,一种确定B_i和Y是否存在关系的肯定方法是为每个协变量获取一个相关系数p值,然后执行multcomp(尽管这肯定会丢失信号)。 最后,假设我计算了B1 / Y1,B2 / Y1和B3 / Y1之间的相关性(因此是三个p值)。无关地,我还在T1 / Y2,T2 / Y2,T3 / Y2之间进行了关联。我假设正确的Bonferroni调整对于所有6个测试一起为6(而不是第一组为3,第二组为3-从而获得2个“半”调整后的p值)。

3
多元回归中解释变量之间的线性关系
我正在阅读《使用R:基于示例的方法进行数据分析和图形》的多元回归一章,感到有点困惑,以至于发现它建议检查解释变量之间的线性关系(使用散点图),如果没有,牛逼的任何,转化他们,使他们也变得更加线性相关的。以下是一些摘录: 6.3拟合多元回归模型的策略 (...) 检查涉及所有解释变量的散点图矩阵。(在这一点上,包括因变量是可选的。)首先看一下解释变量相互之间的关系图中是否存在非线性的证据。 (...) 这一点确定了一种模型搜索策略- 搜索模型,其中解释变量之间的回归关系遵循“简单”线性形式。因此,如果某些成对图显示出非线性的证据,请考虑使用变换来给出更接近线性的关系。尽管不一定可以证明采用这种策略可以对回归关系进行充分建模,但出于以下原因,这是开始进行搜索时遵循的良好策略。 (...) 如果解释变量之间的关系近似线性,也许是在变换之后,则可以放心地将预测变量对响应变量的图进行解释。 (...) 可能无法找到一个或多个说明变量的变换,以确保面板中显示的(成对)关系呈现线性。这就会产生问题无论对于诊断地块解释为任何拟合回归方程的系数的解释在拟合方程。参见Cook和Weisberg(1999)。 我不应该担心因变量之间的线性关系(由于存在多重共线性的风险)而不是积极地追求它们吗?具有近似线性相关变量的优点是什么? 作者将在本章稍后部分讨论多重共线性的问题,但此建议似乎与避免多重共线性有关。

1
卢斯选择公理,关于条件概率的问题[关闭]
已关闭。这个问题需要细节或说明。它当前不接受答案。 想改善这个问题吗?添加细节并通过编辑此帖子来澄清问题。 2年前关闭。 我正在读Luce(1959)。然后,我发现了以下语句: 当一个人在备选方案中进行选择时,通常他们的反应似乎受以选择集为条件的概率所支配。但是普通概率论及其对条件概率的标准定义似乎并不是所需要的。一个例子说明了困难。在决定如何从家到另一座城市旅行时,您可以选择乘飞机(a),公共汽车(b)或汽车(c)。令A,B,C表示与旅行形式相关的自然状态的不确定性。请注意,如果选择c,则A和B的所有不确定性都将保留,因为无论您是否在飞机上,飞机都会飞行并且公共汽车在运行。但是,如果您选择a或b,那么您的汽车将保留在车库中,并且从驾驶汽车起就彻底改变了C集。 引入第一章的选择公理是对构建类似于概率的选择理论的首次尝试,该理论绕过了固定的,通用的样本空间假设。 资料来源:http : //www.scholarpedia.org/article/Luce's_choice_axiom 对我来说,概率度量由三重态,样本空间,西格玛代数F和最后一个度量P定义。ΩΩ\OmegaFF\mathcal{F}PPP 对于上述示例,如果我定义以下内容,这似乎是个问题: Ω={bus,car,airplane}Ω={bus,car,airplane}\Omega = \{ \text{bus}, \text{car}, \text{airplane} \} 共同统计中的一个关键假设是ceteris paribus条件。这是因为违反cp假设而需要在选择行为的背景下调整基本概率论的原因吗?


1
glm或glmnet哪个更准确?
R glm和glmnet使用不同的算法。 当我同时使用两者时,我会发现估计系数之间存在不小的差异。 我对何时一个比另一个更准确以及解决/准确性权衡的时间感兴趣。 具体来说,我指的是在glmnet中设置lambda = 0的情况,这是因为它估计与glm相同。

3
固定效果与随机效果
我最近开始学习广义线性混合模型,并且正在使用R探索将组成员身份视为固定或随机效应有何不同。特别是,我正在查看此处讨论的示例数据集: http://www.ats.ucla.edu/stat/mult_pkg/glmm.htm http://www.ats.ucla.edu/stat/r/dae/melogit.htm 正如本教程中概述的那样,Doctor ID的作用是可观的,我期望随机截距的混合模型能够提供更好的结果。但是,比较两种方法的AIC值表明此模型较差: > require(lme4) ; hdp = read.csv("http://www.ats.ucla.edu/stat/data/hdp.csv") > hdp$DID = factor(hdp$DID) ; hdp$Married = factor(hdp$Married) > GLM = glm(remission~Age+Married+IL6+DID,data=hdp,family=binomial);summary(GLM) Call: glm(formula = remission ~ Age + Married + IL6 + DID, family = binomial, data = hdp) Deviance Residuals: Min 1Q Median 3Q Max -2.5265 -0.6278 …

1
LASSO如何在共线预测变量中选择?
我正在寻找一个直观的答案,为什么GLM LASSO模型会从一组高度相关的预测器中选择一个特定的预测器,以及为什么这样做与最佳子集特征选择不同。 根据1996年Tibshirani中图2所示的LASSO的几何形状,我认为LASSO选择方差更大的预测变量。 现在,假设我使用具有10倍CV的最佳子集选择来获得2个逻辑回归模型的预测变量,并且我具有合理的先验知识,这2个预测变量是最优的(0-1损失意义上)。 LASSO解决方案偏向于使用较少的简约(5个预测变量)解决方案,并具有较大的预测误差。凭直觉,是什么导致差异出现?是因为LASSO在相关预测变量中进行选择的方式吗?

2
因果推论和预测之间有什么关系?
因果推论和预测(分类和回归)之间的关系和区别是什么? 在预测上下文中,我们具有预测器/输入变量和响应/输出变量。这是否意味着输入和输出变量之间存在因果关系?那么,预测是否属于因果推理? 如果我理解正确,则因果推理会考虑在给定另一个随机变量的情况下估计一个随机变量的条件分布,并且经常使用图形模型来表示随机变量之间的条件独立性。因此,从这个意义上讲,因果推理不是预测,是吗?

2
为什么在使用具有正负值的数据时变异系数无效?
我似乎找不到确切的答案。 我的数据由几张图组成,测量平均值在0.27到0.57之间。在我的情况下,所有数据值都是正值,但是测量本身是基于反射率值的比率,范围可以是-1到+1。这些图代表NDVI的值,NDVI是植被“生产力”的远程指标。 我的目的是比较每个图的值的变异性,但是由于每个图的均值不同,因此我选择使用CV来衡量每个图的NDVI值的相对离散度。 据我了解,采用这些图的CV并不是合规的,因为每个图可以同时具有正值和负值。为什么在这种情况下不宜使用简历?有哪些可行的替代方案(例如,相对分散,数据转换等的类似测试)?

1
R中的离散时间危害模型(博客)
该survival软件包R似乎专注于连续时间生存模型。我对估计比例风险模型(互补对数-对数模型)的离散时间版本感兴趣。我有一个非常简单的生存模型,并带有简单的权限检查。 我知道,估算此模型的一种方法是创建一个数据集,该数据集在不是“死角”的每个时期的每个观察值中都有单独的一行。然后,可以使用glm带有cloglog链接的模型。 这种方法似乎对内存效率很低。实际上,它可能会产生一个数据集,该数据集对于我的计算机上的内存而言太大。 第二种方法是自己编写MLE。那将足够简单,但是我希望有一个可以固定这种生存模型的软件包。协作更容易,并且避免使用程序包时出现编码错误。 有人知道这样的包裹吗?
10 r  survival 

2
寻找已知数量的圆心,以最大化固定距离内的点数
我有一组二维数据,我想在其中找到指定数量的圆心()的中心,这些圆使指定距离()内的点总数达到最大。NNNRRR 例如,我有10,000个数据点,我想找到圆的中心,它们在的半径内捕获了尽可能多的点。预先给出了5个中心和10个半径,而不是从数据中得出的。(Xi,Yi)(Xi,Yi)(X_i, Y_i)N=5N=5N=5R=10R=10R=10 圆内数据点的存在是二进制“或”或“命题”。如果,则相距11个单位与100个单位之外的点的值没有差异,因为它们都>10。类似地,在圆内,靠近中心与靠近边缘也没有任何附加值。 。数据点在圆圈之一中或不在圆圈中。R=10R=10R=10 是否有一个好的算法可以用来解决这个问题?这些似乎与聚类技术有关,但不是最小化平均距离,如果该点在个点中的任意一个点的内,则“距离”函数为0 ,否则为1。RRRNNN 我更喜欢在R中找到一种方法来执行此操作,但是任何方法都是可以理解的。
10 r  clustering  distance 



1
具有均匀和不均匀容器的直方图
这个问题描述了均匀和不均匀直方图之间的基本区别。和这个问题讨论经验法则用于拾取均匀直方图的仓的数量优化(在某些意义上)该直方图表示该数据的样品绘制的分布程度。 我似乎找不到关于均匀和非均匀直方图的同类“最优性”讨论。我有一个离群点很远的聚类非参数分布,因此直觉上不均匀的直方图更有意义。但我希望对以下两个问题进行更精确的分析: 统一bin直方图何时比不均匀bin更好? 对于不均匀的直方图,有多少个bin? 对于不均匀的直方图,我认为是最简单的情况,我们从未知分布中抽取样本,对所得的值进行排序,然后将它们分成 bin,这样每个bin都具有个样本(假设对于某个大整数,)。通过取bin i中值的与bin i + 1中值的\ min之间的中点来形成范围。这里和这里的链接描述了这些类型的非均匀直方图。ññnññnķķkķñķñ\frac{k}{n}Ñ ≡ Ç ķñ≡Cķn \equiv c kCCc最大值最大值\max一世一世i分分\min我+ 1一世+1个i+1


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.