统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
在生存分析中使用对数秩与Mantel-Haenszel方法来计算危险比的优缺点是什么?
总结两条生存曲线比较的一种方法是计算危险比(HR)。有(至少)两种方法可以计算该值。 Logrank方法。作为Kaplan-Meier计算的一部分,计算每个组(和)中观察到的事件(通常为死亡)的数量,以及假设生存时间没有差异的零假设(和)的预期事件的数量。。则危险比为: OaOaOaObObObEaEaEaEbEbEbHR=(Oa/Ea)(Ob/Eb)HR=(Oa/Ea)(Ob/Eb) HR= \frac{(Oa/Ea)}{(Ob/Eb)} Mantel-Haenszel方法。首先计算V,它是每个时间点的超几何差异的总和。然后计算危险比为: 我从Machin,Cheung和Parmar,Survival Analysis的第3章获得了这两个方程。该书指出,这两种方法通常提供非常相似的方法,而书中的示例确实如此。HR=exp((Oa−Ea)V)HR=exp⁡((Oa−Ea)V) HR= \exp\left(\frac{(Oa-Ea)}{V}\right) 有人给我举了一个例子,其中两种方法相差三倍。在此特定示例中,很显然对数秩估计是明智的,而Mantel-Haenszel估计值相差甚远。我的问题是,对于何时最佳选择危险比的对数估计,以及何时最佳选择Mantel-Haenszel估计,是否有人有任何一般性建议?与样本量有关吗?领带数量?样本数量比例?
17 survival  hazard 

2
了解线性回归的t检验
我正在尝试找出如何对线性回归执行一些假设检验(零假设没有相关性)。我遇到的每个指南和关于该主题的页面似乎都在使用t检验。但是我不明白线性回归的t检验实际上意味着什么。除非我有完全错误的理解或心理模型,否则将使用t检验比较两个人群。但是,回归变量和回归变量不是相似总体的样本,甚至可能不是同一单位,因此比较它们是没有意义的。 那么,在线性回归上使用t检验时,我们实际上在做什么呢?

1
在无信息的Beta先验之间进行选择
我正在寻找无信息的先验信息,以进行Beta分发以使用二项式过程(命中率/小姐)。最初,我考虑使用生成统一的PDF,或者使用Jeffrey 优先使用。但是我实际上是在寻找对后验结果影响最小的先验,然后我考虑使用的不正确的先验。这里的问题是,只有当我至少有一次命中和一次错过时,我的后验分布才起作用。为了克服这个问题,我然后考虑使用一个非常小的常数,例如,只是为了确保后和将。α=1,β=1α=1,β=1\alpha=1, \beta=1α=0.5,β=0.5α=0.5,β=0.5\alpha=0.5, \beta=0.5α = 0,β= 0α=0,β=0\alpha=0, \beta=0α = 0.0001 ,β= 0.0001α=0.0001,β=0.0001\alpha=0.0001, \beta=0.0001αα\alphaββ\beta> 0>0>0 有谁知道这种方法是否可以接受?我看到了更改这些先验的数值效果,但是有人可以给我一种将像这样的小常数放在先验的解释吗?

2
为什么将T分布用于假设检验线性回归系数?
在实践中,通常使用标准的T检验来检验线性回归系数的显着性。计算的机制对我来说很有意义。 为什么可以使用T分布来建模线性回归假设检验中使用的标准检验统计量?我在这里指的是标准测试统计信息: T0=βˆ−β0SE(βˆ)T0=β^−β0SE(β^) T_{0} = \frac{\widehat{\beta} - \beta_{0}}{SE(\widehat{\beta})}

2
关联特征后,为什么Lasso或ElasticNet的性能优于Ridge
我有一组150个功能,其中许多功能彼此之间高度相关。我的目标是预测范围为1-8的离散变量的值。我的样本大小为550,我正在使用10倍交叉验证。 AFAIK,在正则化方法(套索,ElasticNet和Ridge)中,Ridge更严格地关联特征之间。这就是为什么我期望使用Ridge可以得到更准确的预测的原因。但是,我的结果表明,Lasso或Elastic的平均绝对误差在0.61左右,而岭回归的平均分误差是0.97。我不知道对此会有什么解释。这是因为我拥有许多功能,而Lasso却因为选择了某种功能而摆脱了多余的功能,因此性能更好了吗?



5
从协方差矩阵衡量“方差”?
如果数据为1d,则方差表示数据点彼此不同的程度。如果数据是多维的,我们将获得协方差矩阵。 对于多维数据,通常有没有一种方法可以给出单个的数据点彼此之间如何不同的数量? 我认为可能已经有很多解决方案,但是我不确定搜索所用的正确术语。 也许我可以做一些事情,例如将协方差矩阵的特征值相加,这听起来明智吗?

3
如何决定使用哪个glm家庭?
我有一些鱼密度数据,我试图在几种不同的采集技术之间进行比较,该数据有很多零,并且直方图看上去像是适合泊松分布的vaugley,除了密度以外,它不是整数数据。我对GLM相对陌生,最近几天一直在网上寻找如何确定使用哪个发行版,但是在寻找任何有助于做出此决定的资源方面完全失败了。数据的直方图示例如下所示: 我不知道如何决定要为GLM使用的合适家庭。如果有人有任何建议或可以给我资源,我应该检查一下,那就太好了。

3
负R平方是什么意思?
假设我有一些数据,然后将数据与模型拟合(非线性回归)。然后,我计算R平方()。R2[R2R^2 如果R平方为负,那是什么意思?这是否意味着我的模型不好?我知道的范围可以是[-1,1]。当为0时,这还意味着什么?R2[R2R^2R2[R2R^2

3
Logistic回归还是T检验?
一群人回答一个问题。答案可以是“是”或“否”。研究人员想知道年龄是否与答案的类型有关。 通过进行逻辑回归来评估该关联,其中年龄是解释变量,答案类型(是,否)是因变量。通过计算分别回答“是”和“否”的组的平均年龄,并通过进行T检验以比较均值来分别解决。 两种测试都是在不同的人的建议下进行的,但他们都不确定哪种方法是正确的。鉴于研究问题,哪种测试更好? 对于假设检验,p值不显着(回归)和显着(T检验)。样本少于20例。

2
在有向无环图中表示交互作用
有向无环图(DAG;例如Greenland等,1999)是因果关系反事实解释的因果形式化形式的一部分。在这些图中从变量的箭头的存在可变断言可变直接引起(在危险情况时),可变,和如果没有这样一个箭头的断言,可变不直接原因(在风险的某些变化的)可变。一种一种A乙乙B一种一种A乙乙B一种一种A乙乙B 例如,在下面的DAG因果图中,从“烟草烟雾暴露”到“间皮瘤”的黑色箭头表示“吸烟直接导致间皮瘤风险”的说法。 同样,在下面的DAG因果图中,从“石棉暴露”到“间皮瘤”的黑色箭头表示“石棉暴露直接导致间皮瘤风险的改变” 。 由于红色箭头,我使用术语DAG来描述以下因果关系图,我打算断言诸如“石棉暴露引起烟草烟雾暴露对间皮瘤风险的直接因果效应发生变化 ”(石棉确实对肺细胞的损害,除了直接引起间皮瘤风险的改变外,还使这些细胞更容易受到烟草烟雾暴露的致癌性损害,结果是,接触石棉和烟草都会导致吸烟增加。风险大于两个单独风险的总和),并且这与我在问题开始时描述的DAG中因果箭头的形式含义不太吻合(即,因为红色箭头未终止于变量中))。 如何在DAG的视觉形式主义中正确表示交互作用? 参考文献 格陵兰,S。,珍珠,J。和罗宾斯,JM(1999)。流行病学研究因果图。流行病学,10(1):37-48。

2
使用相关矩阵选择回归的预测变量是否正确?
几天前,我的一位心理学家和研究员向我介绍了他为线性回归模型选择变量的方法。我猜这不好,但是我需要请其他人确保。方法是: 查看所有变量(包括因变量Y)之间的相关矩阵,并选择与Y最相关的那些预测变量Xs。 他没有提到任何标准。 问:他说的对吗? [我认为这种选择方法是错误的,因为有很多事情,比如说应该选择哪个预测变量,甚至是省略变量偏差(OVB)的理论。]

2
如何解释p值的QQ图
我正在使用称为plink(http://pngu.mgh.harvard.edu/~purcell/plink/download.shtml)的软件进行GWAS SNP疾病关联研究。 通过关联结果,我得到了所有已分析的SNP的p值。现在,我使用这些p值的QQ图显示一个非常低的p值是否与p值的预期分布(均匀分布)不同。如果p值偏离预期分布,则可以“将该” p值称为统计有效值。 正如您在QQ图中看到的那样,在顶部尾端,最后4点有点难以解释。灰色的最后两个点表明,这些p值位于p值的预期分布中,而其他两个则不在。 现在,如何解释这一点,最后两个点具有较低的 p值,但根据QQ-情节不是“显著”,而其他两个点有较高的 P值“显著”?这怎么可能是真的?
17 qq-plot 

2
LDA中的“线性判别系数”是什么?
在中R,我使用lda库中的函数MASS进行分类。据我了解LDA,输入将被分配标签,这将最大化,对吗?XXxÿÿyp (ÿ| X)p(ÿ|X)p(y|x) 但是当我拟合其中我不太了解的输出, x=(Lag1,Lag2 )X=(大号一种G1,大号一种G2)x=(Lag1,Lag2)ÿ= d 我ř Ë Ç 吨我Ò Ñ ,ÿ=d一世[RËCŤ一世Øñ,y=Direction,lda 编辑:要重现下面的输出,请首先运行: library(MASS) library(ISLR) train = subset(Smarket, Year < 2005) lda.fit = lda(Direction ~ Lag1 + Lag2, data = train) > lda.fit Call: lda(Direction ~ Lag1 + Lag2, data = train) Prior probabilities of groups: Down Up 0.491984 …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.