统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
危害比率可以转化为生存时间中位数的比率吗?
在一篇描述生存分析结果的论文中,我读到了一条陈述,该陈述暗示可以使用以下公式将危险比(HR)转换为中位生存时间比(M1M1M_1和M2M2M_2): HR=M1M2HR=M1M2HR = \frac{M_1}{M_2} 我敢肯定,当人们不能假设成比例的风险模型时,它就不成立了(因为如果HR定义不明确,那就没有用了)。但是我怀疑,即使那样,它对于指数分布以外的任何生存分布也将不起作用。我的直觉对吗?
15 survival  hazard 

1
随机检验和置换检验之间的区别
在文献中,术语“随机化”和“置换”可互换使用。许多作者都说“置换(aka随机化)测试”,反之亦然。 充其量我相信差异是微妙的,这取决于他们对数据的假设以及可以得出的结论。我只需要检查我的理解是否正确,或者我是否缺少更深的区别。 排列检验假设数据是从基础总体分布(总体模型)中随机抽取的。这意味着从置换检验得出的结论通常适用于来自总体的其他数据[3]。 随机化检验(随机化模型)“使我们能够放弃典型心理学研究的令人难以置信的假设-从指定分布中随机抽样” [2]。但是,这意味着得出的结论仅适用于测试中使用的样品[3]。 当然,区别仅在于人口的定义。如果我们将人群定义为“所有患有疾病且适合治疗的患者”,则排列检验对该人群有效。但是,由于我们将人群限制在适合治疗的人群中,因此它实际上是一项随机检验。 参考文献: [1] Philip Good,置换检验:关于检验假设的重采样方法的实用指南。 [2] Eugene Edgington和Patric Onghena,随机检验。 [3] Michael Ernst,置换方法:精确推断的基础

2
具有秩相关的典范相关分析
典型相关分析(CCA)旨在最大化两个数据集的线性组合的通常Pearson乘积矩相关(即线性相关系数)。 现在,考虑该相关系数仅测量线性关联这一事实-这就是为什么我们也使用Spearman- 或Kendall- τ(秩)相关系数来测量之间的任意单调(不一定是线性)联系的原因。变量。ρρ\rhoττ\tau 因此,我想到了以下几点:CCA的一个局限性在于,由于其目标函数,它仅试图捕获所形成的线性组合之间的线性关联。通过最大化Spearman- 而不是Pearson- r在某种意义上扩展CCA是否可行?ρρ\rhorrr 这样的程序会导致任何统计学上可解释和有意义的事情吗?(例如,对等级执行CCA有意义吗??)我想知道当我们处理非常规数据时是否有帮助...

3
考克斯模型与逻辑回归
假设我们遇到以下问题: 预测未来3个月内最有可能停止在我们商店购物的客户。 对于每个客户,我们都知道他们开始在我们的商店购买商品的月份,此外,我们还具有每月汇总的许多行为功能。“老大”的客户已经买了五十个月了。让我们表示自客户开始通过()开始购买以来的时间。可以假设客户数量很大。如果客户停止购买三个月然后又回来,则将其视为新客户,因此一个事件(停止购买)只能发生一次。tttt∈[0,50]t∈[0,50]t \in [0, 50] 我想到了两种解决方案: Logistic回归 -对于每个客户和每个月(可能是最近三个月除外),我们可以说客户是否停止购买,因此我们可以对每个客户和每个月进行一次观察。我们可以将自开始以来的月数用作分类变量,以获取等效的基本危害函数。 扩展Cox模型 -也可以使用扩展Cox模型对该问题进行建模。看来这个问题更适合生存分析。 问题:在类似问题中进行生存分析有哪些优势?生存分析是出于某种原因而发明的,因此必须具有一定的优势。 我对生存分析的知识不是很深,我认为使用逻辑回归也可以实现Cox模型的大多数潜在优势。 可以使用ttt和分层变量的相互作用获得等效的分层Cox模型。 可以通过将种群分为几个亚群并为每个亚群估计LR来获得交互作用Cox模型。 我看到的唯一好处是Cox模型更加灵活。例如,我们可以轻松地计算出客户6个月后停止购买的可能性。


1
哪些统计方法是过时的,应该从教科书中省略?[关闭]
按照目前的情况,这个问题并不适合我们的问答形式。我们希望答案会得到事实,参考或专业知识的支持,但是这个问题可能会引起辩论,争论,民意调查或扩展讨论。如果您认为此问题可以解决并且可以重新提出,请访问帮助中心以获取指导。 6年前关闭。 在回答有关二项式比例的置信区间的问题时,我指出了这样一个事实,即正态逼近是一种不可靠的方法,是一种过时的方法。尽管可能会争论说将其作为有关什么是适当方法的一课的一部分,但不应将其作为方法来讲授。 还有哪些其他“标准”统计方法已经过了使用期限,并且应在以后的教科书版本中省略(从而为有用的思想留出空间)?


1
我可以将协方差矩阵转换为变量的不确定性吗?
我有一个GPS单元,它通过协方差矩阵输出噪声测量值:ΣΣ\Sigma Σ=⎡⎣⎢σxxσyxσxzσxyσyyσyzσxzσyzσzz⎤⎦⎥Σ=[σxxσxyσxzσyxσyyσyzσxzσyzσzz]\Sigma = \left[\begin{matrix} \sigma_{xx} & \sigma_{xy} & \sigma_{xz} \\ \sigma_{yx} & \sigma_{yy} & \sigma_{yz} \\ \sigma_{xz} & \sigma_{yz} & \sigma_{zz} \end{matrix}\right] (有也是参与,但我们忽略了一秒钟。)ttt 假设我想告诉其他人,每个方向()的精度都是某个数字。μ X,μ ÿ,μ ž。也就是说,我的GPS可以给我的阅读X = ˉ X ± μ X,等等。我的理解是,μ在这种情况下,意味着所有被测量是彼此独立的(即协方差矩阵对角线)。此外,找到矢量误差就像在正交中求和(平方和的平方根)一样简单。x,y,zx,y,zx,y,zμx,μy,μzμx,μy,μz\mu_x, \mu_y, \mu_zx=x¯±μxx=x¯±μxx=\bar{x}\pm\mu_xμμ\mu 如果我的协方差矩阵不是对角线会怎样?是否存在一个包含y和z方向影响的简单数字?如何找到给定的协方差矩阵?μ∗xμx∗\mu_x^*yyyzzz

1
如何使用R估计泊松过程?(或者:如何使用NHPoisson包?)
我有一个事件数据库(即日期变量)和相关的协变量。 这些事件是由非平稳泊松过程生成的,参数是某些协变量的未知(但可能是线性)函数。 我认为NHPoisson软件包仅用于此目的。但是经过15个小时的失败研究,我仍然不知道如何使用它。 哎呀,我什至尝试阅读两本参考书:Coles,S.(2001)。极值统计建模简介。施普林格。Casella,G.和Berger,RL,(2002年)。统计推断。布鲁克斯/科尔。 fitPP.fun文档中的一个示例似乎不适合我的设置;我没有极端的价值观!我只是裸露事件。 有人可以帮我举一个简单的例子,用单个协变量拟合参数的泊松过程,并假设吗?我对和估计很感兴趣。我提供了一个包含事件时间的两列数据集(假设是在任意时间之后以秒为单位测量),而另一列则提供了协变量?的值。λλ\lambdaXXXλ=λ0+α⋅Xλ=λ0+α⋅X\lambda = \lambda_0 + \alpha \cdot Xλ0λ0\lambda_0αα\alphat0t0t_0XXX

2
估计多元高斯的协方差后验分布
我需要以很少的样本“学习”一个双变量高斯分布,但是对于先验分布有一个很好的假设,因此我想使用贝叶斯方法。 我定义我的在先: P(μ)∼N(μ0,Σ0)P(μ)∼N(μ0,Σ0) \mathbf{P}(\mathbf{\mu}) \sim \mathcal{N}(\mathbf{\mu_0},\mathbf{\Sigma_0}) μ0=[00] Σ0=[160027]μ0=[00] Σ0=[160027] \mathbf{\mu_0} = \begin{bmatrix} 0 \\ 0 \end{bmatrix} \ \ \ \mathbf{\Sigma_0} = \begin{bmatrix} 16 & 0 \\ 0 & 27 \end{bmatrix} 和我的分销给定的假说 P(x|μ,Σ)∼N(μ,Σ)P(x|μ,Σ)∼N(μ,Σ) \mathbf{P}(x|\mathbf{\mu},\mathbf{\Sigma}) \sim \mathcal{N}(\mathbf{\mu},\mathbf{\Sigma}) μ=[00] Σ=[180018]μ=[00] Σ=[180018] \mathbf{\mu} = \begin{bmatrix} 0 \\ 0 \end{bmatrix} \ \ \ \mathbf{\Sigma} = …

2
估计正态分布的参数:中位数而不是均值?
估计正态分布参数的常用方法是使用均值和样本标准差/方差。 但是,如果存在一些离群值,则中位数和与中位数的中位数偏差应该更健​​壮,对吗? 在某些数据集我想,通过估计正态分布N(median(x),median|x−median(x)|)N(median(x),median|x−median(x)|)\mathcal{N}(\text{median}(x), \text{median}|x - \text{median}(x)|)似乎产生更好的配合比经典N(μ^,σ^)N(μ^,σ^)\mathcal{N}(\hat\mu, \hat\sigma)用平均值和RMS偏差。 如果您假设数据集中存在一些离群值,是否有任何理由不使用中位数?您知道这种方法的参考吗?在Google上进行快速搜索并没有发现有用的结果来讨论此处使用中位数的好处(但显然,“正态分布参数估计中位数”不是一组非常具体的搜索字词)。 中位数偏差,是否有偏差?我应该乘它n−1nn−1n\frac{n-1}{n}减少偏见? 您是否知道其他分布(例如Gamma分布或指数修改的高斯分布)(在参数估计中需要偏度,而离群值确实弄乱了该值)的相似鲁棒参数估计方法吗?

4
logit函数是否始终是二进制数据回归建模的最佳选择?
我一直在考虑这个问题。用于模拟二进制数据的常用逻辑函数为: 然而,logit函数是S形曲线,始终是建模数据的最佳选择?也许您有理由相信您的数据不遵循正常的S形曲线,而是具有域的另一种类型的曲线。log(p1−p)=β0+β1X1+β2X2+…log⁡(p1−p)=β0+β1X1+β2X2+… \log\left(\frac{p}{1-p}\right)=\beta_0+\beta_1X_1+\beta_2X_2+\ldots (0,1)(0,1)(0,1) 是否对此有任何研究?也许您可以将其建模为Probit函数或类似的函数,但是如果它完全是其他函数呢?这样可以更好地估计效果吗?只是我的想法,我想知道是否对此有任何研究。

1
gbm软件包中输出项的含义?
我正在使用gbm软件包进行分类。如预期的那样,效果很好。但是我试图理解分类器的输出。输出中有五个术语。 `Iter TrainDeviance ValidDeviance StepSize Improve` 谁能解释每个词的含义,特别的意义提高。

2
指定协方差结构:利弊
在GLM中指定协方差结构有什么好处(而不是将协方差矩阵中的所有非对角线条目都视为零)?除了反映人们对数据的了解之外,它还能 提高贴合度? 提高对保留数据的预测准确性? 让我们估计协方差的程度? 施加协方差结构的成本是多少?可以 为估算算法增加计算复杂性? 增加估计参数的数量,还增加AIC,BIC,DIC? 是否有可能凭经验确定正确的协方差结构,或者这是否取决于您对数据生成过程的了解? 我没有提到任何成本/收益吗?

1
为什么我们要稳定方差?
在阅读Kaggle Essay Eval方法时,我遇到了方差稳定化转换。他们使用方差稳定化变换对kappa值进行变换,然后取平均值,然后将其变换回去。即使阅读了我无法理解的关于方差稳定化变换的Wiki,为什么我们实际上仍能稳定方差呢?我们从中获得什么好处?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.