统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
广义线性混合模型:诊断
我有一个随机截距逻辑回归(由于重复测量),我想做一些诊断,特别是关于异常值和有影响力的观察结果的诊断。 我查看了残差以查看是否有突出的观察结果。但我也想看看类似库克的距离或DFFITS。Hosmer和Lemeshow(2000)说,由于缺乏用于关联数据的模型诊断工具,因此应该只适合常规logistic回归模型而忽略相关性,而应使用可用于常规logistic回归的诊断工具。他们认为这比完全不进行诊断要好。 这本书是2000年出版的,我想知道现在是否有可用的方法用于模型诊断和混合效应逻辑回归?什么是检查异常值的好方法? 编辑(2013年11月5日): 由于缺乏响应,我想知道使用混合模型进行的诊断是否一般而言没有进行,或者在对数据建模时不是很重要的一步。因此,让我重新表述我的问题:一旦找到“良好”的回归模型,您会怎么做?


1
不相关性对哪些分布表示独立?
统计由来已久的提醒是“uncorrelatedness并不能意味着独立”。通常,这种提醒是在心理上舒缓的(并且在科学上正确的)陈述中进行补充的:“尽管如此,这两个变量共同正态分布,但不相关的确意味着独立”。 我可以将快乐异常的数量从一增加到两个:当两个变量是伯努利分布时,那么不相关又意味着独立。如果和是两个Bermoulli rv,则,其中我们有,类似地对于,它们的协方差为XXXYYYX∼B(qx),Y∼B(qy)X∼B(qx),Y∼B(qy)X \sim B(q_x),\; Y \sim B(q_y)P(X=1)=E(X)=qxP(X=1)=E(X)=qxP(X=1) = E(X) = q_xYYY Cov(X,Y)=E(XY)−E(X)E(Y)=∑SXYp(x,y)xy−qxqyCov⁡(X,Y)=E(XY)−E(X)E(Y)=∑SXYp(x,y)xy−qxqy\operatorname{Cov}(X,Y)= E(XY) - E(X)E(Y) = \sum_{S_{XY}}p(x,y)xy - q_xq_y =P(X=1,Y=1)−qxqy=P(X=1∣Y=1)P(Y=1)−qxqy=P(X=1,Y=1)−qxqy=P(X=1∣Y=1)P(Y=1)−qxqy = P(X=1,Y=1) - q_xq_y = P(X=1\mid Y=1)P(Y=1)-q_xq_y =(P(X=1∣Y=1)−qx)qy=(P(X=1∣Y=1)−qx)qy= \Big(P(X=1\mid Y=1)-q_x\Big)q_y 对于不相关性,我们要求协方差为零,因此 Cov(X,Y)=0⇒P(X=1∣Y=1)=P(X=1)Cov⁡(X,Y)=0⇒P(X=1∣Y=1)=P(X=1)\operatorname{Cov}(X,Y) = 0 \Rightarrow P(X=1\mid Y=1) = P(X=1) ⇒P(X=1,Y=1)=P(X=1)P(Y=1)⇒P(X=1,Y=1)=P(X=1)P(Y=1)\Rightarrow P(X=1,Y=1) = P(X=1)P(Y=1) 这也是变量独立所需要的条件。 所以我的问题是:您是否知道其他任何分布(连续或离散)的不相关性意味着独立性? 含义:假设两个随机变量具有边际属于相同的分布(或许与所涉及的分布参数不同的值)的分布,但让我们用同样支持如说。两个指数,两个三角形等。方程所有解是否都由于所涉及的分布函数的形式/性质而隐含着独立性?正态边际(也假定它们具有二元正态分布)和伯努利边际都是这种情况-还有其他情况吗?X,YX,YX,YCov(X,Y)=0Cov⁡(X,Y)=0\operatorname{Cov}(X,Y) = 0 这样做的动机是,与检查独立性是否成立相比,通常更容易检查协方差是否为零。因此,如果在给定理论分布的情况下,通过检查协方差,您还在检查独立性(例如伯努利或正态情况),那么这将是一件有用的事情。 …

5
连续随机变量取固定点的概率
我正在介绍性统计课程中,其中连续随机变量的概率密度函数已定义为。我知道的积分,但是我不能凭直觉来对这一点进行纠正。假设X是随机变量,等于从火车到达时间t开始的分钟数。我如何计算火车从现在开始准确到达5分钟的概率?这个概率如何为零?不可能吗 如果火车确实从现在起5分钟后到达,怎么办呢,如果概率为0,怎么办?一∫一个 ˚F (X )d X = 0P{X∈B}=∫Bf(x)dxP{X∈B}=∫Bf(x)dxP\left\{X\in B\right\}=\int_B f\left(x\right)dx∫aaf(x)dx=0∫aaf(x)dx=0\int\limits_a^af(x)dx=0 谢谢。

1
预测间隔=可信间隔?
我想知道预测间隔和可信间隔是否会评估同一件事。 例如,使用线性回归,当您估计拟合值的预测间隔时,您将估计期望值下降的间隔的极限。相反,与置信区间相反,您不会关注平均值等分布参数,而是会针对指定的X值(假设)来说明变量的取值。(1−α)%(1−α)%(1-\alpha)\% Y=a+b.X Y=a+b.X\ Y = a + b.X 当从后验概率分布中估计贝叶斯框架内给定值的拟合值时,可以估计可信区间。这个间隔是否为您提供了有关拟合值的相同信息?XXX

1
基于另一项测试的结果进行假设测试的论文
众所周知,根据另一个统计检验的结果选择一个统计检验是有问题的,因为p值难以解释(例如,根据另一个检验结果(例如正态性)选择统计检验) 。但是,这仍然是许多应用程序中的标准做法,通常似乎在应用论文中并未引起注意或讨论。翻阅文献,我找不到真正讨论这种现象的论文。 我希望能获得与任何出版物有关的链接,这些出版物与基于另一种统计测试的结果来选择统计测试有关,尤其是应用科学家可以访问的出版物。

1
分层Gamma-Poisson模型的超先验密度
在数据的层次模型中,其中 在实践中选择值似乎很典型(,以使伽玛分布的均值和方差与数据的均值和方差大致匹配(例如Clayton和Kaldor,1987年“疾病测绘的年龄标准化相对风险的经验贝叶斯估计”,Biometrics)。显然,这只是一个临时解决方案,因为它会夸大研究人员对参数的信心yyyy∼Poisson(λ)y∼Poisson(λ)y \sim \textrm{Poisson}(\lambda) λ∼Gamma(α,β)λ∼Gamma(α,β)\lambda \sim \textrm{Gamma}(\alpha, \beta)α,β)α,β)\alpha, \beta)yyy(α,β)(α,β)(\alpha, \beta)即使基础数据生成过程保持不变,已实现数据的微小波动也可能对伽玛密度产生重大影响。 此外,Gelman 在贝叶斯数据分析(第二版)中写道,这种方法是“ 草率的 ”。在书和本文中(从第3232页开始),他建议以类似于大鼠肿瘤示例(从第130页开始)的方式选择一些优先级较高的密度)。p(α,β)p(α,β)p(\alpha, \beta) 尽管很明显,只要只要产生一定的后验密度就可以接受,但我还没有找到研究人员过去用于此问题的任何超高密度示例。如果有人可以指出我使用超优先密度来估计泊松-伽马模型的书籍或文章,我将不胜感激。理想情况下,我对感兴趣,它相对平坦,并且会像老鼠肿瘤示例中的数据一样占主导地位,或者对几种替代规格以及与每种规格相关的取舍进行讨论。p(α,β)p(α,β)p(\alpha, \beta)p(α,β)p(α,β)p(\alpha, \beta)

1
估计S型曲线笔直部分的斜率
我被赋予了这项任务,并感到沮丧。一位同事让我估算下图的和:Xü p p è [RXüppË[Rx_{upper}X升ø 瓦特Ë řX升ØwË[Rx_{lower} 曲线实际上是累积分布,而x是某种度量。他很想知道当累积函数开始变得笔直并偏离笔直时,x上对应的值是多少。 我知道我们可以使用微分来找到某个点的斜率,但是我不太确定如何确定何时可以将该直线称为直线。任何对某些已经存在的方法/文学的微调将不胜感激。 如果您碰巧知道此类调查的任何相关软件包或示例,我也知道R。 非常感谢。 更新 多亏了Flounderer,我得以进一步扩展工作,建立框架并在这里和那里修改参数。为了学习,这里是我当前的代码和图形输出。 library(ESPRESSO) x <- skew.rnorm(800, 150, 5, 3) x <- sort(x) meanX <- mean(x) sdX <- sd(x) stdX <- (x-meanX)/sdX y <- pnorm(stdX) par(mfrow=c(2,2), mai=c(1,1,0.3,0.3)) hist(x, col="#03718750", border="white", main="") nq <- diff(y)/diff(x) plot.ts(nq, col="#6dc03480") log.nq <- log(nq) low …

2
小样本随机化可靠吗?
杰罗姆·康菲尔德(Jerome Cornfield)写道: 渔业革命的最好成果之一就是随机化的想法,而在其他几件事上达成共识的统计学家至少对此达成了共识。但是尽管达成了这一协议,并且尽管在临床和其他形式的实验中广泛使用了随机分配程序,但其逻辑状态(即其执行的确切功能)仍然不清楚。 杰罗姆·康菲尔德(1976)。“对临床试验的最新方法论贡献”。美国流行病学杂志104(4):408–421。 在整个站点以及各种文献中,我始终看到关于随机化能力的自信主张。诸如“它消除了混杂变量的问题”之类的强大术语很常见。例如,请参见此处。但是,出于实际/伦理的原因,很多时候都使用小样本(每组3-10个样本)进行实验。这在使用动物和细胞培养物进行临床前研究中非常普遍,研究人员通常报告p值以支持其结论。 这让我想知道,随机化在平衡混淆方面有多好。对于这个图,我模拟了一个比较治疗组和对照组的情况,其中一个混杂物可能以50/50的机会出现两个值(例如,type1 / type2,male / female)。它显示了用于研究各种小样本数量的“不平衡百分比”(处理样本与对照样本之间的type1#的差异除以样本数量)的分布。红线和右侧轴显示ecdf。 小样本量下,随机化下各种程度的平衡概率: 从这个情节可以清楚地看出两件事(除非我在某个地方搞砸了)。 1)随着样本数量的增加,获得完全平衡样本的可能性降低。 2)随着样本数量的增加,获得非常不平衡的样本的可能性降低。 3)在两组中n = 3的情况下,有3%的机会获得一组完全不平衡的组(对照组中的所有type1,治疗中的所有type2)。N = 3在分子生物学实验中很常见(例如,通过PCR测量mRNA或通过蛋白质印迹法测量蛋白质) 当我进一步检查n = 3的情况时,我观察到在这些条件下p值的奇怪行为。左侧显示类型2子组在不同均值条件下使用t检验计算的p值的总体分布。类型1的平均值为0,两组的sd = 1。右侧面板显示了从0.05到0.0001的名义“显着性临界值”的相应假阳性率。 通过t检验比较时,n = 3的p值在n = 3时具有两个子组和第二子组的平均值不同(10000个蒙特卡洛分析): 这是两组的n = 4的结果: 两个组的n = 5: 两组的n = 10: 从上面的图表可以看出,样本量和子组之间的差异之间似乎存在相互作用,这导致在原假设下不一致的各种p值分布。 因此,我们可以得出结论:对于小样本量的适当随机化和受控实验,p值不可靠吗? 第一图的R代码 require(gtools) #pdf("sim.pdf") par(mfrow=c(4,2)) for(n in c(3,4,5,6,7,8,9,10)){ #n<-3 p<-permutations(2, n, …

1
了解在R中执行的引导程序的输出(tsboot,MannKendall)
我对R中的tsboot调用的解释有疑问。我检查了Kendall和启动软件包的文档,但并不比以前更聪明。 当我使用Kendall包中的示例运行引导程序时,测试统计量为Kendall的tau: library(Kendall) # Annual precipitation entire Great Lakes # The Mann-Kendall trend test confirms the upward trend. data(PrecipGL) MannKendall(PrecipGL) 这确认了上升趋势: tau = 0.265, 2-sided pvalue =0.00029206 然后,该示例继续使用块引导程序: # #Use block bootstrap library(boot) data(PrecipGL) MKtau<-function(z) MannKendall(z)$tau tsboot(PrecipGL, MKtau, R=500, l=5, sim="fixed") 我收到以下结果: BLOCK BOOTSTRAP FOR TIME SERIES Fixed Block Length …
11 r  bootstrap 

2
“逐步回归”如何工作?
我使用以下R代码来拟合概率模型: p1 <- glm(natijeh ~ ., family=binomial(probit), data=data1) stepwise(p1, direction='backward/forward', criterion='BIC') 我想知道到底是做什么stepwise和backward/forward做什么,以及如何选择变量?



1
使用交叉验证时平均精度和召回率
我已经使用多个分类器对2类标签数据进行了分类,并且使用了5倍交叉验证。对于每一次折叠,我都计算了tp,tn,fp和fn。然后,我计算了每个测试的准确性,准确性,召回率和F分数。我的问题是,当我想对结果进行平均时,我对精度进行了平均,但我是否也可以对精度,查全率和F评分进行平均?还是这在数学上是错误的?PS在每个类中使用的数据集在每个类的实例数方面都非常均衡。 谢谢。

4
如何在广义增强回归模型中选择树数?
是否有选择GBM中树木数量的策略?具体而言,ntrees在自变量R的gbm函数。 我不明白为什么您不应该设置ntrees为最高合理值。我注意到,大量的树明显减少了来自多个GBM的结果的可变性。我认为大量树木不会导致过度拟合。 有什么想法吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.