统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


1
如果检验统计量的分布是双峰的,那么p值意味着什么?
假设零假设为真,则将P值定义为至少获得与所观察到的极端一样的检验统计量的概率。换一种说法, P(X≥t|H0)P(X≥t|H0)P( X \ge t | H_0 ) 但是,如果检验统计量在分布上是双峰的,该怎么办?在这种情况下,p值意味着什么吗?例如,我将在R中模拟一些双峰数据: set.seed(0) # Generate bi-modal distribution bimodal <- c(rnorm(n=100,mean=25,sd=3),rnorm(n=100,mean=100,sd=5)) hist(bimodal, breaks=100) 并假设我们观察到的测试统计值为60。在这里,从图片中我们知道该值是不太可能的。因此,理想情况下,我希望使用一个统计过程(例如p值)来揭示这一点。但是,如果我们按照定义的p值进行计算,则会得到相当高的p值 observed <- 60 # Get P-value sum(bimodal[bimodal >= 60])/sum(bimodal) [1] 0.7991993 如果我不知道分布,我将得出结论,我观察到的仅仅是偶然的机会。但是我们知道这是不对的。 我想我要问的问题是:为什么在计算p值时,为什么要计算“至少与所观察值一样极端”的值的概率?如果遇到上面模拟的情况,替代解决方案是什么?


1
非数学家的Clopper-Pearson
我想知道是否有人可以向我解释Clopper-Pearson CI之外的直觉。 据我所知,每个配置项都包含一个差异。但是,对于比例,即使我的比例是0或1(0%或100%),也可以计算Clopper-Pearson CI。我尝试查看这些公式,但我知道它具有二项式分布的百分位数,而且我知道查找CI涉及迭代,但是我想知道是否有人可以用“简单的单词”或最少的数学来解释逻辑和有理数?

4
包含不确定性的内核密度估计
可视化一维数据时,通常使用内核密度估计技术来考虑不正确选择的bin宽度。 当我的一维数据集具有测量不确定性时,是否有标准方法来合并此信息? 例如(如果我的理解是天真的,请原谅我)KDE将高斯分布与观测值的三角函数卷积。该高斯核在每个位置之间共享,但是可以改变高斯参数以匹配测量不确定度。有执行此操作的标准方法吗?我希望用宽内核反映不确定的值。σσ\sigma 我只是在Python中实现了此功能,但我不知道执行此操作的标准方法或函数。这种技术有什么问题吗?我确实注意到它给出了一些奇怪的图形!例如 在这种情况下,低值具有较大的不确定性,因此倾向于提供较宽的平坦内核,而KDE会过重权重低(且不确定)的值。

1
找不到适合混合效果的计数数据的良好模型-ZINB还是其他?
我有一个关于单蜂丰度的非常小的数据集,我无法进行分析。它是计数数据,几乎所有计数都在一种处理中,而大多数零在另一种处理中。还有两个非常高的值(六个站点中的两个站点中的每个站点),因此计数分布的尾巴非常长。我正在R中工作。我使用了两个不同的软件包:lme4和glmmADMB。 泊松混合模型不适合:当不拟合随机效应时模型过于分散(glm模型),而当拟合随机效应时模型分散不充分(glmer模型)。我不明白为什么会这样。实验设计要求嵌套随机效应,因此我需要将它们包括在内。泊松对数正态误差分布不会提高拟合度。我使用glmer.nb尝试了负二项式误差分布,但无法拟合它–达到了迭代极限,即使使用glmerControl(tolPwrss = 1e-3)更改了公差。 因为很多零是由于我根本看不到蜜蜂(它们通常是微小的黑色物体)而造成的,所以我接下来尝试了零膨胀模型。ZIP不太适合。ZINB是迄今为止最好的模型拟合,但是我仍然对模型拟合不太满意。我不知道下一步该怎么做。我确实尝试了跨栏模型,但无法将截断分布拟合到非零结果–我认为是因为在控制处理中有很多零(错误消息是“ Model.frame.default(formula = s.bee〜tmt + lu +:可变长度不同(发现为“治疗”)”)。 另外,我认为我所包含的交互对我的数据做了一些奇怪的事情,因为系数很小,尽管当我比较bbmle软件包中使用AICctab的模型时包含交互的模型是最好的。 我包括一些R脚本,这些脚本几乎可以重现我的数据集。变量如下: d = Julian日期,df = Julian日期(作为因子),d.sq = df平方(蜜蜂数量增加,然后整个夏天下降),st =站点,s.bee =蜜蜂数量,tmt =处理,lu =土地利用类型,hab =周围景观中半自然栖息地的百分比,ba =边界地区的圆形田地。 非常感谢收到关于如何获得良好模型拟合的任何建议(替代误差分布,不同类型的模型等)! 谢谢。 d <- c(80, 80, 121, 121, 180, 180, 86, 86, 116, 116, 144, 144, 74, 74, 143, 143, 163, 163, 71, 71,106, …

2
从问卷中找出无用的问题
我正在开发问卷。为了提高其可靠性和有效性,我想使用统计方法。 我想消除答案始终相同的问题。这意味着几乎所有参与者都对这些问题给出了相同的答案。 现在我的问题是: 这类无用的问题的答案总是相同的,与使用环境无关的技术术语是什么? 有什么方法可以识别此类问题?


1
贝瑞反演
我拥有关于美国葡萄酒销售的大量市场数据集,我想估计对某些优质葡萄酒的需求。这些市场份额基本上来自于以下形式的随机效用模型: 其中包括观察到的产品特征,表示产品价格,是影响需求且与价格相关的未观察到的产品特征,是误差项,索引个人,索引产品和指数市场(在这种情况下为城市)。Uijt=X′jtβ−αpjt+ξjt+ϵijt≡δjt+ϵjtUijt=Xjt′β−αpjt+ξjt+ϵijt≡δjt+ϵjtU_{ijt} = X’_{jt}\beta - \alpha p_{jt} + \xi_{jt} + \epsilon_{ijt} \equiv \delta_{jt} + \epsilon_{jt}XXXξ ε 我Ĵ 吨pppξξ\xiϵϵ\epsiloniiijjjttt 由于无法使用质量术语,因此我无法使用通常的条件logit模型,并且我没有好的仪器。但是,Berry(1994)开发了一种在多项式logit框架中线性化市场方程组非线性系统的策略,但我无法弄清楚他如何进行反演步骤。ξξ\xi 在真正的参数值,他说,估计市场份额应该等于“真实的”市场份额:为然后他建议将市场份额从 为 可以解决并将其消除。如果有人可以阐明该反演步骤的工作原理,甚至可以在Stata中实现它,那就太好了。非常感谢。小号Ĵ吨=小号 Ĵ吨(δ,α,β)δ=小号 -1(小号,α,β)ξsˆjt(X,β,α,ξ)=Sjts^jt(X,β,α,ξ)=Sjt\widehat{s}_{jt} (X, \beta , \alpha , \xi) = S_{jt}Sjt=sˆjt(δ,α,β)Sjt=s^jt(δ,α,β)S_{jt} = \widehat{s}_{jt}(\delta , \alpha , \beta)δ=sˆ−1(S,α,β)δ=s^−1(S,α,β)\delta = \widehat{s}^{-1}(S, \alpha, \beta)ξξ\xi Berry,ST 1994,“估计产品差异的离散选择模型”,兰德经济学期刊,第25卷,第2期,第242-62页

2
大众比萨统计
《纽约时报》网站上的简短条目提供了美国比萨消费的事实和数据。我对如何使用统计数据(或滥用统计数据)向普通受众提供信息有偶然的兴趣,并且根据提供的统计数据出现了两个问题: 如果今天八分之一的美国人会吃披萨,这是否意味着美国人平均每八天吃一次披萨?这里有一个假设,就是每个美国人都吃披萨,事实并非如此。但是,这就提出了一个问题,即如何对多少美国人吃披萨做出正确的假设。 据报道,一个孩子的热量摄入中有25%是比萨。我将一个孩子定义为9岁的孩子,他的身体比较活跃,因此需要每天摄入2000卡路里的热量。如果我们相信Google估计的披萨片中的卡路里数量为285,那么这是否意味着一个孩子平均每周食用12片披萨?(2000 * 7 * 0.25 / 285) 我怀疑我对统计数据的解释是错误的;在我看来,今天有八分之一的美国人正在吃披萨,而现在每天也吃大约1.7片以达到25%的卡路里摄入量,这似乎并不是一个孩子的一部分。

1
手动计算对数似然,以进行广义非线性最小二乘回归(nlme)
我正在尝试为函数优化的广义非线性最小二乘回归计算对数似然功能在R包,使用由距离上AA进化树假设(布朗运动产生的方差协方差矩阵从包中)。以下可重现的R代码使用x,y数据和具有9个分类单元的随机树来拟合gnls模型:f(x)=β1(1+xβ2)β3f(x)=β1(1+xβ2)β3f(x)=\frac{\beta_1}{(1+\frac x\beta_2)^{\beta_3}}gnlsnlmecorBrownian(phy=tree)ape require(ape) require(nlme) require(expm) tree <- rtree(9) x <- c(0,14.51,32.9,44.41,86.18,136.28,178.21,262.3,521.94) y <- c(100,93.69,82.09,62.24,32.71,48.4,35.98,15.73,9.71) data <- data.frame(x,y,row.names=tree$tip.label) model <- y~beta1/((1+(x/beta2))^beta3) f=function(beta,x) beta[1]/((1+(x/beta[2]))^beta[3]) start <- c(beta1=103.651004,beta2=119.55067,beta3=1.370105) correlation <- corBrownian(phy=tree) fit <- gnls(model=model,data=data,start=start,correlation=correlation) logLik(fit) 我想logLik根据从获得的估计参数来“手动”计算对数似然(在R中,但不使用函数),gnls因此它与的输出匹配logLik(fit)。注意:我不是要估计参数;我只想计算该函数估计的参数的对数似然gnls性(尽管如果有人提供了一个可重现的示例,说明了如何在不使用的情况下估计参数gnls,我将非常感兴趣!)。 我不确定如何在R中执行此操作。S和S-Plus的混合效果模型(Pinheiro和Bates)中描述的线性代数表示法让我非常头疼,而且我的尝试都没有logLik(fit)。以下是Pinheiro和Bates描述的详细信息: 对数似然为广义非线性最小二乘模型 其中的计算方法如下:φ 我 = 甲我 βÿ一世= f一世(ϕ一世,v一世)+ ϵ一世yi=fi(ϕi,vi)+ϵiy_i=f_i(\phi_i,v_i)+\epsilon_iϕ一世= A一世βϕi=Aiβ\phi_i=A_i\beta 升(β,σ2,δ| ÿ)= − 12{ N日志(2 πσ2)+ ∑我= …

3
如何将瘦态分布转变为正态分布?
假设我有一个变数变量,我想将其转换为正态分布。哪些转换可以完成此任务?我很清楚,转换数据可能并不总是理想的,但是作为一项学术追求,假设我想将数据“锤击”到正常状态。此外,从图中可以看出,所有值均严格为正。 我已经尝试了各种转换(我以前见过的几乎所有转换,包括等),但是它们都不能很好地工作。是否有使Leptokurtic分布更正常的众所周知的转换?1X,X−−√,asinh(X)1X,X,asinh(X)\frac 1 X,\sqrt X,\text{asinh}(X) 请参见下面的示例普通QQ图:

5
分布的峰度与密度函数的几何关系如何?
峰度用于测量分布的峰度和平坦度。分布的密度函数(如果存在)可以视为曲线,并具有与其形状相关的几何特征(例如曲率,凸度等)。 因此,我想知道分布的峰度是否与密度函数的某些几何特征有关,从而可以解释峰度的几何含义?

4
回归残差分布假设
为什么有必要将分布假设置于误差上,即 ,具有 ε 我〜Ñ(0 ,σ 2)。ÿ一世= Xβ+ ϵ一世yi=Xβ+ϵiy_i = X\beta + \epsilon_{i}ϵ一世〜ñ(0 ,σ2)ϵi∼N(0,σ2)\epsilon_{i} \sim \mathcal{N}(0,\sigma^{2}) 为什么不写 ,与 ÿ 我〜Ñ(X β,σ 2),ÿ一世= Xβ+ ϵ一世yi=Xβ+ϵiy_i = X\beta + \epsilon_{i}ÿ一世〜ñ(Xβ^,σ2)yi∼N(Xβ^,σ2)y_i \sim \mathcal{N}(X\hat{\beta},\sigma^{2}) 其中在任一情况下。 我已经看到它强调指出分布假设是基于错误而不是数据,但没有解释。 ϵ一世= y一世- ÿ^ϵi=yi−y^\epsilon_i = y_i - \hat{y} 我不太了解这两种说法之间的区别。在某些地方,我看到分布假设被放置在数据上(贝叶斯照明。它似乎主要是),但是大多数情况下,假设被放置在错误上。 在建模时,为什么/应该选择一个假设还是另一个假设开始?

1
信息从帽子矩阵中进行逻辑回归
对我来说很明显,并且在多个位置上都有很好的解释,帽子矩阵对角线上的值为线性回归提供了哪些信息。 对我来说,逻辑回归模型的帽子矩阵不太清楚。它与您通过线性回归从帽子矩阵中获得的信息相同吗?这是我在CV的另一个主题(源1)上发现的hat矩阵的定义: H=VX(X′VX)−1X′VH=VX(X′VX)−1X′VH=VX ( X'V X)^-1 X' V 其中X为预测变量的向量,V为的对角矩阵(π(1−π))−−−−−−−−√(π(1−π))\sqrt{(π(1−π))}。 换句话说,观察的帽子矩阵的特定值是否也只是表示协变量在协变量空间中的位置,而与该观察的结果值无关吗? 这写在Agresti的《分类数据分析》一书中: 观测值的杠杆越大,其对拟合的潜在影响就越大。与普通回归一样,杠杆率介于0到1之间,并且等于模型参数的数量。与普通回归不同,帽子值取决于拟合以及模型矩阵,具有极高预测值的点不需要具有高杠杆作用。 因此,超出这个定义,似乎不能像在普通线性回归中那样使用它? 来源1:如何计算R中逻辑回归的帽子矩阵?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.