统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
指数族分布是否均存在均值和方差?
假设标量随机变量属于具有pdf的矢量参数指数族XXX FX(x | θ )= h (x )exp(∑我= 1sη一世(θ)T一世(X )- 甲(θ))fX(x|θ)=h(x)exp⁡(∑i=1sηi(θ)Ti(x)−A(θ)) f_X(x|\boldsymbol \theta) = h(x) \exp\left(\sum_{i=1}^s \eta_i({\boldsymbol \theta}) T_i(x) - A({\boldsymbol \theta}) \right) 其中θ =(θ1个,θ2,⋯ ,θs)Ťθ=(θ1,θ2,⋯,θs)T{\boldsymbol \theta} = \left(\theta_1, \theta_2, \cdots, \theta_s \right )^T是参数向量,T(x)=(T1个(X ),Ť2(x ),⋯ ,Ts(x ))ŤT(x)=(T1(x),T2(x),⋯,Ts(x))T\mathbf{T}(x)= \left(T_1(x), T_2(x), \cdots,T_s(x) \right)^T是联合充分统计量。 可以证明存在每个T_i(x)的均值和方差Ť一世(x )Ti(x)T_i(x)。但是,X的均值和方差XXX(即Ë(X)E(X)E(X)和V一个- [R (X)Var(X)Var(X))是否也总是存在吗?如果不是,是否存在这种形式的指数族分布实例,其均值和变量不存在? 谢谢。

3
可以(应该)在随机效应模型中使用正则化技术吗?
通过正则化技术,我指的是套索,岭回归,弹性网等。 考虑一个包含人口统计和诊断数据的医疗保健数据预测模型,其中预测住院时间。对于某些人,在基线时间段内有多个LOS观测值(即,一个以上IP事件)相关。 例如,建立一个包含每个人随机效应拦截项的弹性净预测模型是否有意义?

2
在逻辑回归中可视化类别的影响及其普遍性的最佳方法是什么?
我需要使用民意调查数据来介绍有关候选人投票的主要预测因子的信息。我已经使用我关心的所有变量进行了逻辑回归,但是我找不到一种很好的方式来显示此信息。 我的客户不仅在乎效果的大小,而且在乎效果的大小与具有此类属性的总体大小之间的相互作用。 如何在图形中处理呢?有什么建议么? 这是一个例子: 当候选变量中因变量为Vote / Not时,变量SEX(Male = 1)的为2.3,这是取幂并被视为比值比或概率后的大数。但是,进行此调查的社会只有30%的男性。因此,尽管人非常支持该候选人,但对于试图赢得多数选举的候选人而言,他们的人数并不重要。ββ\beta

3
将多级模型拟合到R中的复杂测量数据
我正在寻找有关如何在R中使用多级模型分析复杂调查数据的建议。我已使用该survey软件包对一级模型中选择的不平等概率进行加权,但是此软件包没有用于多层建模的功能。该lme4软件包非常适合用于多层建模,但是我不知道有一种方法可以在不同级别的聚类中包含权重。Asparouhov(2006)提出了问题: 多级模型通常用于分析群集抽样设计中的数据。但是,这样的抽样设计通常在集群级别和单个级别使用不相等的选择概率。在一个或两个级别上分配采样权重以反映这些概率。如果在任何一个级别上都忽略了采样权重,则参数估计值可能会出现明显偏差。 用于两级模型的一种方法是在MPLUS中实现的多级伪最大似然(MPML)估计器(Asparouhov等,α)。Carle(2009)回顾了主要的软件包,并提出了一些有关如何进行的建议: 为了使用复杂的调查数据和设计权重正确地执行MLM,分析人员需要可以在程序外部包括按比例缩放的权重并包括“新”缩放的权重而无需自动修改程序的软件。当前,三个主要的MLM软件程序允许这样做:Mplus(5.2),MLwiN(2.02)和GLLAMM。不幸的是,HLM和SAS都无法做到这一点。 West和Galecki(2013)给出了更新的评论,我将详细引用相关文章: 有时,分析人员希望使LMM适合从复杂设计的样本中收集的数据集(见Heeringa等,2010,第12章)。复杂的样本设计通常具有以下特征:将人群划分为各个阶层,从阶层内部对个体集群进行多阶段选择,以及集群和最终样本个体的选择概率均等。这些不平等的选择概率通常会导致构建个体的采样权重,从而确保在纳入分析时对描述性参数进行无偏估计。这些权重可能会针对调查无响应而进一步调整,并根据已知的总体总数进行校准。传统上,分析人员在估计回归模型时可能会考虑基于设计的方法来整合这些复杂的采样功能(Heeringa等,2010)。最近,统计学家已经开始探索基于模型的方法来分析这些数据,使用LMM来结合采样层的固定效应和采样群的随机效应。 开发基于模型的方法来分析这些数据的主要困难是选择适当的方法来合并抽样权重(有关问题的摘要,请参见Gelman,2007)。Pfeffermann等。(1998),Asparouhov和Muthen(2006)以及Rabe-Hesketh和Skrondal(2006)开发了用于以合并调查权重的方式估算多层次模型的理论,Rabe-Hesketh和Skrondal(2006),Carle(2009)和Heeringa等。(2010年,第12章)介绍了使用当前软件程序的应用程序,但这仍然是统计研究的活跃领域。能够适应LMM的软件过程处于实现迄今为止文献中提出的用于合并复杂设计特征的方法的各个阶段,分析人员在将LMM拟合到复杂的样本调查数据时需要考虑这一点。有兴趣将LMM拟合到从复杂样本调查收集的数据中的分析人员,将被吸引到能够将调查权重正确纳入估计程序(HLM,MLwiN,Mplus,xtmixed和gllamm)的程序。区域。 这使我想到我的问题:是否有人对将LMM拟合R中的复杂测量数据有最佳实践建议?

1
通用线性模型(GLM)是否总是存在规范链接函数?
在GLM中,假定基础分布的标量和具有pdf 可以证明。如果链接函数满足以下条件,则其中是线性预测变量,则为此被称为规范链接函数模型。YYYθθ\thetafY(y|θ,τ)=h(y,τ)exp(θy−A(θ)d(τ))fY(y|θ,τ)=h(y,τ)exp⁡(θy−A(θ)d(τ))f_Y(y | \theta, \tau) = h(y,\tau) \exp{\left(\frac{\theta y - A(\theta)}{d(\tau)} \right)}μ=E(Y)=A′(θ)μ=E⁡(Y)=A′(θ) \mu = \operatorname{E}(Y) = A'(\theta)g(⋅)g(⋅)g(\cdot)g(μ)=θ=X′βg(μ)=θ=X′βg(\mu)=\theta = X'\beta X′βX′βX'\betag(⋅)g(⋅)g(\cdot) 我的问题是,规范链接功能是否始终存在于GLM中?换句话说,总是可以反转吗?规范链接函数存在的必要条件是什么?A′(θ)A′(θ)A'(\theta)


1
卡方因变量的比例分布
假设,其中是独立的。X 我〜Ñ (0 ,σ 2)X=X1+X2+⋯+XnX=X1+X2+⋯+Xn X = X_1 + X_2+\cdots+ X_n Xi∼N(0,σ2)Xi∼N(0,σ2)X_i \sim N(0,\sigma^2) 我的问题是,什么分布 Z=X2X21+X22+⋯+X2nZ=X2X12+X22+⋯+Xn2 Z = \frac{X^2}{X_1^2 + X_2^2 + \cdots + X_n^2} 跟随?从这里我知道两个表示为卡方随机变量的比率遵循Beta分布。我认为这假设和之间具有独立性。但是在我的情况下,的分母包含平方的成分。 WYZXWW+YWW+Y\frac{W}{W + Y}WWWYYYZZZXXX 我认为也必须遵循Beta分布的变化,但是我不确定。如果这个假设是正确的,我不知道如何证明它。ZZZ

3
交叉验证分类准确性的置信区间
我正在研究一个分类问题,该问题计算两个输入X射线图像之间的相似性度量。如果图像属于同一个人(标签为“正确”),则将计算更高的度量;两个不同人的输入图像(标签为“错误”)将导致较低的指标。 我使用分层的10倍交叉验证来计算错误分类的概率。我当前的样本大小约为40个正确匹配和80个错误匹配,其中每个数据点都是计算得出的指标。我得到的误分类概率为0.00,但是我需要对此进行某种置信区间/错误分析。 我正在研究使用二项式比例置信区间(在此情况下,将交叉验证的结果用作成功次数的正确标记或错误标记)。但是,二项式分析背后的假设之一是每个试验的成功概率相同,并且我不确定交叉验证中“正确”或“错误”分类背后的方法是否可以认为具有成功几率相同。 我能想到的唯一其他分析是重复进行交叉验证X次并计算分类误差的均值/标准差,但是我不确定这是否合适,因为我会重复使用我的数据相对较小的样本数倍。 有什么想法吗?我正在使用MATLAB进行所有分析,并且确实有“统计”工具箱。非常感谢您的协助!

1
边际模型与随机效应模型–如何在它们之间进行选择?给外行的建议
在搜索有关边际模型和随机效应模型以及如何在它们之间进行选择的任何信息时,我发现了一些信息,但是它或多或少是数学抽象的解释(例如此处的示例:https://stats.stackexchange .com / a / 68753/38080)。我发现在这两种方法/模型之间的参数估计值之间存在实质性差异(http://www.biomedcentral.com/1471-2288/2/15/),但是Zuur等人则相反。(2009年,第116页;http://link.springer.com/book/10.1007%2F978-0-387-87458-6)。边际模型(广义估计方程法)带来了总体平均参数,而随机效应模型(广义线性混合模型)的输出考虑了随机效应–主体(Verbeke等人,2010年,第49-52页;http:/ /link.springer.com/chapter/10.1007/0-387-28980-1_16)。 我想在非统计学家和非数学家熟悉的语言中,在一些模型(现实生活)示例中看到对这些模型的一些类似外行的解释。 详细来说,我想知道: 什么时候应该使用边际模型,什么时候应该使用随机效应模型?这些模型适合哪些科学问题? 这些模型的输出应如何解释?

1
您如何从其样本路径检查随机过程的遍历性?
如何从其样本路径检查广义平稳随机过程的遍历性? 我们可以从单个样本路径检查遍历性吗?还是我们需要多个样本路径? 检查遍历性的一种动机是在时间序列中,以确保您可以安全地将样本路径随时间的平均值用作总体平均值的估计值?

2
期望与平均值相同吗?
我正在大学里做ML,而教授在试图向我们解释有关高斯过程的某些东西时,提到了期望(E)一词。但是根据他的解释,我知道E与平均值μ相同。我明白吗? 如果相同,那么您知道为什么同时使用两个符号吗?我也看到E可以像E()一样用作函数,但是我对μ没有看到。X2x2x^2 有人可以帮助我更好地了解两者之间的区别吗?

1
采样分布的半径为2D正态分布
均值和协方差矩阵的二元正态分布可以用半径和角度极坐标重写。我的问题是:给定样本协方差矩阵,的采样分布是什么,即从点到估计中心的距离是多少?Σ [R θ - [R X ˉ X小号μμ\muΣΣ\Sigmarrrθθ\thetar^r^\hat{r}xxxx¯x¯\bar{x}SSS 背景:从点到均值的真实距离遵循Hoyt分布。与特征值的,和,它的形状参数是,其缩放参数为。已知累积分布函数是两个Marcum Q函数之间的对称差。rrrμ λ 1,λ 2Σ λ 1 > λ 2 q = 1xxxμμ\muλ1,λ2λ1,λ2\lambda_{1}, \lambda_{2}ΣΣ\Sigmaλ1>λ2λ1>λ2\lambda_{1} > \lambda_{2} ω=λ1+λ2q=1(λ1+λ2)/λ2)−1√q=1(λ1+λ2)/λ2)−1q=\frac{1}{\sqrt{(\lambda_{1}+\lambda_{2})/\lambda_{2})-1}}ω=λ1+λ2ω=λ1+λ2\omega = \lambda_{1} + \lambda_{2} 仿真表明,估计堵和的和到真正的CDF适用于大样本,但不适用于小样本。下图显示了200次的结果小号μΣx¯x¯\bar{x}SSSμμ\muΣΣ\Sigma 为给定(轴),(行)和分位数(列)的每种组合模拟20个2D法线向量X ωqqqxxxωω\omega 对于每个样本,计算观察到的半径至的给定分位数 ˉ Xr^r^\hat{r}x¯x¯\bar{x} 对于每个样本,在插入样本估计和之后,根据理论Hoyt(二维法线)cdf和理论Rayleigh cdf计算分位数。小号x¯x¯\bar{x}SSS 当接近1(分布变为圆形)时,估计的Hoyt分位数接近不受影响的估计的Rayleigh分位数。随着增长,经验分位数与估计分位数之间的差异会增加,特别是在分布的尾部。q ωqqqqqqωω\omega

1
最大似然估计的几何解释
我正在阅读富兰克林·费舍尔(Franklin M. Fisher)的《计量经济学中的识别问题》一书,对他通过可视化似然函数来演示识别的部分感到困惑。 该问题可以简化为: 对于回归,其中Ú 〜我。我。d 。Ñ (0 ,σ 2我), 一个和b是参数。假设Y的系数c等于1。然后,在c ,a ,b空间中的似然函数 将沿着射线具有与真实参数的向量及其标量倍数相对应的脊ÿ= a + Xb + uÿ=一种+Xb+üY=a+Xb+u你〜我。我。d。ñ(0 ,σ2一世)ü〜一世。一世。d。ñ(0,σ2一世)u \sim i.i.d. N(0,\sigma^2I)一种一种abbbÿÿYCCcc ,a ,bC,一种,bc, a,b。仅考虑给定的位置时,似然函数在光线与该平面相交的点处将具有唯一的最大值。c = 1C=1个c=1 我的问题是: 关于演示中提到的山脊和射线,应该如何理解和推理。 由于射线是真实的参数和标量,因此为什么射线不在给出的平面上,因为参数c的真实值为1。c = 1C=1个c=1CCc

1
弗里德曼测试与威尔科克森测试
我正在尝试评估监督型机器学习分类算法的性能。观察结果属于名义类别(目前为2类,不过我想将其概括为多类问题),这些样本来自99名受试者。 我想回答的问题之一是,如果算法在输入类别之间的分类准确度方面存在显着差异。对于二元分类的情况,我正在使用配对的Wilcoxon检验来比较受试者之间各类之间的平均准确性(因为基础分布是非正态的)。为了将此程序推广到多类问题,我特别使用了Friedman检验。 但是,在二进制IV的情况下,通过这两种方法获得的p值变化很大,Wilcoxon检验屈服,p < .001而p = .25Friedman检验。这使我相信我对弗里德曼测试的结构有基本的误解。 在这种情况下,使用弗里德曼检验来比较所有受试者重复测量准确性的结果是否合适? 我获得这些结果的R代码(subject是对象标识符,acc精度DV和expected观察等级IV): > head(subject.accuracy, n=10) subject expected acc 1 10 none 0.97826087 2 10 high 0.55319149 3 101 none 1.00000000 4 101 high 0.68085106 5 103 none 0.97826087 6 103 high 1.00000000 7 104 none 1.00000000 8 104 high 0.08510638 9 105 none …


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.