统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
密度函数的预测
我正在做一些有关预测概率密度函数的时间序列的研究。我们的目标是根据历史观察到的(通常是估计的)PDF来预测PDF。我们正在开发的预测方法在模拟研究中表现良好。 但是,我需要一个来自实际应用的数值示例来进一步说明我们的方法。因此,在应用程序(金融,经济学,生物学,工程学等)中是否有适当的示例,这些示例收集了PDF的时间序列,并且预测这样一个时间序列既重要又难于预测?

1
广义最小二乘:从回归系数到相关系数?
对于具有一个预测变量的最小二乘法: y=βx+ϵy=βx+ϵy = \beta x + \epsilon 如果和在拟合之前已标准化(即),则:xxxyyy∼N(0,1)∼N(0,1)\sim N(0,1) ββ\beta与皮尔逊相关系数。rrr ββ\beta在反射回归中相同:x=βy+ϵx=βy+ϵx = \beta y + \epsilon 对于广义最小二乘(GLS),是否同样适用?即,如果我将数据标准化,是否可以直接从回归系数中获得相关系数? 通过对数据的实验,反射的GLS得出不同的系数,而且我不确定我是否认为回归系数与我的相关期望值相符。我知道人们引用了GLS相关系数,所以我想知道他们是如何得出的,它们的真正含义是什么?ββ\beta

1
如何在ARIMA模型的观察值48中加入创新的离群值?
我正在处理数据集。使用一些模型识别技术后,我得出了一个ARIMA(0,2,1)模型。 我使用R detectIO包TSA中的函数在对原始数据集进行第48次观察时检测到创新的离群值(IO)。 如何将这个离群值合并到模型中,以便将其用于预测?我不想使用ARIMAX模型,因为我可能无法根据R中的模型做出任何预测。还有其他方法可以做到吗? 以下是我的价值观: VALUE <- scan() 4.6 4.5 4.4 4.5 4.4 4.6 4.7 4.6 4.7 4.7 4.7 5.0 5.0 4.9 5.1 5.0 5.4 5.6 5.8 6.1 6.1 6.5 6.8 7.3 7.8 8.3 8.7 9.0 9.4 9.5 9.5 9.6 9.8 10.0 9.9 9.9 9.8 9.8 9.9 9.9 9.6 9.4 …
10 r  time-series  arima  outliers  hypergeometric  fishers-exact  r  time-series  intraclass-correlation  r  logistic  glmm  clogit  mixed-model  spss  repeated-measures  ancova  machine-learning  python  scikit-learn  distributions  data-transformation  stochastic-processes  web  standard-deviation  r  machine-learning  spatial  similarities  spatio-temporal  binomial  sparse  poisson-process  r  regression  nonparametric  r  regression  logistic  simulation  power-analysis  r  svm  random-forest  anova  repeated-measures  manova  regression  statistical-significance  cross-validation  group-differences  model-comparison  r  spatial  model-evaluation  parallel-computing  generalized-least-squares  r  stata  fitting  mixture  hypothesis-testing  categorical-data  hypothesis-testing  anova  statistical-significance  repeated-measures  likert  wilcoxon-mann-whitney  boxplot  statistical-significance  confidence-interval  forecasting  prediction-interval  regression  categorical-data  stata  least-squares  experiment-design  skewness  reliability  cronbachs-alpha  r  regression  splines  maximum-likelihood  modeling  likelihood-ratio  profile-likelihood  nested-models 

3
如何获得总体r平方变化的置信区间
为了简单的示例,假设有两个线性回归模型 模型1有三个预测,x1a,x2b,和x2c 模型2具有从模型1 3个预测和两个附加的预测x2a和x2b 有一个种群回归方程,其中模型1 解释的种群方差为,模型解释为 。模型2解释的种群中的增量方差为ρ2(1)ρ(1)2\rho^2_{(1)}ρ2(2)ρ(2)2\rho^2_{(2)}Δ ρ2= ρ2(2 )- ρ2(1 )Δρ2=ρ(2)2−ρ(1)2\Delta\rho^2 = \rho^2_{(2)} - \rho^2_{(1)} 我有兴趣获取\ Delta \ rho ^ 2的估计量的标准误差和置信区间Δ ρ2Δρ2\Delta\rho^2。虽然该示例分别涉及3个和2个预测变量,但我的研究兴趣涉及大量不同数量的预测变量(例如5个和30个)。我首先想到的是使用 Δ [R2一dĴ= r2一dj (2 )- - [R2一dĴ (1 )Δradj2=radj(2)2−radj(1)2\Delta r^2_{adj} = r^2_{adj(2)} - r^2_{adj(1)}作为估计量并进行引导,但是我不确定是否会适当的。 问题 是Δ [R2一dĴΔradj2\Delta r^2_{adj}一个合理的估计Δ ρ2Δρ2\Delta \rho^2? 如何获得总体r平方变化的置信区间(即Δ ρ2Δρ2\Delta\rho^2)? 引导Δ ρ2Δρ2\Delta\rho^2是否适合计算置信区间? 任何对模拟或已发表文献的引用也将受到欢迎。 范例程式码 如果有帮助,我在R中创建了一个小的模拟数据集,可用于演示答案: …

1
了解混合效应模型中连续随机因素的效应
我了解分类随机效应对混合效应模型的影响,因为它在随机效应中按级别对观察结果进行了部分合并,有效地假设观察值本身不是独立的,而只是它们的部分合并。同样,据我所知,在这种模型中,观测值具有相同的随机效应水平,但固定效应水平不同,将胜过随机效应和固定效应水平不同的观测。 那么,连续随机因子的作用是什么?假设没有随机效应的模型显示固定效应的效应量为X。我是否应该期望,如果固定效应在不同级别的观察结果来自随机效应连续体的远端,则效应量将变小。一个包含随机因子的模型,而如果在不同固定因子水平上的观测值具有相似的随机效应值,则效应量会增加吗?

1
带宽是什么意思?
我在R中绘制了密度函数,并在其下绘制了带的数目。这个数字是什么意思?
10 r 


1
我对转换后的因变量进行日志记录,可以将GLM正态分布与LOG链接功能一起使用吗?
我有一个关于广义线性模型(GLM)的问题。我的因变量(DV)是连续的并且不正常。因此,我对其进行了日志转换(仍然不正常,但对其进行了改进)。 我想将DV与两个类别变量和一个连续协变量相关联。为此,我想进行GLM(我正在使用SPSS),但是我不确定如何决定要选择的分布和功能。 我已经进行了Levene的非参数检验,并且我具有方差均匀性,因此我倾向于使用正态分布。我已经读过,对于线性回归,数据不需要是正态的,残差也可以。因此,我从每个GLM分别打印了标准化的Pearson残差和线性预测变量的预测值(GLM正常标识函数和正常对数函数)。我已经进行了正态性检验(直方图和Shapiro-Wilk),并分别针对两个预测值绘制了残差与预测值(以检查随机性和方差)。来自身份函数的残差不正常,但来自对数函数的残差正常。我倾向于选择具有对数链接功能的正态,因为Pearson残差呈正态分布。 所以我的问题是: 可以对已经进行日志转换的DV使用GLM正态分布和LOG链接功能吗? 方差同质性检验是否足以证明使用正态分布是合理的? 残差检查程序是否正确以证明选择链接功能模型是正确的? 左侧是DV分布图,右侧是对数链接功能,是GLM法线的残差。

1
如何从人们感兴趣的领域的调查中解释这个PCA双线图?
背景:我询问了数百名受访者对所选区域的兴趣(按李克特五分制,其中1分表示“不感兴趣”,5分表示“感兴趣”)。 然后我尝试了PCA。下图是前两个主要组成部分的投影。颜色用于性别,PCA箭头是原始变量(即兴趣)。 我注意到: 点(受访者)被第二部分很好地分开了。 没有左箭头。 有些箭比其他箭短得多。 变量趋向于形成集群,而不是观察值。 看来,指向男性的向下箭头主要是男性的利益,指向上方的箭头主要是女性的利益。 一些箭头既不指向下方也不指向上方。 问题:如何正确解释点(受访者),颜色(性别)和箭头(变量)之间的关系?从这个情节中可以得出关于受访者及其兴趣的其他结论吗? 数据可以在这里找到。

2
如何计算Kullback-Leibler的散度/距离?
我有三个数据集X,Y和Z。每个数据集定义事件发生的频率。例如: 数据集X:E1:4,E2:0,E3:10,E4:5,E5:0,E6:0等等。 数据集Y:E1:2,E2:3,E3:7,E4: 6,E5:0,E6:0等。 数据集Z:E1:0,E2:4,E3:8,E4:4,E5:1,E6:0等。 我必须找到X和Y之间的KL散度;在X和Z之间。如您所见,对于某些事件,将有0和非零值。对于某些事件,所有三个数据集均为0。 如果有人可以帮助我找到KL的分歧,我将不胜感激。我不是统计学家,所以我没有太多想法。就我的理解而言,我在网上查看的教程过于复杂。

1
使用openMx在相同和异卵双胞胎的SEM概念模型中选择路径权重
我正在审查R包OpenMx进行遗传流行病学分析,以了解如何指定和拟合SEM模型。我对此很陌生,所以请多多包涵。我正在遵循《OpenMx用户指南》第59页上的示例。他们在这里绘制以下概念模型: 在指定路径时,他们将潜在的“一个”节点对显示的bmi节点“ T1”和“ T2”的权重设置为0.6,因为: 感兴趣的主要路径是从每个潜在变量到相应观察变量的路径。还估算了这些值(因此将它们全部设置为空),获得的起始值为0.6,并带有适当的标签。 # path coefficients for twin 1 mxPath( from=c("A1","C1","E1"), to="bmi1", arrows=1, free=TRUE, values=0.6, label=c("a","c","e") ), # path coefficients for twin 2 mxPath( from=c("A2","C2","E2"), to="bmi2", arrows=1, free=TRUE, values=0.6, label=c("a","c","e") ), 的0.6的值来自的估计的协方差bmi1和bmi2(严格的单合子双胞胎)。我有两个问题: 当他们说路径的“开始”值为0.6时,是否像在估计GLM时那样设置具有初始值的数值积分例程? 为什么严格根据单卵双胞胎估算这个值?

1
如何在R中的重复测量方差分析中编写误差项:误差(主题)vs误差(主题/时间)
我的问题与先前的帖子非常相关,该帖子 在R中的重复度量ANOVA中指定Error()项。但是,我想对如何定义错误项有更多的了解。 假设我有一个双向重复方差分析,组效应之间的因素是治疗(对照组与安慰剂),而时间是组内效应的4倍以上(T1〜T4)。患者ID被记录为“主题”。在这里,我从http://gjkerns.github.io/R/2012/01/20/power-sample-size.html中的教程示例中借用了数据, 因此数据看起来像这样 Time Subject Method NDI 0min 1 Treat 51.01078 15min 1 Treat 47.12314 48hrs 1 Treat 26.63542 96hrs 1 Treat 20.78196 0min 2 Treat 42.61345 15min 2 Treat 32.77171 要应用方差分析: aovComp <- aov(NDI ~ Time*Method + Error(Subject/Time), theData) summary(aovComp) Error: Subject Df Sum Sq Mean Sq F …

1
是否有效果大小的一般定义?
该effect-size标签没有维基。关于效果大小的维基百科页面没有提供精确的一般定义。而且我还没有看到效果大小的一般定义。然而读了一些讨论,比如当这一个我的印象是人们心目中的影响大小的一般概念下,在统计检验的情况下。我已经看到的标准化平均被称为影响大小用于正常模型Ñ(μ ,σ 2),以及标准平均差θ = (θ=μ/σθ=μ/σ\theta=\mu/\sigmaN(μ,σ2)N(μ,σ2){\cal N}(\mu,\sigma^2)为“两个高斯手段”的模式。但是一般的定义呢?上面两个示例共有的有趣特性是,据我所知, 功率仅取决于 θ的参数,并且是 |的递增函数。θ | 当我们考虑用于通常测试 ħ 0:{ μ = 0 }在所述第一壳体和 ħ 0:{ μ 1 = μ 2 }在第二种情况下。 θ=(μ1−μ2)/σθ=(μ1−μ2)/σ\theta=(\mu_1-\mu_2)/\sigmaθθ\theta|θ||θ||\theta|H0:{μ=0}H0:{μ=0}H_0:\{\mu=0\}H0:{μ1=μ2}H0:{μ1=μ2}H_0:\{\mu_1=\mu_2\} 这个属性是效应大小概念背后的基本思想吗?那将意味着效果大小被定义为单调一对一转换?还是有一个更精确的一般定义?

2
几种逻辑回归与多项式回归
是否可以执行几个二进制逻辑回归而不是多项式回归?从这个问题出发:多项式逻辑回归与一对多对数逻辑回归我看到该多项式回归可能具有较低的标准误差。 但是,我想使用的软件包尚未推广到多项式回归(ncvreg:http : //cran.r-project.org/web/packages/ncvreg/ncvreg.pdf),所以我想知道是否可以简单地做而是几个二进制逻辑回归。

1
线性回归的因变量是比率
我正在进行线性回归,其中因变量的比率范围为0.01到100。 是否可以对因变量和对数进行对数取对数?我正在匹配一项研究的结果,这就是他们所做的。 取对数与按原样使用比率有什么区别?
10 regression 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.