统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
两组样本量小且不平衡-该怎么办?
我有两个组的数据(即样本),我想进行比较,但是总样本量很小(n = 29)并且严重不平衡(n = 22 vs n = 7)。 这些数据在逻辑上很难收集,而且费用昂贵,因此,“收集更多数据”作为一种明显的解决方案在这种情况下并没有帮助。 测量了许多不同的变量(出发日期,到达日期,迁移时间等),因此有多个测试,其中一些差异非常大(较小的样本具有较高的差异)。 最初,一位同事对这些数据进行了t检验,其中一些在统计学上具有显着性,P <0.001,而另一个在P = 0.069上不显着。一些样本是正态分布的,而其他样本则不是。一些测试涉及与“相等”方差的较大偏差。 我有几个问题: T检验在这里合适吗?如果没有,为什么?这仅适用于满足正态性和方差相等的假设的测试吗? 什么是合适的替代品?也许是排列测试? 不相等的方差会夸大类型I的错误,但是怎么办?小而不平衡的样本量对I型错误有什么影响?


1
什么是逐点方差?
在阅读《统计学习的要素》时,我多次遇到术语“逐点方差”。虽然我对它可能意味着什么有一个模糊的想法,但我很高兴知道 如何定义? 它是如何衍生的?
10 variance 

3
直方图中的间隔数是否有上限?
我读过的书本,介绍如何选择几篇文章和摘录良好的间隔数(箱)的数据集的直方图,但我想知道如果有一个硬最高基于点的数量区间的数数据集或其他标准。 背景:我问的原因是我试图基于研究论文中的程序编写软件。该过程的第一步是从数据集中创建多个直方图,然后根据特征函数(由本文的作者定义)选择最佳分辨率。我的问题是作者没有提到要测试的间隔数的上限。(我要分析数百个数据集,每个数据集可以具有不同的“最佳”箱数。另外,选择最佳箱数也很重要,因此手动查看结果并选择一个好的箱数不会工作。) 仅仅将最大间隔数设置为数据集中的点数是一个很好的准则,还是在统计中通常使用其他标准?

2
REML vs ML stepAIC
在尝试研究如何进行混合模型分析并随后使用AIC选择最佳模型之后,我感到不知所措。我不认为我的数据那么复杂,但是我想确认自己所做的正确,然后就如何继续提供建议。我不确定我应该使用lme还是lmer,然后再使用这两个,如果我应该使用REML或ML。 我有一个选择值,我想知道哪个协变量最能影响该值并允许进行预测。这是一些组合的示例数据和我正在使用的测试代码: ID=as.character(rep(1:5,3)) season=c("s","w","w","s","s","s","s","w","w","w","s","w","s","w","w") time=c("n","d","d","n","d","d","n","n","n","n","n","n","d","d","d") repro=as.character(rep(1:3,5)) risk=runif(15, min=0, max=1.1) comp1=rnorm(15, mean = 0, sd = 1) mydata=data.frame(ID, season, time, repro, risk, comp1) c1.mod1<-lmer(comp1~1+(1|ID),REML=T,data=mydata) c1.mod2<-lmer(comp1~risk+(1|ID),REML=T,data=mydata) c1.mod3<-lmer(comp1~season+(1|ID),REML=T,data=mydata) c1.mod4<-lmer(comp1~repro+(1|ID),REML=T,data=mydata) c1.mod5<-lmer(comp1~time+(1|ID),REML=T,data=mydata) c1.mod6<-lmer(comp1~season+repro+time+(1|ID),REML=T,data=mydata) c1.mod7<-lmer(comp1~risk+season+season*time+(1|ID),REML=T,data=mydata) 我有〜19个模型,这些模型使用各种组合和最多2种交互作用项来探索此数据,但始终以ID为随机效应,而comp1为我的因变量。 Q1。使用哪个?我还是我?有关系吗? 在这两种方法中,我都可以选择使用ML或REML-并且得到了截然不同的答案-使用ML再加上AIC,我最终得到了6个具有相似AIC值的模型,并且模型组合根本没有意义,而REML导致最有可能的两个模型是最好的。但是,在运行REML时,我无法再使用方差分析。 Q2。与ANOVA一起使用,是在ML之上使用ML的主要原因是什么?我不清楚。 我仍然无法运行stepAIC,或者我不知道缩小19种模型的其他方法。 Q3。目前有没有办法使用stepAIC?

1
分类变量和连续变量之间相互作用的解释系数
我对连续变量和分类变量之间的相互作用系数的解释有疑问。这是我的模型: model_glm3=glm(cog~lg_hag+race+pdg+sex+as.factor(educa)+(lg_hag:as.factor(educa)), data=base_708) Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 21.4836 2.0698 10.380 < 2e-16 *** lg_hag 8.5691 3.7688 2.274 0.02334 * raceblack -8.4715 1.7482 -4.846 1.61e-06 *** racemexican -3.0483 1.7073 -1.785 0.07469 . racemulti/other -4.6002 2.3098 -1.992 0.04687 * pdg 2.8038 0.4268 6.570 1.10e-10 *** sexfemale 4.5691 1.1203 …

3
Winbugs和其他MCMC,无须事先分发的信息
当您不了解参数分布时会发生什么?我们应该使用什么方法? 大多数时候,我们的目标是低估某个变量是否对某个物种的存在/不存在有任何影响,并且根据变量的重要性来接受或不接受该变量。这意味着大多数时候我们不考虑参数应具有的展开分布。 当我所知道的是b1,b2,b3和b4应该在-2和2之间变化而b0可以在-5和5之间变化时,假设所有参数都遵循正态分布是正确的吗? model { # N observations for (i in 1:N) { species[i] ~ dbern(p[i]) logit(p[i]) <- b0 + b1*var1[i] + b2*var2[i] + b3*var3[i] + b4*var4[i] } # Priors b0 ~ dnorm(0,10) b1 ~ dnorm(0,10) b2 ~ dnorm(0,10) b3 ~ dnorm(0,10) b4 ~ dnorm(0,10) }
10 r  bayesian  mcmc  bugs  winbugs 

5
首先适合贝叶斯模型,然后开始削弱先验可以吗?
在进行常客统计时,一长串重大的禁忌之举,例如在决定收​​集更多数据之前先查看统计测试的结果。我通常想知道贝叶斯统计中涉及的方法是否存在类似的不行清单,尤其是以下内容是否是其中之一。 我最近意识到,对于我一直在拟合的某些模型,我的过程一直是首先将模型与信息丰富的先验条件拟合,以查看其是否起作用或爆炸,然后将先验条件削弱为缺乏信息或弱信息化,调整模型。 我这样做的动机确实与我用JAGS / Stan编写这些模型有关,在我看来,我一直将其视为编程任务,而不是统计任务。因此,我进行了首次运行,通过使用先验信息使它能够快速收敛,从而更容易发现我编写的模型中的错误。然后,在调试模型后,我用无信息或信息量较弱的先验条件对其进行了重新拟合。 我的问题是我是否在此过程中违反了一些严肃的规定。例如,为了使我的推论有效,并且避免利用研究人员的自由度,在开始拟合任何模型之前,我是否需要承诺先验先验?

2
GAM交叉验证以测试预测误差
我的问题与mgcv R软件包中的GAM有关。由于样本量较小,我想使用留一法交叉验证来确定预测误差。这合理吗?有没有包装或代码,我该怎么做?ipred软件包中的errorest()功能不起作用。一个简单的测试数据集是: library(mgcv) set.seed(0) dat <- gamSim(1,n=400,dist="normal",scale=2) b<-gam(y~s(x0)+s(x1)+s(x2)+s(x3),data=dat) summary(b) pred <- predict(b, type="response") 非常感谢您的帮助!
10 r  cross-validation  gam  mgcv 

1
使用交叉验证时计算预测间隔
是否通过以下方式计算标准差估算值: sN=1N∑Ni=1(xi−x¯¯¯)2−−−−−−−−−−−−−√.sN=1N∑i=1N(xi−x¯)2. s_N = \sqrt{\frac{1}{N} \sum_{i=1}^N (x_i - \overline{x})^2}. (http://en.wikipedia.org/wiki/Standard_deviation#Sample_standard_deviation) 从10倍交叉验证中抽取的预测准确性?我担心由于训练集之间的实质重叠(尽管预测集是独立的),因此每次折叠之间计算的预测准确性是相互依赖的。任何讨论此问题的资源都将非常有帮助。


4
并联电阻的变化
假设您有一组电阻R,所有电阻均以均值μ和方差σ分布。 考虑具有以下布局的电路的一部分:(r)|| (r + r)|| (r + r + r)。每个部分的等效电阻分别为r,2r和3r。然后每个部分的方差是σ2σ2σ^2,2σ22σ22σ^2,3σ23σ23σ^2。 整个电路的电阻变化是多少? 在对数百万个点进行采样之后,我们发现方差约为.10286σ2.10286σ2.10286\sigma^2。 我们将如何分析得出这个结论? 编辑:假设电阻值是正态分布的,具有一些平均电阻r和方差σ2σ2σ^2。

3
如何找到时间序列之间的相似性?
在以下示例中,我有一个数据框,该数据框由在海洋中5个深度处记录的水温测量值的时间序列组成,其中in的每个值Temp对应于in的日期DateTime和in 的深度Depth。 set.seed(1) Temp <- rnorm(43800,sd=20) AirT <- rnorm(8760,sd=20) Depth <- c(1:5) DateTime = seq(from=as.POSIXct("2010-01-01 00:00"), to=as.POSIXct("2010-12-31 23:00"), length=8760) Time <- as.POSIXct(DateTime, format = "%Y-%m-%d %H:%M") DatT <- data.frame(Temp) ## bind together FinalDat <- cbind(DatT, Date = rep(Time,5)) FinalDat <- cbind(FinalDat, AirT = rep(AirT, 5), Depth = rep(Depth, each = …

3
可能范围
假设三个时间序列,和X1X1X_1X2X2X_2YYY 上运行的普通线性回归〜(),我们得到。普通的线性回归〜得到。假设YYYX1X1X_1Y=bX1+b0+ϵY=bX1+b0+ϵY = b X_1 + b_0 + \epsilonR2=UR2=UR^2 = UYYYX2X2X_2R2=VR2=VR^2 = VU&lt;VU&lt;VU < V 什么是最小和最大的可能值上回归〜()?R2R2R^2YYYX1+X2X1+X2X_1 + X_2Y=b1X1+b2X2+b0+ϵY=b1X1+b2X2+b0+ϵY = b_1 X_1 + b_2 X_2 + b_0 + \epsilon 我相信最小应该是 +一个小值,因为添加新变量总是会增加,但是我不知道如何量化这个小值,也不知道如何获得最大范围。R2R2R^2VVVR2R2R^2

2
2.04标准错误的含义?当置信区间广泛重叠时,均值的显着不同吗?
下面的图片是从这篇文章中心理科学。一位同事指出了两个不寻常的事情: 根据标题,误差线显示为“±2.04标准误差,置信区间为95%”。我只见过±1.96 SE用于95%CI,而我找不到关于2.04 SE用于任何目的的任何信息。2.04 SE是否具有一些公认的含义? 案文指出,按计划进行的成对比较发现,平均惊吓幅度在误差与正确的可预测试验(t(30)= 2.51,p &lt;.01)和误差与正确的不可预测试验(t(30)= 2.61,p &lt;.01)(综合F检验在p &lt;.05时也很显着)。但是,该图显示了所有三个条件的误差线基本重叠。如果±2.04 SE间隔重叠,那么在p &lt;.05时,这些值有何显着不同?重叠部分足够大,我假设±1.96 SE间隔也重叠。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.