统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
什么是前向逐步回归算法?
也许只是我很累,但是在尝试理解前向逐步回归算法时遇到了麻烦。从“统计学习要素”第60页: 前向逐步回归(FS)比前向逐步回归受到的约束更大。它像逐步回归一样开始,其截距等于y的均值,并且中心预测变量的系数最初均为0。 在每一步中,算法都会识别与当前残差最相关的变量。然后,它计算该所选变量的残差的简单线性回归系数,然后将其添加到该变量的当前系数中。一直持续到所有变量都与残差不相关为止(即,当N> p时,最小二乘拟合)。 那么,这是算法吗?: b[1]=mean(y) b[2..n]=0 r=(y-X*b) index, maxCorr = max(transpose(r)*X) while(abs(maxCorr) > someThreshold) b[index]=b[index]+regress(r,X[1..n][index]) r=(y-X*b) index, maxCorr = max(transpose(r)*X) 其中b是系数的列向量,X是输入矩阵,而y是输出的列向量。即y = X * b +错误。 询问是因为此算法仅在我正在测试的数据集中给我一些非零系数(阈值= .0001),并且预测精度根本不是很好。

1
如何最小化指数拟合的平方的剩余平方和?
我有以下数据,并希望对其采用负指数增长模型: Days <- c( 1,5,12,16,22,27,36,43) Emissions <- c( 936.76, 1458.68, 1787.23, 1840.04, 1928.97, 1963.63, 1965.37, 1985.71) plot(Days, Emissions) fit <- nls(Emissions ~ a* (1-exp(-b*Days)), start = list(a = 2000, b = 0.55)) curve((y = 1882 * (1 - exp(-0.5108*x))), from = 0, to =45, add = T, col = "green", …

2
当具有基于不同样本量的组平均值的预测变量时,该怎么办?
考虑一个经典的数据分析问题,其中您有一个结果YiYiY_{i},以及它与多个预测变量Xi1,...,XipXi1,...,XipX_{i1}, ..., X_{ip}。这里要考虑的基本应用程序类型是 YiYiY_{i}是某些团体级别的结果,例如市的犯罪率iii。 预测变量是组级别的特征,例如城市人口统计学特征iii。 基本目标是拟合回归模型(可能具有随机效应,但暂时不要考虑): E(Yi|Xi)=β0+β1Xi1+...+βpXipE(Yi|Xi)=β0+β1Xi1+...+βpXip E(Y_{i} | {\bf X}_{i} ) = \beta_0 + \beta_1 X_{i1} + ... + \beta_p X_{ip} 当一个(或多个)预测变量是每个单位样本量不同的调查结果时,是否会出现技术上的困难?例如,假设Xi1Xi1X_{i1}是城市总分,iii它是来自城市的个体样本的平均响应,iii但是这些平均值所基于的样本量却大不相同: City12345⋮Sample size2010030053⋮CitySample size120210033004553⋮⋮\begin{array}{c|c} {\rm City} & {\rm Sample \ size} \\ \hline 1 & 20 \\ 2 & 100 \\ 3 & 300 \\ 4 & 5 …

1
寻找一个使用R对二分数据(二元变量)进行因子分析的示例的步骤
我有一些二分数据,只有二进制变量,老板要求我使用四分相关矩阵进行因子分析。以前,我已经能够自学如何根据此处的示例以及UCLA的统计站点和其他类似站点进行不同的分析,但我似乎无法通过示例进行二分法因素分析使用R的数据(二进制变量)。 我确实看到了 chl对一个有点类似的问题的回答,也看到了ttnphns的回答,但是我正在寻找更详细的内容,这是我可以使用的示例的一步。 这里有人通过使用R对二进制变量进行因子分析的示例知道这一步骤吗? 更新2012-07-11 22:03:35Z 我还应该补充一点,我正在使用一个已建立的,具有三个维度的工具,我们在其中添加了一些其他问题,现在希望找到四个不同的维度。此外,我们的样本量仅为,目前我们有19个项目。我将样本量和项目数与许多心理学文章进行了比较,我们绝对处于较低端,但无论如何我们都想尝试一下。虽然,这对于我正在寻找的逐步示例和以下caracal的示例并不重要n=153n=153n=153191919看起来确实很棒。早上,我将首先使用数据来解决问题。

2
计数标准误
我有按罕见疾病季节划分的事件案例数据集。例如,假设春季有180例,夏季有90例,秋季有45例,冬季有210例。我正在努力将标准错误附加到这些数字上是否合适。就我们正在寻找将来可能再次发生的疾病发病率的季节性模式而言,研究目标具有推论性。因此,直观地感觉到应该有可能将不确定性的度量附加到总数上。但是,我不确定在这种情况下如何计算标准误,因为我们处理的是简单的计数而不是均值或比例。 最后,答案是否取决于数据代表病例总数(曾经发生过的每个病例)还是随机样本?如果我没记错的话,由于没有推断,通常用人口统计数据来表示标准错误是没有意义的。

1
从正交多项式回归中恢复原始系数和方差
看来,如果我有一个回归模型如yi∼β0+β1xi+β2x2i+β3x3iyi∼β0+β1xi+β2xi2+β3xi3y_i \sim \beta_0 + \beta_1 x_i+\beta_2 x_i^2 +\beta_3 x_i^3我可以拟合原始多项式并获得不可靠的结果,也可以拟合正交多项式并获得没有直接物理解释的系数(例如,我无法使用它们来找到原始比例上的极值位置)。似乎我应该能够同时兼顾两个方面,并且能够将拟合的正交系数及其方差转换回原始比例。我已经学习了应用线性回归的研究生课程(使用Kutner,5ed),并且浏览了Draper(3ed,由Kutner引用)中的多项式回归一章,但是没有找到有关如何执行此操作的讨论。的帮助文本poly()中的R功能没有。我也没有在网络搜索中找到任何内容,包括此处。正在从拟合正交多项式的系数中重构原始系数(并获得其方差)。 无法做,我在浪费时间。 可能是可行的,但在一般情况下还不知道怎么做。 可能但未讨论,因为“谁愿意?” 可能但由于“显而易见”而未进行讨论。 如果答案是3或4,如果有人能耐心地解释如何做到这一点或指出这样做的来源,我将不胜感激。如果是1或2,我仍然很想知道障碍是什么。非常感谢您阅读本文,如果我忽略了明显的内容,我向您致歉。

1
如何使用lmer估计具有随机效应的模型的方差成分并将其与lme结果进行比较
我进行了一项实验,从两个不同的来源人群中抚养了不同的家庭。每个家庭被分配两种治疗方法之一。实验结束后,我测量了每个人的几个特征。为了测试治疗或来源的效果以及它们之间的相互作用,我使用了以家庭为随机因素的线性混合效应模型,即 lme(fixed=Trait~Treatment*Source,random=~1|Family,method="ML") 到目前为止,到目前为止,我现在必须计算相对方差分量,即通过处理或源以及交互作用来解释的变化百分比。 没有随机效应,我可以轻松地使用平方和(SS)来计算每个因素所解释的方差。但是对于混合模型(带有ML估计),没有SS,因此我认为我也可以使用Treatment和Source作为随机效应来估计方差,即 lme(fixed=Trait~1,random=~(Treatment*Source)|Family, method="REML") 但是,在某些情况下,lme无法收敛,因此我使用了lme4软件包中的lmer: lmer(Trait~1+(Treatment*Source|Family),data=DATA) 在哪里使用摘要功能从模型中提取方差: model<-lmer(Trait~1+(Treatment*Source|Family),data=regrexpdat) results<-VarCorr(model) variances<-results[,3] 我得到与VarCorr函数相同的值。然后,我使用这些值以总和作为总变化量来计算实际的变化百分比。 我在努力挣扎的是对初始lme模型(以治疗和来源为固定效应)和随机模型以估计方差成分(以治疗和来源为随机效应)的结果的解释。我发现在大多数情况下,由每个因素解释的方差百分比与固定效应的重要性不符。 例如,对于性状HD,最初的lme暗示了相互作用的趋势以及对治疗的重要性。使用后退程序,我发现“治疗”有接近明显的趋势。但是,在估计方差成分时,我发现Source具有最高的方差,占总方差的26.7%。 LME: anova(lme(fixed=HD~as.factor(Treatment)*as.factor(Source),random=~1|as.factor(Family),method="ML",data=test),type="m") numDF denDF F-value p-value (Intercept) 1 426 0.044523 0.8330 as.factor(Treatment) 1 426 5.935189 0.0153 as.factor(Source) 1 11 0.042662 0.8401 as.factor(Treatment):as.factor(Source) 1 426 3.754112 0.0533 和lmer: summary(lmer(HD~1+(as.factor(Treatment)*as.factor(Source)|Family),data=regrexpdat)) Linear mixed model fit by REML Formula: …
14 r  anova  variance  lme4-nlme 

3
隐马尔可夫模型阈值
我已经开发出了使用mfcc和隐马尔可夫模型进行声音识别的概念验证系统。当我在已知声音上测试系统时,它会提供令人鼓舞的结果。尽管系统在输入未知声音时返回的结果具有最接近的匹配结果,并且得分的差异并不明显,但它是未知声音,例如: 我训练了3种隐藏式马尔可夫模型,一种用于讲话,一种用于从水龙头出来的水,另一种用于敲打桌子。然后,我对它们进行了看不见的数据测试,并得到以下结果: input: speech HMM\knocking: -1213.8911146444477 HMM\speech: -617.8735676792728 HMM\watertap: -1504.4735097322673 So highest score speech which is correct input: watertap HMM\knocking: -3715.7246152783955 HMM\speech: -4302.67960438553 HMM\watertap: -1965.6149147201534 So highest score watertap which is correct input: knocking HMM\filler -806.7248912250212 HMM\knocking: -756.4428782636676 HMM\speech: -1201.686687761133 HMM\watertap: -3025.181144273698 So highest score knocking which is correct input: …



1
与二进制数据相关的方差划分和纵向变化
我正在使用逻辑线性混合效应模型(随机截距)分析175所学校中300,000名学生的数据。每个学生仅出现一次,数据跨越6年。 如何以类似于VPC / ICC的方式在学校和学生之间划分差异,以获得连续的结果?我看过这篇文章,提出了4种方法,其中A和B对我来说似乎很有趣,但是我想知道使用这两种方法可能有哪些优点/缺点,当然还有其他方法可以使用它。 如何比较每年(或任何其他时间段)的学校水平残差方差?到目前为止,我是通过按年份划分数据并针对每年的数据运行模型来完成此操作的,但我认为这是有缺陷的,因为:i)没有明显的理由可以按年份进行划分;ii)由于每年的固定效应估算值是不同的,因此逐年比较随机效应可能没有意义(这是我的直觉,如果有人能够更正式地解释这一点(如果正确),那将是很好的)。 注意:我在与Whuber和Macro 进行元讨论后重新写了这个问题

1
可用于分类变量(R中)的不同编码类型是什么?何时使用它们?
如果您拟合线性模型或混合模型,则可以使用不同类型的编码将类别或名义变量转换为估计参数的多个变量,例如虚拟编码(R默认)和效果编码。 我听说在进行交互时最好使用效果编码(有时称为偏差编码或对比度编码),但是可能存在哪些对比度,何时使用哪种类型的对比度? 上下文是R中使用的混合建模lme4,但我认为可以使用更广泛的响应。抱歉,如果我错过了类似的问题。 编辑:两个有用的链接是:效果编码和伪编码说明。

3
简短文档的主题模型
受这个问题的启发,我想知道是否针对大量极短文本的主题模型进行了任何工作。我的直觉是,Twitter应该是此类模型的自然灵感。但是,通过一些有限的实验,看起来标准主题模型(LDA等)在此类数据上的表现非常差。 有没有人知道在这方面所做的任何工作?本文讨论了将LDA应用于Twitter,但是我真的很感兴趣是否还有其他算法在短文档环境中表现更好。

5
用探索性因子分析解释R和SPSS之间的差异
我是计算机科学的研究生。我一直在为一个研究项目做一些探索性因素分析。我的同事(领导项目的人)使用SPSS,而我更喜欢使用R。这没关系,直到我们发现两个统计数据包之间存在重大差异。 我们使用主轴因子分解作为提取方法(请注意,我很清楚PCA和因子分析之间的区别,并且至少没有故意地没有使用PCA)。根据我的阅读,根据R文档,这应该对应于R中的“主轴”方法,以及SPSS中的“主轴分解”或“未加权最小二乘” 。我们使用一种倾斜旋转方法(特别是promax),因为我们期望相关因子,并且正在解释模式矩阵。 在R和SPSS中运行两个过程,存在主要差异。模式矩阵给出不同的负载。尽管这给变量关系带来了几乎相同的因素,但是在相应的载荷之间存在多达0.15的差异,这似乎比仅采用不同的提取方法和promax旋转实现的预期要大。但是,这并不是最惊人的差异。 由这些因素解释的累积方差在SPSS结果中约为40%,在R结果中约为31%。这是一个巨大的差异,这导致我的同事希望使用SPSS而不是R。我对此没有问题,但是相差很大,使我认为我们可能错误地解释了某些内容,这是一个问题。 当我们进行非加权最小二乘分解时,SPSS更加令人困惑,报告了不同类型的解释方差。初始特征值解释的方差的比例为40%,而平方负荷提取和(SSL)的解释方差的比例为33%。这使我认为初始特征值不是要查看的适当数字(我怀疑这是旋转之前解释的方差,尽管它太大了,超出了我的范围)。更令人困惑的是,SPSS还显示了旋转SSL,但没有计算出解释方差的百分比(SPSS告诉我,具有相关因子意味着我无法添加SSL来找到总方差,这与我所见的数学很有意义)。来自R的报告的SSL与这些都不匹配,R告诉我它描述了总方差的31%。R的SSL与轮换SSL最接近。来自原始相关矩阵的R的特征值确实与来自SPSS的初始特征值匹配。 另外,请注意,我一直在使用不同的方法,并且SPSS的ULS和PAF似乎最接近R的PA方法。 我的具体问题: 在使用因子分析实现的R和SPSS之间,我期望有多少差异? 我应该解释SPSS的哪些平方荷载总和,初始特征值,提取或旋转? 还有其他我可能会忽略的问题吗? 我对SPSS和R的呼叫如下: SPSS: FACTOR /VARIABLES <variables> /MISSING PAIRWISE /ANALYSIS <variables> /PRINT INITIAL KMO AIC EXTRACTION ROTATION /FORMAT BLANK(.35) /CRITERIA FACTORS(6) ITERATE(25) /EXTRACTION ULS /CRITERIA ITERATE(25) /ROTATION PROMAX(4). R: library(psych) fa.results <- fa(data, nfactors=6, rotate="promax", scores=TRUE, fm="pa", oblique.scores=FALSE, max.iter=25)

2
关于逻辑回归的问题
我想运行一个二元logistic回归模型,以在10年内(1997-2006年)从一组自变量中模拟冲突(因变量)的存在与否,每年有107个观测值。我的独立人是: 土地退化(针对两种退化类型); 人口增加(0-否; 1-是); 生计类型(0-1型; 1-2-2型); 人口密度(三种密度水平); NDVI连续(最大蔬菜生产率); NDVI t − 1(比上一年的蔬菜下降-0-否; 1-是)和t−1t−1_{t-1} 和NDVI t − 2(从两年后的蔬菜开始下降-0-否; 1-是)。t−2t−2_{t-2} 我对此很陌生-这是我的讲师给我的一个项目-因此,我将感谢您的一些建议或指导。我已经测试了多大学衔。 本质上,我的数据被划分为107个观测单位(空间区域),覆盖了10年(总共1070年),对于每个观测单位,它给出的是当时该单位内独立变量条件的“快照”值(区域)。我想知道如何设置逻辑回归(或表格)以分别识别每年的107个值,以便可以评估不同单位年之间的时间NDVI变化吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.