2 哪些描述统计量不是效应大小? 维基百科说 效果大小是现象强度的度量或该数量的基于样本的估计。根据数据计算出的效应大小是一种描述性统计数据,用于传达关系的估计量,而无需对数据中的表观关系是否反映总体中的真实关系做出任何声明。 为了更好地理解它,我想知道除图形和曲线图外,哪些描述性统计数字不是效应大小。 12 effect-size
2 当数据具有高斯分布时,将表征多少个样本? 在一维中分布的高斯数据需要两个参数来表征(均值,方差),并且有传言说,大约30个随机选择的样本通常足以以合理的高置信度估计这些参数。但是随着尺寸数量的增加会发生什么? 在二维(例如身高,体重)中,需要5个参数来指定“最佳拟合”椭圆。在三个维度上,这增加了9个参数来描述一个椭球,而在4-D中则增加了14个参数。我想知道估计这些参数所需的样本数量是否也以可比的速度,以较慢的速度或(请!)以较高的速度增加。更好的是,如果有一条被广泛接受的经验法则,建议在给定数量的维度上需要多少个样本来表征高斯分布,那将是一个很好的认识。 更精确地说,假设我们要定义一个以“平均点”为中心的对称“最佳拟合”边界,我们可以确信其中有95%的样本将掉落。我想知道以适当的高置信度(> 95%)查找参数以近似此边界(一维的间隔,二维的椭圆等)可能需要多少个样本,以及该数量如何随置信度的变化而变化。尺寸数量增加。 12 normal-distribution multivariate-analysis
1 使用机器学习学习预测财务时间序列的第一步 我正在尝试掌握如何使用机器学习来预测未来的财务时间序列1或更多步骤。 我有一个包含描述性数据的财务时间序列,我想形成一个模型,然后使用该模型预测未来的n步。 到目前为止,我一直在做的是: getSymbols("GOOG") GOOG$sma <- SMA(Cl(GOOG)) GOOG$range <- GOOG$GOOG.High-GOOG$GOOG.Low tail(GOOG) GOOG.Open GOOG.High GOOG.Low GOOG.Close GOOG.Volume GOOG.Adjusted sma range 2013-05-07 863.01 863.87 850.67 857.23 1959000 857.23 828.214 13.20 2013-05-08 857.00 873.88 852.91 873.63 2468300 873.63 834.232 20.97 2013-05-09 870.84 879.66 868.23 871.48 2200600 871.48 840.470 11.43 2013-05-10 875.31 880.54 872.16 … 12 r time-series machine-learning random-forest finance
2 法线总和与法线立方总和之比 请帮助我找到以下项的极限分布(如): 其中是iid。n→∞n→∞n \rightarrow \inftyUn=X1+X2+…+XnX31+X32+…X3n,Un=X1+X2+…+XnX13+X23+…Xn3, U_n = \frac{X_1 + X_2 + \ldots + X_n}{X_1^3 + X_2^3 + \ldots X_n^3},XiXiX_iN(0,1)N(0,1)N(0,1) 12 distributions normal-distribution asymptotics
2 盖尔曼报告的“悖论”的名称 在安德鲁·盖尔曼(Andrew Gelman)的著作《红色州,蓝色州》中,他分析了一个事实,即特定州内的富人倾向于投票给共和党人而不是穷人,但是富裕的州倾向于投票给民主政党,而不是穷国。 这个悖论有什么名字吗? 在我看来,这与生态悖论有关,但并不完全相同。 12 paradox
2 如何在R中使用lmer()测试泊松GLMM中的过度分散? 我有以下模型: > model1<-lmer(aph.remain~sMFS1+sAG1+sSHDI1+sbare+season+crop +(1|landscape),family=poisson) ...这是摘要输出。 > summary(model1) Generalized linear mixed model fit by the Laplace approximation Formula: aph.remain ~ sMFS1 + sAG1 + sSHDI1 + sbare + season + crop + (1 | landscape) AIC BIC logLik deviance 4057 4088 -2019 4039 Random effects: Groups Name Variance Std.Dev. landscape (Intercept) … 12 r poisson-distribution lme4-nlme glmm overdispersion
2 广义线性模型中残差的预期分布是什么? 我正在执行一个广义线性模型,在该模型中,我必须指定一个与普通模型不同的族。 残差的预期分布是什么? 例如,残差是否应该正态分布? 12 generalized-linear-model residuals normality-assumption
3 朴素贝叶斯(Naive Bayes)功能概率:我应该对单词重复计数吗? 我正在为自己的Naive Bayes bag o'word模型制作原型,而我对计算特征概率有疑问。 假设我有两个类,我将只使用垃圾邮件,而不会使用垃圾邮件,因为这是每个人都使用的。让我们以“伟哥”一词为例。我的培训集中有10封电子邮件,5封垃圾邮件和5封非垃圾邮件。“ viagra”出现在所有5个垃圾邮件文档中。在其中一份培训文档中,它出现了3次(这是我的问题是关于的),因此,垃圾邮件总数达到了7次。在非垃圾邮件训练集中,它出现1次。 如果我想估计p(伟哥|垃圾邮件),是否简单: p(伟哥|垃圾邮件)= 5个包含伟哥的垃圾邮件/ 5个垃圾邮件总计= 1 换句话说,一个文件提到伟哥3次而不是一次的事实真的没有关系吗? 编辑:这是一篇博客文章,作者使用了我刚才列出的方法:http : //ebiquity.umbc.edu/blogger/2010/12/07/naive-bayes-classifier-in-50-lines/ 这是一篇博客文章,作者说:p(viagra | spam)= 7个伟哥垃圾邮件提及次数/ 8个总提及次数 http://www.nils-haldenwang.de/computer-science/machine-learning/how-to-apply朴素贝叶斯分类器到文档分类问题 然后,下面的答案之一应该是:p(viagra | spam)=垃圾邮件中提及7个伟哥/垃圾邮件中的术语总数 任何人都可以链接到对此有意见的来源吗? 12 classification conditional-probability naive-bayes
5 R中的功能选择包,可同时进行回归和分类 已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 我是R的新手。我正在学习机器学习。非常抱歉,如果这个问题看起来很基础。我试图在R中找到一个不错的功能选择包。我通过了Boruta包。这是一个很好的软件包,但我读到它仅对分类有用。 我想在R中为回归任务实现特征选择。我仔细阅读了插入符号包文档,但就我而言,这很难理解。 任何人都可以请我指向一个好的教程或在R中列出任何好的软件包或最常用的软件包进行功能选择。 任何帮助,将不胜感激。提前致谢。 12 r feature-selection
2 R中lm和aov之间报告的p值的差异 什么解释了以下aov和lm调用中p值的差异?差异仅是由于平方和的计算类型不同吗? set.seed(10) data=rnorm(12) f1=rep(c(1,2),6) f2=c(rep(1,6),rep(2,6)) summary(aov(data~f1*f2)) summary(lm(data~f1*f2))$coeff 12 r regression anova linear-model sums-of-squares
3 Mundlak固定效应程序是否适用于假人的逻辑回归? 我有一个包含8000个聚类和400万个观测值的数据集。不幸的是xtlogit,即使使用10%的子样本,我的统计软件Stata在使用其面板数据函数进行logistic回归时运行也相当缓慢。 但是,使用非面板logit功能时,结果会更快出现。因此,我可能会受益于使用logit修正后的数据来解决固定效应。 我相信该程序是“ Mundlak固定效应程序”的创造(Mundlak,Y。1978年。时间序列和横截面数据的合并。Econometrica,46(1),69-85)。 我在Antonakis,J.,Bendahan,S.,Jacquart,P.,&Lalive,R.(2010)的论文中找到了对此过程的直观解释。关于提出因果主张:审查和建议。《领导力季刊》 21(6)。1086-1120。我引用: 解决遗漏固定效应问题并仍然包含2级变量的一种方法是将所有1级协变量的聚类均值包括在估计模型中(Mundlak,1978)。聚类平均值可以作为回归变量包括在内,也可以从1级协变量中减去(即聚类平均居中)。聚类均值在聚类内是不变的(并且在聚类之间有所不同),并且允许对一级参数进行一致的估计,就像已包含固定效应一样(参见Rabe-Hesketh和Skrondal,2008年)。 因此,聚类平均居中似乎是解决我的计算问题的理想选择。但是,这些论文似乎是针对线性回归(OLS)的。 这种聚类平均居中的方法是否也适用于“复制”固定效应二进制逻辑回归? 一个更技术性的问题应该得出相同的答案:当数据集B是数据集A的均值中心版本时,数据集A是否xtlogit depvar indepvars, fe等于logit depvar indepvars数据集B? 我在这种聚类均值居中发现的另一个困难是如何应对假人。由于虚拟变量为0或1,它们在随机效应和固定效应回归中是否相同?他们不应该“居中”吗? 12 logistic categorical-data stata fixed-effects-model
2 QQ图与直方图不匹配 我有一个直方图,内核密度和拟合的正态分布的财务日志收益,它们已转换为损失(符号已更改),以及这些数据的正态QQ图: QQ图清楚地表明尾巴未正确安装。但是,如果我看一下直方图和拟合的正态分布(蓝色),即使0.0左右的值也不能正确拟合。因此,QQ图显示仅尾部未正确拟合,但显然整个分布未正确拟合。为什么这不会显示在QQ图中? 12 data-visualization normality-assumption histogram qq-plot
3 ROC曲线越过对角线 我目前正在运行一个二进制分类器。当我绘制ROC曲线时,我在开始时得到了很好的提升,然后它改变了方向并越过对角线,然后当然又向上倾斜,使该曲线呈倾斜的S形。 对此有什么解释/解释? 谢谢 12 roc