统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


3
考试成绩真的遵循正态分布吗?
我一直在尝试了解要在GLM中使用哪些发行版,而在何时使用正态发行版时我有些糊涂。在我的教科书的一部分中,它说正态分布可能对建模考试成绩很有利。在下一部分中,它询问对汽车保险索赔进行建模的哪种分布是合适的。这次,它说适当的分布将是Gamma或反高斯分布,因为它们仅以正值连续。好吧,我相信考试成绩也只会是正数,而是连续的,那为什么我们要在那使用正态分布呢?正态分布是否允许负值?

5
混合效应模型:比较分组变量各个级别的随机方差分量
假设我有参与者,每个参与者给出响应20次,一种情况为10次,另一种情况为10次。我拟合了一个线性混合效应模型,比较了每种情况下的这是一个可重现的示例,使用中的包来模拟这种情况:ÿ ÿñNNÿYYÿYYlme4R library(lme4) fml <- "~ condition + (condition | participant_id)" d <- expand.grid(participant_id=1:40, trial_num=1:10) d <- rbind(cbind(d, condition="control"), cbind(d, condition="experimental")) set.seed(23432) d <- cbind(d, simulate(formula(fml), newparams=list(beta=c(0, .5), theta=c(.5, 0, 0), sigma=1), family=gaussian, newdata=d)) m <- lmer(paste("sim_1 ", fml), data=d) summary(m) 该模型m产生两个固定效应(条件的截距和斜率)和三个随机效应(参与者的随机截距,条件的参与者随机斜率和截距-斜率相关性)。 我想在统计上比较由定义的各组参与者的随机截距方差的大小condition(即,在对照和实验条件下分别计算以红色突出显示的方差分量,然后测试各分量的大小是否存在差异不为零)。我将如何做(最好在R中)? 奖金 假设该模型稍微复杂一些:参与者各自经历10次刺激,每次20次,一种情况发生10次,另一种情况发生10次。因此,有两组交叉的随机效应:参与者的随机效应和刺激的随机效应。这是一个可重现的示例: library(lme4) fml <- "~ condition …


3
超参数调整:随机搜索与贝叶斯优化
因此,我们知道随机搜索比网格搜索更好,但是最近的方法是贝叶斯优化(使用高斯过程)。我查找了两者之间的比较,却一无所获。我知道,在斯坦福大学的cs231n中,他们只提及随机搜索,但是他们可能想使事情保持简单。 我的问题是:哪种方法通常更好,并且如果答案是“有时是随机搜索,有时是贝叶斯方法”,那么我何时应该优先使用一种方法呢?

1
插入符glmnet与cv.glmnet
在glmnet内部caret使用搜索最佳lambda和cv.glmnet执行相同任务的比较中似乎有很多困惑。 提出了许多问题,例如: 分类模型train.glmnet与cv.glmnet? 在插入符号中使用glmnet的正确方法是什么? 使用`caret`交叉验证`glmnet` 但是没有给出答案,这可能是由于问题的可重复性。在第一个问题之后,我给出了一个非常相似的示例,但确实存在相同的问题:为什么估计的lambda如此不同? library(caret) library(glmnet) set.seed(849) training <- twoClassSim(50, linearVars = 2) set.seed(849) testing <- twoClassSim(500, linearVars = 2) trainX <- training[, -ncol(training)] testX <- testing[, -ncol(testing)] trainY <- training$Class # Using glmnet to directly perform CV set.seed(849) cvob1=cv.glmnet(x=as.matrix(trainX),y=trainY,family="binomial",alpha=1, type.measure="auc", nfolds = 3,lambda = seq(0.001,0.1,by = 0.001),standardize=FALSE) …


1
Logistic回归中有无截距模型之间的区别
我想了解逻辑回归中有或没有拦截模型之间的区别 它们之间有什么区别,除了截距系数是相对于基线组的对数(奇数比),无截距系数是相对的(logs)奇数?从我看到的情况来看,两种情况下的系数都相同,但是重要性并不总是相同,并且不明白为什么会这样。此外,在哪些情况下使用无截距的模型是否正确? 这是我的模型:glm(NeverReturn ~ factor(Network) * TotalPrice , family = binomial)而且我不确定是否要保留拦截,因为在“实词”上,总价格无论如何都不能低于50,但是概率是1而不是0,所以我很困惑。

3
线性回归F统计量,R平方和残差标准误差告诉我们什么?
我对以下术语的线性回归上下文的意义差异感到非常困惑: F统计 R平方 残留标准误差 我找到了这个网站,这使我对线性回归中涉及的不同术语有了深刻的了解,但是,据我所知,上述术语看起来非常相似。我会引用我读到的东西和让我感到困惑的东西: 残差标准误差是线性回归拟合的质量的度量.......残差标准误差是响应(dist)偏离真实回归线的平均值。 1.因此,实际上这是观测值与lm线的平均距离吗? R平方统计量可用来衡量模型对实际数据的拟合程度。 2.现在我很困惑,因为如果RSE告诉我们观察点与回归线有多远,则低RSE实际上告诉我们“您的模型基于观察到的数据点非常合适”->因此,我们的模型有多好模型适合,那么R平方和RSE有什么区别? F统计量可以很好地指示我们的预测变量与响应变量之间是否存在关系。 3.的确,我们可以有一个F值来表示非线性的强关系,因此我们的RSE高而我们的R平方很低

1
二项式随机变量的预测区间
二项式随机变量的预测间隔的公式(近似或精确)是什么? 假设ÿ〜乙我Ñ ø 米(Ñ ,p )Y∼Binom(n,p)Y \sim \mathsf{Binom}(n, p),和我们观察ÿyy(从绘制ÿYY)。该ñnn是已知的。 我们的目标是从获得新抽签的95%预测间隔ÿYY。 点估计是ñ p^np^n\hat{p},其中p = ÿp^= yñp^=yn\hat{p}=\frac{y}{n}。对于A置信区间 p是直截了当的,但我不能找到针对预测时间间隔的公式ÿ。如果我们知道p(而不是 p ),那么95%的预测区间只是涉及寻找一个二项式的位数。有什么明显的我可以忽略的吗?p^p^\hat{p}ÿYYpppp^p^\hat{p}

3
为什么/应该为政治(例如盖洛普)进行统计抽样?
与人口规模相比,在那里进行的民意测验(例如盖洛普)抽样的人数极少(例如,亿万人口中有千人)。 现在,对我而言,当您有充分理由相信样本可以代表人口(或类似地,代表其他样本)时,对人口进行抽样作为估算人口统计数据的一种方法就很有意义。 例如,采样显然对医学研究有意义,因为我们先验地知道人类都有非常相似的基因组,并且这个因素使他们的身体表现出相似的行为。 注意这不是某种松散的耦合-基因组是一个非常强大的决定性因素。 但是,我只是不明白使用低样本量进行政治民意测验的理由。 我可以买到在任何给定社区中大约80-90%的人都为总统投票(由于相似的社会经济/教育背景),但是这似乎不足以证明如此少的样本数是合理的。从字面上看,没有(至少对我而言)没有令人信服的理由,为什么有1000个随机选民的举止应该像其他2亿选民的举止一样。 对我来说,您至少需要(例如)该金额的100倍。为什么?我可以想到很多原因,例如: 仅加利福尼亚州就有约22,000个专用区。人们在经济和教育背景上成长的差异如此之大,以至于规模为1000的民意调查似乎很小。您如何平均用不到1个人来概括整个区域? 人们通常无法改变其身体对医学的反应,但是他们可以仅通过思考就改变对政治的看法。我的看法是,与政治打交道时,没有像医学中的DNA那样的强迫因素。在最好的我想像应该有相关的小口袋。 但是无论如何,这样的民意调查似乎仍然有效?或者至少人们似乎认为他们这样做? 但是为什么要这样呢?也许我只是根本不了解采样?有人可以解释吗? 我只是不能认真对待我所看到的任何民意调查,但我觉得我或多或少地独自一人。

2
自动编码器神经网络的起源是什么?
我在Google,Wikipedia,Google Scholar等上进行了搜索,但找不到Autoencoders的来源。也许这是一个逐渐发展的概念,不可能追溯到一个清晰的起点,但是我仍然想对它们的主要发展步骤进行一些总结。 Ian Goodfellow,Yoshua Bengio和Aaron Courville的深度学习书中有关自动编码器的章节说: 几十年来,自动编码器的思想已成为神经网络历史的一部分(LeCun,1987; Bourlard和Kamp,1988; Hinton和Zemel,1994)。传统上,自动编码器用于降维或特征学习。 此演示文稿由帕斯卡尔·文森特说: 实际上,使用经典自动编码器进行降噪的方法要早得多(LeCun,1987; Gallinari等,1987),作为Hopfield网络的替代方法(Hopfield,1982)。 这似乎暗示“经典自动编码器”在此之前存在:LeCun和Gallinari使用了它们,但并未发明它们。1987年之前,我看不到“经典自动编码器”的踪迹。 有任何想法吗?

2
Benjamini-Hochberg调整后的p值的公式是什么?
我了解该程序及其控制的内容。那么在BH程序中用于多次比较的调整后的p值的公式是什么? 刚才我意识到原始的BH不会产生调整后的p值,只是调整了(非)拒绝条件:https : //www.jstor.org/stable/2346101。无论如何,戈登·史密斯(Gordon Smyth)还是在2002年引入了调整后的BH p值,因此该问题仍然适用。p.adjust与method 一样在R中实现BH。

4
机器学习算法的预测间隔
我想知道以下所述的过程是否有效/可以接受,并且有任何合理的理由。 想法:监督学习算法不假设数据的基础结构/分布。最终,他们输出点估计。我希望以某种方式量化估计的不确定性。现在,ML模型的建立过程本质上是随机的(例如,在用于超参数调整的交叉验证的采样中以及在随机GBM中的子采样中),因此建模管道将为每个具有不同种子的相同预测变量提供不同的输出。我的想法(天真)是一遍又一遍地运行此过程以得出预测的分布,我希望可以对预测的不确定性做出陈述。 如果重要的话,我使用的数据集通常很小(约200行)。 这有意义吗? 需要说明的是,我实际上并没有按照传统意义引导数据(即,我没有对数据进行重新采样)。每次迭代都使用相同的数据集,我只是利用xval和随机GBM中的随机性。

2
do(x)运算符的含义?
在关于因果关系的一些文献评论中,我到处都可以看到运算符(例如,参见此Wikipedia条目)。但是,我找不到该运算符的正式定义。do (x )do(x)do(x) 有人可以为此指出我一个很好的参考吗?我对一般定义感兴趣,而不是对特定实验中的解释感兴趣。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.