统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
与弹性网有关的混乱
我正在阅读与弹性网有关的这篇文章。他们说他们使用弹性网,因为如果我们仅使用套索,它倾向于在高度相关的预测变量中仅选择一个预测变量。但这不是我们想要的。我的意思是,它使我们免于多重共线性的麻烦,不是吗。 有什么建议/澄清吗?



2
添加随机效应影响系数估计
我一直被教导随机效应只会影响方差(误差),而固定效应只会影响均值。但是我发现了一个例子,其中随机效应也会影响均值-系数估计: require(nlme) set.seed(128) n <- 100 k <- 5 cat <- as.factor(rep(1:k, each = n)) cat_i <- 1:k # intercept per kategorie x <- rep(1:n, k) sigma <- 0.2 alpha <- 0.001 y <- cat_i[cat] + alpha * x + rnorm(n*k, 0, sigma) plot(x, y) # simulate missing data y[c(1:(n/2), …

4
神经网络权重的收敛
我遇到一种情况,即使经过500次迭代,我的神经网络的权重仍未收敛。我的神经网络包含1个输入层,1个隐藏层和1个输出层。它们在输入层中约为230个节点,在隐藏层中约为9个节点,在输出层中约为1个输出节点。我想知道是否要尽早停止条件(例如,在100次迭代后停止神经网络训练)。这会对模型产生什么影响? 还想知道如果神经网络中的权重不收敛,行业的工作标准是什么?

2
从混合模型进行预测时,为什么难以将不确定性纳入随机效应中?
R-sig-ME上有多个线程可以获取有关使用lme4和nlme在R中进行预测的置信区间的信息。例如,在2010年的此处和此处,包括这两个软件包的作者之一Dougals Bates的一些评论。我不愿逐字逐句地引用他,因为担心他们会脱离上下文,但无论如何,他的一句话是 “您在预测中结合了参数和随机变量,我不确定评估那些预测的变异性意味着什么。贝叶斯方法可能能够理解这一点,但我无法理解。 ” https://stat.ethz.ch/pipermail/r-sig-mixed-models/2010q1/003447.html 我知道贝叶斯glmm软件包MCMCglmm可以产生可靠的预测间隔。 最近,lme4已经为github上的开发版本提供了一种predict方法,但它附带以下注释: “ @note没有选择来计算预测的标准误差,因为很难定义一种将方差参数中包含不确定性的有效方法;对于此任务,我们建议使用\ code {\ link {bootMer}}。” https://github.com/lme4/lme4/blob/master/R/predict.R 那么,为什么在频繁的情况下根据混合模型进行预测时,很难将不确定性纳入随机效应中呢?

3
应该仅对训练数据(或所有数据)执行特征选择吗?
应该仅对训练数据(或所有数据)执行特征选择吗?我经历了一些讨论和论文,例如Guyon(2003)以及Singhi and Liu(2006),但仍然不确定正确的答案。 我的实验设置如下: 数据集:50位健康对照者和50位疾病患者(cca 200功能可能与疾病预测相关)。 任务是根据可用功能诊断疾病。 我要做的是 取整个数据集并执行特征选择(FS)。我仅保留选定的功能以进行进一步处理 拆分以测试和训练,使用火车数据和所选功能进行火车分类。然后,将分类器应用于测试数据(再次仅使用所选功能)。使用留一法验证。 获得分类精度 平均:重复1)-3)N次。(100)。N=50N=50N=50 我同意在整个数据集上进行FS会带来一些偏差,但是我认为在平均过程中它被“平均”了(步骤4)。那是对的吗?(精度方差)&lt;2%&lt;2%<2\% 1 Guyon,I.(2003),“变量和特征选择简介”,《机器学习研究杂志》,第1卷。3,第1157-1182页 2 Singhi,SK和Liu,H.(2006)“用于分类学习的特征子集选择偏差”,进行ICML '06的第23届国际机器学习会议论文集,第849-856页

1
比较泛化性能的分布
假设我有两种针对分类问题的学习方法和,并且通过诸如反复交叉验证或自举之类的方法来估计它们的泛化性能。从这个过程中,我得到了在这些重复中每种方法的得分和的分布(例如,每个模型的ROC AUC值的分布)。AAABBB PAPAP_APBPBP_B 从这些分布来看,可能是 但(即的预期泛化性能高于,但是此估计存在更多不确定性)。μA≥μBμA≥μB\mu_A \ge \mu_BσA≥σBσA≥σB\sigma_A \ge \sigma_BAAABBB 我认为这称为回归中的偏差方差困境。 我可以使用哪些数学方法来比较和并最终就使用哪种模型做出明智的决定?PAPAP_APBPBP_B 注意:为简单起见,我在这里指的是两种方法和,但我对可用于比较〜1000个学习方法的分数分布(例如来自网格搜索)的方法感兴趣,并最终使关于使用哪种模型的最终决定。AAABBB

2
探索许多变量的散点图矩阵
我正在分析具有许多参数(例如50-200)的数据集,并且我对查看变量之间的关系感兴趣(例如,根据2变量散点图或2d直方图)。但是,对于这种数量的参数,绘制200x200的绘图阵列似乎是不可行的(除非我将其打印并挂在墙上)。 另一方面,仅执行相关矩阵并不能给出有关2变量关系的所有信息。 有没有一种方法(库或工作流)来探索许多变量的2变量关系? 我特别想向他人展示结果(也许经过一些数据预处理之后)。例如,在JavaScript中具有交互性的东西,可以看到相关矩阵中选定字段的散点图矩阵。 通过散点图矩阵,我的意思是这样的: (摘自pandasplotting博客;在Python / Pandas,R,D3.js等中可用)。

1
局部Moran的I统计量(LISA)的p值调整
我正在使用spdep软件包在R中进行一些探索性空间分析。 我遇到了一个选项,用于调整使用函数计算的空间关联性本地指标(LISA)的plocalmoran值。根据文档,它的目标是: ...用于多个测试的概率值调整。 在p.adjustSP我进一步阅读的文档中,可用选项包括: 调整方法包括Bonferroni校正(“ bonferroni””),其中p值乘以比较次数。Holm(1979)(“” holm“”),Hochberg(1988)('“” hochberg“'),Hommel(1988)('” hommel“')和Benjamini&Hochberg(1995)也进行了四次较不保守的校正。 ('“ fdr”')。还包括传递选项(“ none”)。 前四种方法旨在严格控制家庭错误率。似乎没有理由使用未经修改的Bonferroni校正,因为它受到Holm方法的支配,该方法在任意假设下也有效。 当假设检验是独立的或非负相关时,Hochberg和Hommel的方法是有效的(Sarkar,1998; Sarkar和Chang,1997)。Hommel的方法比Hochberg的方法更强大,但是差异通常很小,并且Hochberg p值的计算速度更快。 Benjamini,Hochberg和Yekutieli的“ BH”(又名“ fdr”)和“ BY”方法控制错误发现率,即错误发现的预期比例在被拒绝的假设中。误发现率的条件不如家庭式错误率严格,因此这些方法比其他方法更有效。 出现的几个问题: 简而言之-这项调整的目的是什么? 是否有必要使用此类更正? 如果是,如何从可用选项中进行选择?

1
是什么使霍夫丁不等式成为重要的统计概念?
拉里·瓦瑟曼(Larry Wasserman)在他的博客上发表了一篇帖子,介绍了他计划于去年秋天在课程中涵盖的内容。他指出,他正在放弃一些古典话题,而转向更现代的话题。他提到的一个话题是霍夫丁的不等式。是什么使这个结果对学生和从业者特别重要?

3
将BMI指数定义为体重/身高的统计原因是什么?
也许这个问题在医学上是有答案的,但是是否有统计上的原因将BMI指数计算为?为什么不例如仅?我的第一个想法是,它与二次回归有关。体重/身高体重/ 身高2weight/height2\text{weight}/\text{height}^2体重/ 身高weight/height\text{weight}/\text{height} 真实数据样本(200个体重,身高,年龄和性别的个体): structure(list(Age = c(18L, 21L, 17L, 20L, 19L, 53L, 27L, 22L, 19L, 27L, 19L, 20L, 19L, 20L, 42L, 17L, 23L, 20L, 20L, 19L, 20L, 19L, 19L, 18L, 19L, 15L, 19L, 15L, 19L, 21L, 60L, 19L, 17L, 23L, 60L, 33L, 24L, 19L, 19L, 22L, 20L, 21L, 19L, 19L, …


1
研究逻辑回归的稳健性,以防止违反逻辑线性
我正在执行具有二进制结果(启动和不启动)的逻辑回归。我混合的预测变量都是连续变量或二分变量。 使用Box-Tidwell方法,我的连续预测变量之一可能违反了logit线性的假设。拟合优度统计没有迹象表明拟合是有问题的。 随后,我再次运行回归模型,将原始连续变量替换为:首先是平方根变换,其次是变量的二分形式。 在检查输出时,拟合优度似乎略有提高,但残差成为问题。参数估计值,标准误差和仍然相对相似。在我的假设中,在这三个模型中,数据的解释都没有改变。exp(β)exp⁡(β)\exp(\beta) 因此,就我的结果的实用性和数据解释的意义而言,似乎应该使用原始的连续变量来报告回归模型。 我想知道这一点: Logistic回归何时能抵抗logit假设线性度的潜在违反? 鉴于我上面的示例,在模型中包括原始连续变量似乎可以接受吗? 有什么参考或指南可以推荐何时可以令人满意地接受模型对潜在的logit线性违反的鲁棒性?

1
当结果变量不是病例/对照状态时,估计病例对照设计中的逻辑回归系数
考虑通过以下方式从大小为的总体中采样数据:对于NNNk=1,...,Nk=1,...,Nk=1, ..., N 观察个体的“疾病”状态kkk 如果他们患有疾病,则以概率将其包括在样本中pk1pk1p_{k1} 如果他们没有疾病,则以概率包括他们。pk0pk0p_{k0} 假设您观察到二元结果变量和预测变量向量,对于这种方式采样的对象。结果变量不是 “疾病”状态。我想估计逻辑回归模型的参数:YiYiY_iXiXi{\bf X}_ii=1,...,ni=1,...,ni=1, ..., n log(P(Yi=1|Xi)P(Yi=0|Xi))=α+Xiβlog⁡(P(Yi=1|Xi)P(Yi=0|Xi))=α+Xiβ \log \left( \frac{ P(Y_i = 1 | {\bf X}_i) }{ P(Y_i = 0 | {\bf X}_i) } \right) = \alpha + {\bf X}_i {\boldsymbol \beta} 我只关心(对数)比值比ββ{\boldsymbol \beta}。拦截与我无关。 我的问题是:我可以通过忽略采样概率\ {p_ {i1},p_ {i0} \},i = 1,...,n并像拟合模型一样来获得ββ{\boldsymbol \beta}的合理估计这是普通的随机样本吗?{pi1,pi0}{pi1,pi0}\{ p_{i1}, p_{i0} \}i=1,...,ni=1,...,ni=1, …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.