4 如果神经网络中的每个神经元基本上都是逻辑回归函数,那么为什么多层更好? 我将浏览Cousera的DeepAI课程(第3周视频1“神经网络概述”),Andrew Ng解释了神经网络中的每一层如何只是另一种逻辑回归,但他没有解释如何使事情变得更加准确。 那么在2层网络中,如何多次计算logistic使其更准确? 13 logistic neural-networks
1 为什么朴素贝叶斯分类器最适合0-1损失? 朴素贝叶斯分类器是基于最大化类成员资格的后验P (C | x )将项分配给类C的分类器,并假定项的特征是独立的。xxxCCCP(C|x)P(C|x)P(C|x) 0-1损失是指将任何未分类归类为“ 1”的损失,并将任何正确分类为“ 0”的损失。 我经常读(1),“朴素贝叶斯”分类器对于0-1损失是最佳的。为什么会这样呢? (1)一个示例性来源:贝叶斯分类器和贝叶斯误差 13 machine-learning bayesian optimization naive-bayes loss-functions
1 为什么在实践中不使用“无马鞍牛顿”下降算法? 最近,我读了Yann Dauphin等人的论文。识别和解决高维非凸优化中的鞍点问题,他们引入了一种有趣的下降算法,称为“无鞍牛顿”,该算法似乎是专门为神经网络优化设计的,因此不会卡在鞍点上像香草SGD这样的一阶方法。 该论文的历史可以追溯到2014年,因此并不是什么新鲜事物,但是,我还没有看到它被“野外使用”。为什么不使用此方法?对于现实世界中存在的问题/网络,Hessian计算是否过于严格?该算法是否甚至有一些开源实现,可能与某些主要的深度学习框架一起使用? 2019年2月更新:现在有一个实现:https : //github.com/dave-fernandes/SaddleFreeOptimizer) 13 optimization deep-learning gradient-descent
1 刚刚确定的2SLS中位数是无偏的吗? 在《最无害的计量经济学:经验主义者的同伴》中(Angrist and Pischke,2009:第209页),我读到以下内容: (...)实际上,刚刚确定的2SLS(即简单的Wald估计量)几乎是无偏的。这很难正式显示,因为刚刚确定的2SLS没有任何时刻(即,采样分布有粗尾)。但是,即使仪器较弱,刚刚确定的2SLS也会大致居中。因此,我们说刚刚确定的2SLS是中值无偏的。(...) 虽然作者说是刚刚确定的2SLS是中位数,不带偏见,他们既没有证实,也没有提供一个参考的证据。他们在第213页再次提到了该命题,但没有提及证明。另外,我在麻省理工学院第22页的关于工具变量的讲义中找不到提出这一主张的动机。 原因可能是该提议是错误的,因为他们在博客的注释中拒绝了该提议。但是,他们写道,刚刚确定的2SLS 近似为中值。他们使用一个小型的蒙特卡洛实验来激发这一点,但没有提供分析证明或与近似值相关的误差项的封闭式表达。无论如何,这是作者对密歇根州立大学教授Gary Solon的答复,他评论说刚刚确定的2SLS 并非中性的。 问题1:如何证明刚刚确定的2SLS 并不像Gary Solon所说的那样是中性的? 问题2:如Angrist和Pischke所论,您如何证明刚刚确定的2SLS 近似中值无偏? 对于问题1,我正在寻找一个反例。对于问题2,我(主要)是在寻找证明或参考证明。 在这种情况下,我也在寻找中值无偏差的正式定义。我理解这个概念如下:估计器θ(X 1 :Ñ)的θ基于某些设定的X 1 :ñ的Ñ随机变量是中值无偏为θ当且仅当的分布θ(X 1 :n)具有中值θ。θ^(X1:n)θ^(X1:n)\hat{\theta}(X_{1:n})θθ\thetaX1:nX1:nX_{1:n}nnnθθ\thetaθ^(X1:n)θ^(X1:n)\hat{\theta}(X_{1:n})θθ\theta 笔记 在刚刚确定的模型中,内生回归变量的数量等于工具数量。 {YX=Xβ+Wγ+u=Zδ+Wζ+v(1)(1){Y=Xβ+Wγ+uX=Zδ+Wζ+v\begin{cases} Y&=X\beta+W\gamma+u \\ X&=Z\delta+W\zeta+v \end{cases}\tag{1}XXXk×n+1k×n+1k\times n+1kkkk×n+1k×n+1k\times n+1ZZZWWWuuuvvv ββ\beta(1)(1)(1)XXXZZZWWWX^X^\hat{X}YYYX^X^\hat{X}WWWX^X^\hat{X}ββ\beta yi=α+βxi+uiyi=α+βxi+uiy_i=\alpha+\beta x_i+u_ixixix_iziziz_iββ\betaβ^2SLS=sZYsZX,(2)(2)β^2SLS=sZYsZX,\hat{\beta}^{\text{2SLS}}=\frac{s_{ZY}}{s_{ZX}}\tag{2},sABsABs_{AB}AAABBB(2)(2)(2)β^2SLS=∑i(yi−y¯)zi∑i(xi−x¯)zi=β+∑i(ui−u¯)zi∑i(xi−x¯)zi(3)(3)β^2SLS=∑i(yi−y¯)zi∑i(xi−x¯)zi=β+∑i(ui−u¯)zi∑i(xi−x¯)zi\hat{\beta}^{\text{2SLS}}=\frac{\sum_i(y_i-\bar{y})z_i}{\sum_i(x_i-\bar{x})z_i}=\beta+\frac{\sum_i(u_i-\bar{u})z_i}{\sum_i(x_i-\bar{x})z_i}\tag{3}y¯=∑iyi/ny¯=∑iyi/n\bar{y}=\sum_iy_i/nx¯=∑ixi/nx¯=∑ixi/n\bar{x}=\sum_i x_i/nu¯=∑iui/nu¯=∑iui/n\bar{u}=\sum_i u_i/nnnn 我进行了文献搜索,使用“正当识别”和“中位数无偏”一词来查找回答问题1和2的参考文献(请参见上文)。我什么都没找到。我发现(见下文)的所有文章都提到Angrist和Pischke(2009:第209、213页)时指出刚确定的2SLS是中值无偏的。 Jakiela,P.,Miguel,E.,&Te Velde,VL(2015)。您已经赢得了它:估算人力资本对社会偏好的影响。实验经济学,18(3),385-407。 An,W.(2015年)。工具变量估计社交网络中的对等效应。社会科学研究,50,382-394。 Vermeulen,W.和Van Ommeren,J.(2009)。土地利用规划会影响区域经济吗?同时分析了荷兰的住房供应,内部移民和当地就业增长。住房经济学杂志,18(4),294-310。 Aidt,TS,&Leon,G.(2016年)。民主的机会之窗:撒哈拉以南非洲骚乱的证据。冲突解决杂志,60(4),694-717。 13 regression self-study multiple-regression econometrics instrumental-variables
2 在任何情况下都应使用逐步回归? 过去,逐步回归在许多生物医学论文中已被过度使用,但是随着对其许多问题的更好的教育,这种逐步改善的趋势似乎正在改善。但是,许多较老的审阅者仍然要求它。在什么情况下逐步回归会起作用,应该使用逐步回归(如果有)吗? 13 regression multiple-regression feature-selection model-selection stepwise-regression
1 即使模型不正确,MLE估计也渐近正常且有效吗? 前提:这可能是一个愚蠢的问题。我只知道有关MLE渐近性质的陈述,但我从未研究过证明。如果我这样做了,也许我不会问这些问题,或者我可能会意识到这些问题没有道理...所以请对我轻松一点:) 我经常看到这样的说法:模型参数的MLE估计量渐近是正常且有效的。该声明通常写为 ñ→∞θ^→dN(θ0,I(θ0)−1)θ^→dN(θ0,I(θ0)−1)\hat{\theta}\xrightarrow[]{d}\mathcal{N}(\theta_0,\mathbf{I}(\theta_0)^{-1})为N→∞N→∞N\to\infty 其中是样本数,是Fisher信息,是参数(向量)true值。现在,由于引用了真实模型,这是否意味着如果模型不真实,结果将不成立吗?我θ 0NNNII\mathbf{I}θ0θ0\theta_0 示例:假设我将风力涡轮机功率输出建模 为风速与加性高斯噪声的函数VPPPVVV P=β0+β1V+β2V2+ϵP=β0+β1V+β2V2+ϵP=\beta_0+\beta_1V+\beta_2V^2+\epsilon 我知道这个模式是错误的,至少有两个方面的原因:1)是真的成正比的第三电源和2)错误不是添加剂,因为我忽略未与风速不相关的其他预测(我也知道该应该是0,因为在0风速不发电,但在这里这是不相关)。现在,假设我有一个来自风力涡轮机的功率和风速数据的无限数据库。我可以画任意数量的任意大小的样本。假设我绘制了1000个样本,每个样本的大小为100,并计算\ hat {\ boldsymbol {\ beta}} _ {100},\ boldsymbol {\ beta} =(\ beta_0,\ beta_1,\ beta_2)的MLE估计V β 0PPPVVVβ0β0\beta_0β^100β^100\hat{\boldsymbol{\beta}}_{100}β=(β0,β1,β2)β=(β0,β1,β2)\boldsymbol{\beta}=(\beta_0,\beta_1,\beta_2)(在我的模型下,这只是OLS的估算值)。因此,我从\ hat {\ boldsymbol {\ beta}} _ {100}的分布中获得了1000个样本β^100β^100\hat{\boldsymbol{\beta}}_{100}。我可以用N = 500,1000,1500,\ dots重复练习N=500,1000,1500,…N=500,1000,1500,…N=500,1000,1500,\dots。由于N→∞N→∞N\to\infty,\ hat {\ boldsymbol {\ beta}} _ {N}的分布是否应β^Nβ^N\hat{\boldsymbol{\beta}}_{N}趋于渐近正态分布,且具有均值和方差?还是模型不正确的事实会使该结果无效? 我问的原因是,很少(如果有的话)模型在应用程序中是“真实的”。如果在模型不正确时失去MLE的渐近特性,则可能有必要使用不同的估计原理,虽然在模型正确的情况下其功能不那么强大,但在其他情况下可能会比MLE更好。 编辑:在评论中指出,真实模型的概念可能有问题。我想到了以下定义:给定一个模型族由参数矢量,对于该族中的每个模型,您始终可以编写 fθ(x)fθ(x)f_{\boldsymbol{\theta}}(x)θθ\boldsymbol{\theta} Y=fθ(X)+ϵY=fθ(X)+ϵY=f_{\boldsymbol{\theta}}(X)+\epsilon 只需将定义为。但是,通常该误差不会与正交,平均值为0,并且不一定会在模型推导中具有假定的分布。如果存在一个,使得具有这两个属性以及假定的分布,我会说该模型是正确的。我认为这与说直接相关,因为分解中的误差项ϵϵ\epsilonY−fθ(X)Y−fθ(X)Y-f_{\boldsymbol{\theta}}(X)XXXθ0θ0\boldsymbol{\theta_0}ϵϵ\epsilonfθ0(X)=E[Y|X]fθ0(X)=E[Y|X]f_{\boldsymbol{\theta_0}}(X)=E[Y|X] Y=E[Y|X]+ϵY=E[Y|X]+ϵY=E[Y|X]+\epsilon 具有上述两个属性。 13 maximum-likelihood model asymptotics
1 岭回归的AIC:自由度与参数数量 我想计算岭回归模型的AICc。问题是参数的数量。对于线性回归,大多数人建议参数的数量等于估计系数的数量加上sigma(误差的方差)。 当涉及到岭回归时,我读到帽子矩阵的迹线(自由度(df))仅用作AIC公式中的参数项数(例如,此处或此处)。 它是否正确?我还可以简单地使用df来计算AICc吗?我可以简单地将+1添加到df中以解决误差差异吗? 13 regression aic ridge-regression degrees-of-freedom
1 如何找到95%的可信区间? 我正在尝试计算以下后验分布的95%可信区间。我找不到R中的函数,但是下面的方法正确吗? x <- seq(0.4,12,0.4) px <- c(0,0, 0, 0, 0, 0, 0.0002, 0.0037, 0.018, 0.06, 0.22 ,0.43, 0.64,0.7579, 0.7870, 0.72, 0.555, 0.37, 0.24, 0.11, 0.07, 0.02, 0.009, 0.005, 0.0001, 0,0.0002, 0, 0, 0) plot(x,px, type="l") mm <- sum(x*px)/sum(px) var <- (sum((x)^2*px)/sum(px)) - (mm^2) cat("95% credible interval: ", round(mm -1.96*sqrt(var),3), "-", … 13 bayesian descriptive-statistics credible-interval
1 您可以简单地对IRLS方法进行直观的解释,以找到GLM的MLE吗? 背景: 我正在尝试遵循普林斯顿对GLM的MLE估计的评论。 我明白MLE估计的基础:likelihood,score,观察和期望Fisher information与Fisher scoring技术。而且我知道如何用MLE估计来证明简单的线性回归。 问题: 我什至不了解这种方法的第一行:( 工作变量定义为以下内容的直觉是什么:ž一世ziz_i ž一世= η^一世+ (y一世- μ^一世)dη一世dμ一世zi=η^i+(yi−μ^i)dηidμi z_i = \hat\eta_i + (y_i -\hat\mu_i)\frac{d\eta_i}{d\mu_i} 为什么用它们代替来估计β?ÿ一世yiy_iββ\beta 它们与的关系response/link function是和μ之间的关系ηη\etaμμ\mu 如果有人有一个简单的解释,或者可以指导我获得更基本的说明,我将不胜感激。 13 regression generalized-linear-model maximum-likelihood link-function irls
1 如何在AIC的基础上比较模型? 我们有两个模型使用相同的方法来计算对数似然,并且一个模型的AIC低于另一个模型。但是,AIC较低的人很难解释。 我们在确定是否值得介绍难度时遇到了麻烦,我们使用AIC中的百分比差异来进行判断。我们发现两个AIC之间的差异仅为0.7%,而更复杂的模型的AIC降低了0.7%。 两者之间的低百分比差异是避免使用AIC较低的模型的充分理由吗? 差异百分比是否说明在较简单的模型中丢失了0.7%的信息? 两种模型的结果能否完全不同? 13 model-selection aic
1 为什么ecdf使用阶跃函数而不是线性插值? 经验CDF函数通常由阶跃函数估算。是否有理由这样做而不是使用线性插值?阶跃函数是否具有使我们更喜欢它的任何有趣的理论特性? 这是两个的示例: ecdf2 <- function (x) { x <- sort(x) n <- length(x) if (n < 1) stop("'x' must have 1 or more non-missing values") vals <- unique(x) rval <- approxfun(vals, cumsum(tabulate(match(x, vals)))/n, method = "linear", yleft = 0, yright = 1, f = 0, ties = "ordered") class(rval) <- … 13 r distributions ecdf
1 GBM软件包与使用GBM的插入符 我一直在使用进行模型调整caret,但随后使用该gbm软件包重新运行模型。据我了解,caret程序包使用gbm的输出应相同。然而,data(iris)使用RMSE和R ^ 2作为评估指标,使用进行的快速测试显示模型中的差异约为5%。我想使用来找到最佳模型性能,caret但要重新运行gbm以利用部分依赖图。下面的代码具有可重复性。 我的问题是: 1)为什么即使这两个软件包应该相同,我仍会看到这两个软件包之间的差异(我知道它们是随机的,但5%的差异还是很大的,尤其是当我没有使用iris建模时使用的很好的数据集时) 。 2)同时使用这两个软件包有什么优点或缺点? 3)不相关:使用iris数据集时,最佳interaction.depth值为5,但高于我所阅读的最大值,使用最大值floor(sqrt(ncol(iris)))为2。这是严格的经验法则还是非常灵活? library(caret) library(gbm) library(hydroGOF) library(Metrics) data(iris) # Using caret caretGrid <- expand.grid(interaction.depth=c(1, 3, 5), n.trees = (0:50)*50, shrinkage=c(0.01, 0.001), n.minobsinnode=10) metric <- "RMSE" trainControl <- trainControl(method="cv", number=10) set.seed(99) gbm.caret <- train(Sepal.Length ~ ., data=iris, distribution="gaussian", method="gbm", trControl=trainControl, verbose=FALSE, tuneGrid=caretGrid, metric=metric, bag.fraction=0.75) print(gbm.caret) # … 13 r caret gbm matrix linear-algebra logistic modeling logit ordered-logit r confidence-interval survival population weibull classification separation hypothesis-testing correlation statistical-significance p-value python r data-visualization r regression multiple-regression chi-squared multivariate-analysis distributions random-variable experiment-design distributions poisson-regression residuals excel time-series garch var survival modeling cox-model interaction r pca normality-assumption
2 协方差函数或内核-它们到底是什么? 我对高斯过程领域及其在机器学习中的应用方式还很陌生。我一直在阅读和听到协方差函数是这些方法的主要吸引力。那么,谁能以直观的方式解释这些协方差函数中发生了什么呢? 否则,如果您可以指出特定的教程或说明它们的文档。 13 machine-learning probability bayesian
2 为什么对于逻辑回归,P> 0.5临界值不是“最佳”的? 前言:我不在乎是否使用截止值的优点,也不在乎应该如何选择截止值。我的问题纯属数学,是出于好奇。 Logistic回归模型对A类与B类的后验条件概率进行建模,并且它拟合后验条件概率相等的超平面。因此,从理论上讲,我知道0.5的分类点将最大程度地减少总误差,而与集合平衡无关,因为它对后验概率建模(假设您始终遇到相同的分类比率)。 在我的实际示例中,使用P> 0.5作为分类截止值时,我获得的准确性非常差(约51%的准确性)。但是,当我查看AUC时,它高于0.99。因此,我查看了一些不同的临界值,发现P> 0.6的准确度为98%(较小类别的准确度为90%,较大类别的准确度为99%)-仅2%的案例被错误分类。 这些类严重不平衡(1:9),这是一个高维问题。但是,我将类平均分配给每个交叉验证集,这样模型拟合和预测之间的类平衡之间就不会有差异。我还尝试使用来自模型拟合和预测的相同数据,并且发生了相同的问题。 我对0.5不能使误差最小化的原因感兴趣,我认为如果通过最小化交叉熵损失来拟合模型,这将是设计使然。 是否有人对为什么会发生有任何反馈?是由于增加了处罚,如果可以的话,有人可以解释发生了什么吗? 13 logistic predictive-models unbalanced-classes