统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
预测DNN训练的CPU和GPU内存需求
假设我有一些深度学习模型架构,以及所选的小批量大小。如何从这些数据中得出训练该模型的预期内存需求? 例如,考虑一个(非循环)模型,其输入尺寸为1000,4个完全连接的隐藏层尺寸为100,附加输出层尺寸为10。最小批量大小为256个示例。如何确定训练过程在CPU和GPU上的近似内存(RAM)占用空间?如果有什么不同,让我们假设使用TensorFlow在GPU上训练模型(因此使用cuDNN)。

1
将偏见和方差平方和的加权和最小化的估算器如何适合决策理论?
好的-我的原始讯息未能引起回应;因此,让我将问题改写为另一个。我将从决策理论的角度解释我对估计的理解。我没有经过正规的培训,如果我的想法在某种程度上有缺陷,也不会感到惊讶。 假设我们有一些损失函数。预期的损失是(频繁发生的)风险:L (θ ,θ^(x ))L(θ,θ^(x))L(\theta,\hat\theta(x)) [R (θ ,θ^(x ))= ∫L (θ ,θ^(x ))L(θ ,θ^(x ))dX ,R(θ,θ^(x))=∫L(θ,θ^(x))L(θ,θ^(x))dx,R(\theta,\hat\theta(x))=\int L(\theta,\hat\theta(x))\mathcal{L}(\theta,\hat\theta(x))dx, 其中是可能性; 贝叶斯风险是预期的常客风险:L (θ ,θ^(x ))L(θ,θ^(x))\mathcal{L}(\theta,\hat\theta(x)) r (θ ,θ^(x ))= ∫∫[R (θ ,θ^(x ))π(θ )dX dθ ,r(θ,θ^(x))=∫∫R(θ,θ^(x))π(θ)dxdθ,r(\theta,\hat\theta(x))=\int\int R(\theta,\hat\theta(x))\pi (\theta)dxd\theta, 其中是我们的先验。π(θ )π(θ)\pi (\theta) 在一般情况下,我们发现了θ(X ),最大限度地减少[R而这一切工作地非常好; 而且富比尼定理适用,我们可以反向整合的顺序,使任何给定的θ(X )最小化[R是独立于所有其他人。这样就不会违反似然性原则,并且让我们对成为贝叶斯等感到满意。θ^(x )θ^(x)\hat\theta(x)[Rrrθ^(x )θ^(x)\hat\theta(x)[Rrr 例如,给定大家熟悉的平方误差损失,我们的频率论风险是均方误差或平方偏差和方差和我们的总和贝叶斯风险是给定我们先前的即后验期望损失的期望偏差和方差的平方和。L (θ ,θ^(x ))= (θ - …

3
评估PDF估算方法的最佳方法
我希望检验一些我认为比我所见过的更好的想法。我可能是错的,但我想通过更确定的观察来检验我的想法并消除怀疑。 我一直想做的事情如下: 分析性地定义一组分布。其中一些很简单,例如高斯,统一或高帽。但是其中有些必须是困难且具有挑战性的,例如Simpsons发行。 根据这些分析分布实施软件,并使用它们生成一些样本。 由于这些分布是经过分析定义的,因此,按照定义,我已经知道它们的真实PDF。这很棒。 然后,我将针对以上示例测试以下PDF估计方法: 现有的PDF估计方法(例如具有各种内核和带宽的KDE)。 我认为值得尝试的我自己的想法。 然后,我将根据真实的PDF测量估计的误差。 然后,我将更好地了解哪种PDF估计方法是好的。 我的问题是: Q1:我上面的计划有什么改进吗? Q2:我发现很难解析地定义许多真实的PDF。是否已经有了许多分析定义的真实PDF的完整列表,这些PDF在各种困难(包括非常困难的困难)下都可以在这里重用?

3
使用外部变量预测时间序列数据
目前,我正在一个项目中进行时间序列数据(每月数据)的预测。我正在使用R进行预测。我有1个因变量(y)和3个独立变量(x1,x2,x3)。y变量具有73个观测值,其他3个变量也具有观测值(alos 73)。从2009年1月到2015年1月。我检查了相关性和p值,将其放入模型中非常重要。我的问题是:如何使用所有自变量进行良好的预测?我没有这些变量的将来值。假设我想预测两年(2017年)后我的y变量。我怎样才能做到这一点? 我尝试了以下代码: model = arima(y, order(0,2,0), xreg = externaldata) 我可以使用此代码对两年内的y值进行预测吗? 我还尝试了回归代码: reg = lm(y ~ x1 + x2 + x3) 但是如何花时间在这段代码中?我如何预测我的y值将超过2年?我是统计和预测的新手。我已经进行了一些读取并查看了滞后值,但是如何在模型中使用滞后值进行预测呢? 实际上,我的总体问题是,如何使用没有未来价值的外部变量来预测时间序列数据?

4
为什么需要梯度下降?
当我们可以区分成本函数并通过求解通过对每个参数进行偏微分而获得的方程来找到参数时,找出成本函数最小的地方。另外,我认为有可能找到导数为零的多个位置,从而我们可以检查所有这些位置并找到全局最小值 为什么要执行梯度下降呢?

4
是否有关于S形曲线的公式,其范围和范围为[0,1]
基本上,我想将相似性度量转换为用作预测变量的权重。相似之处将在[0,1]上,而我将权重也限制在[0,1]上。我想要执行此映射的参数函数,我可能会使用梯度下降对其进行优化。要求是0映射到0,1映射到1,并且严格增加。还可以理解一个简单的导数。提前致谢 编辑:感谢到目前为止的答复,这些都非常有帮助。为了使我的目的更清楚,任务是预测。我的观察结果是具有单个维度的极稀疏向量,可以对其进行预测。我的输入尺寸用于计算相似度。然后,我的预测是该预测变量的其他观察值的加权总和,其中权重是相似性的函数。为了简单起见,我将权重限制在[0,1]上。希望现在显而易见,为什么我要求0映射为0,要求1映射为1,并要求它严格增加。正如whuber指出的那样,使用f(x)= x可以满足这些要求,并且实际上效果很好。但是,它没有要优化的参数。我有很多观察,所以我可以容忍很多参数。我将手动编码梯度下降,因此我偏爱简单的导数。 例如,给出的许多响应都是关于.5对称的。使参数向左/向右移动(例如使用beta分布)会很有用

1
对数损失的直观解释
在几次kaggle比赛中,得分基于“ logloss”。这与分类错误有关。 这是一个技术性的答案,但我正在寻找一个直观的答案。我真的很喜欢答案这个有关马氏距离的问题,但PCA并不是logloss。 我可以使用分类软件提供的价值,但我不太了解。为什么用它代替真实/错误的阳性/阴性率?您能帮我,以便我可以向外婆或该领域的新手解释吗? 我也喜欢并同意以下报价: 除非您可以向祖母解释 - 否则您不会真正理解某些东西 在发布到这里之前,我尝试自行回答。 我没有发现直观或真正有用的链接包括: http://www.r-bloggers.com/making-sense-of-logarithmic-loss/ https://www.quora.com/What-is-an-intuitive-explanation-for-the-log-loss-function https://lingpipe-blog.com/2010/11/02/evaluating-with-probabilistic-truth-log-loss-vs-0-1-loss/ https://www.kaggle.com/wiki/LogarithmicLoss 这些信息丰富,准确。它们是为技术读者准备的。他们没有画简单的图画,也没有给出简单易用的例子。他们不是为我祖母写的。


1
是lm模型中的学生化残差v / s标准化残差
回归模型中的“学生残差”和“标准化残差”是否相同?我在R中建立了线性回归模型,并想绘制学生化残差v / s拟合值的图表,但没有找到在R中执行此操作的自动方法。 假设我有一个模型 library(MASS) lm.fit <- lm(Boston$medv~(Boston$lstat)) 则使用plot(lm.fit)不会提供学生化残差与拟合值的任何关系图,但会提供标准化残差与拟合值的关系图。 我用过了plot(lm.fit$fitted.values,studres(lm.fit),它将绘制出想要的图形,所以只想确认我走的路正确,并且学生化和标准化残差不是一回事。如果它们不同,则请提供一些指南以计算它们及其定义。我在网上搜索,发现它有点混乱。


2
如何从行为序列证明合作
情况:两只鸟(雄性和雌性)在巢中保护它们的卵以防入侵者入侵。每只鸟都可以使用攻击或威胁来进行保护,并且可以在场或不在场。数据显示出一种行为可能是互补的模式-男性攻击而女性使用威胁显示,反之亦然。 我的问题是:如何从统计角度证明这种合作? 还是有人知道一些进行类似分析的行为研究?我发现绝大多数的顺序分析都集中在DNA上。 在这里,我提供了一些虚拟数据,但是我的原始数据集是由数十对组成的,它们在捍卫巢穴的同时准确记录了10分钟。因此,每只鸟的行为序列长600个状态(每秒钟都有状态)。这些较短的数据应包含与整个数据集相似的模式。 male_seq <- rep(c("absent","present","attack","threat","present","attack", "threat","present","attack","absent"), times = c(3,4,8,2,6,3,2,6,2,1)) female_seq <- rep(c("absent","present","threat","present","threat","present", "threat","attack","present","threat","attack","present", "attack","threat","absent"), times = c(2,6,2,1,2,1,1,3,5,3,1,3,3,2,2))

3
如何执行非负岭回归?
如何执行非负岭回归?非负套索可在中找到scikit-learn,但对于ridge,我无法强制beta的非负性,实际上,我得到的是负系数。有人知道为什么吗? 另外,我可以按照规则的最小二乘法实施ridge吗?将此问题移至另一个问题:我可以根据OLS回归实现岭回归吗?

2
对岭回归中“矩阵求逆的数值稳定性”的清晰解释及其在减少过拟合中的作用
我知道我们可以在最小二乘回归问题中采用正则化 w∗=argminw[(y−Xw)T(y−Xw)+λ∥w∥2]w∗=argminw⁡[(y−Xw)T(y−Xw)+λ‖w‖2]\boldsymbol{w}^* = \operatorname*{argmin}_w \left[ (\mathbf y-\mathbf{Xw})^T(\boldsymbol{y}-\mathbf{Xw}) + \lambda\|\boldsymbol{w}\|^2 \right] 并且这个问题有一个封闭形式的解决方案,如: w^=(XTX+λI)−1XTy.w^=(XTX+λI)−1XTy.\hat{\boldsymbol{w}} = (\boldsymbol{X}^T\boldsymbol{X}+\lambda\boldsymbol{I})^{-1}\boldsymbol{X}^T\boldsymbol{y}. 我们看到在第二个方程中,正则化只是在\ boldsymbol {X} ^ T \ boldsymbol {X}的对角线上添加了\ lambda,这样做是为了提高矩阵求逆的数值稳定性。λλ\lambdaXTXXTX\boldsymbol{X}^T\boldsymbol{X} 我目前对数值稳定性的“粗略”理解是,如果函数变得更加“数值稳定”,则其输出受输入噪声的影响较小。我很难将提高数值稳定性的概念与如何避免/减少过度拟合的问题联系在一起。 我曾尝试查看Wikipedia和其他一些大学网站,但他们没有深入解释为什么会这样。

3
中心极限定理和帕累托分布
有人可以提供有关帕累托分布和中心极限定理之间关系的简单解释(例如,适用吗?为什么/为什么不呢?)?我试图理解以下陈述: “中心极限定理不适用于所有分布。这是由于一个偷偷摸摸的事实-样本均值聚集在基础分布的均值周围(如果存在的话)。但是分布如何没有均值呢?帕累托分布没有任何意义。如果您尝试使用通常的方法进行计算,则它会发散到无穷大。”

1
有支持SVM的应用程序吗?
SVM算法非常古老-它于1960年代开发,但是在1990年代和2000年代非常流行。它是机器学习课程的经典(而且非常漂亮)的一部分。 如今,似乎在媒体处理(图像,声音等)中,神经网络已完全占据主导地位,而在其他领域,梯度提升却占据了非常重要的位置。 另外,在最近的数据竞赛中,我没有观察到基于SVM的解决方案。 我正在寻找SVM仍能提供最新结果(截至2016年)的应用示例。 更新:我想举一些例子,在解释SVM时可以给学生/同事例如,这样它看起来不像是纯粹的理论或过时的方法。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.