统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
在CNN中,升采样和转置卷积是否相同?
当您进行“反卷积”时,会同时使用“上采样”和“转置卷积”(<-不是一个好术语,但让我在这里使用它)。最初,我以为它们的意思是相同的,但是在我阅读这些文章后,在我看来它们是不同的。有人可以澄清一下吗? 转置卷积:当我们通过卷积神经网络传播损失时,似乎可以使用它。 http://andrew.gibiansky.com/blog/machine-learning/convolutional-neural-networks/#Backward-Propagation https://github.com/vdumoulin/conv_arithmetic https://arxiv.org/pdf/1312.6034v2.pdf,第4节“用于卷积层...” 升采样:想要在convnet-decovnet结构中从较小的输入到较大的输入进行升采样时,似乎可以使用它。 https://www.youtube.com/watch?v=ByjaPdWXKJ4&feature=youtu.be&t=22m


1
在深度学习中的深度残差网络中,残差学习块到底是什么?
我正在阅读论文《深度残差学习以进行图像识别》,但我很难100%地确定残差块在计算上的含义。阅读他们的论文,他们有图2: 它说明了残余块应该是什么。残差块的计算是否与以下内容完全相同: y=σ(W2σ(W1x+b1)+b2+x)y=σ(W2σ(W1x+b1)+b2+x) \mathbf{y} = \sigma( W_2 \sigma( W_1 \mathbf{x} + b_1 ) + b_2 + \mathbf{x} ) 或者是别的什么? 换句话说,也许是试图与论文的符号相匹配的是: F(x)+x=[W2σ(W1x+b1)+b2]+xF(x)+x=[W2σ(W1x+b1)+b2]+x \mathcal F(x) + x = \left[ W_2 \sigma( W_1 \mathbf{x} + b_1 ) + b_2 \right] + \mathbf{x} 真的吗? yy\mathbf{y} σ(F(x)+x)=σ([W2σ(W1x+b1)+b2]+x)σ(F(x)+x)=σ([W2σ(W1x+b1)+b2]+x) \sigma( \mathcal F(x) + x ) = \sigma( …

3
如何在R中使用betareg函数实现混合模型?
我有一个数据集,其中包含一些比例,这些比例用于测量个体t的“活动水平”,因此使值介于0和1之间。该数据是通过计算个体在特定时间间隔内移动的次数(移动为1, 0(表示不移动),然后取平均值以为每个人创建一个值。我的主要固定效果是“密度水平”。 我面临的问题是,我有一个因子变量“ pond”,我想将其作为随机效应包括在内-我不在乎池塘之间的差异,但希望从统计角度考虑它们。关于池塘的重要一点是,我只有3个,而且我了解在处理随机效应时理想的是具有更多的因子水平(5+)。 如果可能的话,我希望获得一些有关如何使用R betareg()或betamix()在R中实现混合模型的建议。我已经阅读了R帮助文件,但是我通常很难理解它们(每个参数在上下文中的真正含义是什么)我自己的数据以及输出值对生态意义的含义),因此我倾向于通过示例更好地工作。 在相关的说明中,我想知道是否可以代替使用glm()二项式族和logit链接来解决此类数据的随机影响。

1
PCA和TruncatedSVD的scikit-learn实现之间的区别
我了解主成分分析和奇异值分解在代数/精确水平之间的关系。我的问题是关于scikit-learn的实现。 该文档说:“ [TruncatedSVD]与PCA非常相似,但是直接对样本矢量进行运算,而不是对协方差矩阵进行运算。 ”,这将反映两种方法之间的代数差异。但是,后来又说:“ 此估算器[TruncatedSVD]支持两种算法:快速随机SVD求解器,和“天真”算法,该算法使用ARPACK作为(X * XT)或(XT * X)上的特征求解器,高效。关于PCA,它表示:“使用数据的奇异值分解来投影以减少线性维数……”。PCA实施支持相同的两种算法(随机和ARPACK)求解器以及另一种算法LAPACK。查看代码,我可以看到PCA和TruncatedSVD中的ARPACK和LAPACK都对样本数据X进行了svd,ARPACK能够处理稀疏矩阵(使用svds)。 因此,除了具有不同的属性和方法之外,PCA还可以使用LAPACK进行精确的全奇异值分解,PCA和TruncatedSVD scikit-learn实现似乎是完全相同的算法。第一个问题:这是正确的吗? 第二个问题:即使LAPACK和ARPACK使用scipy.linalg.svd(X)和scipy.linalg.svds(X)作为X样本矩阵,它们也会计算或X的奇异值分解或特征分解∗ X T内部。虽然“随机化”的求解器不需要计算乘积。(这与数值稳定性有关,请参阅为什么通过数据的SVD对数据进行PCA?)。这个对吗?XT∗XXT∗XX^T*XX∗XTX∗XTX*X^T 相关代码:PCA行415。截断SVD行137。
12 pca  scikit-learn  svd  scipy 

2
统计数据的图形直观
在这篇文章中,您可以阅读以下声明: 模型通常由有限维流形上的点表示。θθ\theta 在迈克尔·K·默里和约翰·赖斯的《微分几何与统计》中,这些概念以散文可读的方式进行了解释,甚至忽略了数学表达式。不幸的是,很少有插图。MathOverflow上的帖子也是如此。 我想寻求视觉表示的帮助,以作为对主题进行更正式理解的地图或动机。 歧管上有什么要点?此在线查找中的引号似乎表明它可以是数据点,也可以是分布参数: 流形和信息几何的统计是差分几何满足统计的两种不同方式。在流形统计中,数据位于流形上,而在信息几何中,数据位于RnRnR^n,但是将感兴趣的概率密度函数的参数化族视为流形。这样的流形被称为统计流形。 我画这个图由切空间的这种解释的启发在这里: [ 编辑以反映以下有关的评论:C∞C∞C^\infty ]在流形,切线空间是与相关的点上所有可能的导数(“速度”)的集合。流经的流形上的所有可能曲线这可以看作是从每条曲线穿过一组映射即定义为组成,用表示曲线(从实线到歧管表面的函数(M)(M)(\mathcal M)p∈Mp∈Mp\in \mathcal M(ψ:R→M)(ψ:R→M)(\psi: \mathbb R \to \mathcal M)p.p.p.p,p,p,C∞(t)→R,C∞(t)→R,C^\infty (t)\to \mathbb R,(f∘ψ)′(t)(f∘ψ)′(t)\left(f \circ \psi \right )'(t)ψψ\psiMM\mathcal M)穿过点并在上图中以红色表示;和表示一个测试功能。“ iso- ”白色轮廓线映射到实线上的同一点,并围绕点。p,p,p,˚F pf,f,f,fffppp 等价(或施加到统计等价中的一个)进行了讨论这里,和将涉及以下引用: 如果指数族的参数空间包含维开放集,则称其为满秩。sss 不是满秩的指数族通常被称为弯曲指数族,因为通常参数空间是维度小于的曲线小号。RsRs\mathcal R^ss.s.s. 这似乎使得对图的解释如下:分布参数(在这种情况下是指数分布族)位于流形上。在秩不足的非线性优化问题的情况下,的数据点将通过函数映射到流形上的一条线。这将与物理学中的速度计算并行:沿着“ iso-f”线的梯度寻找函数的导数(橙色的方向导数):函数将起到优化分布参数选择的作用,如曲线 ψ :- [R → 中号 ˚F (˚F ○ ψ ) '(吨)。˚F :中号 → [R ψ …

2
掷硬币时的Beta分布
克鲁施克(Kruschke)的贝叶斯书说,关于使用Beta分布来掷硬币, 例如,如果除了硬币没有正面和反面的知识之外,我们没有其他先验知识,那等于先前观察到一个头和一条尾巴对应于a = 1和b = 1。 为什么没有信息等于看到一头一尾-0头和0尾对我来说似乎更自然。

2
在二进制分类问题中优化auc vs logloss
我正在执行二进制分类任务,其中结果概率相当低(大约3%)。我正在尝试决定是否通过AUC或对数损失进行优化。据我所知,AUC最大化了模型区分类别的能力,而对数损失则惩罚了实际概率与估计概率之间的差异。在我的任务中,校准精度非常重要。所以我会选择logloss,但是我想知道最好的log-loss模型是否也应该是最好的AUC / GINI模型。

3
现实生活中“非参数统计模型”的例子是什么?
我在这里阅读有关统计模型的Wikipedia文章,并且对“非参数统计模型”的含义有些困惑,尤其是: 如果参数集 是无限维,则统计模型是非参数模型。如果统计模型同时具有有限维和无限维参数,则它是半参数的。形式上,如果是的维数,并且是样本数,则半参数模型和非参数模型都将设为。如果 为,则模型是半参数的;否则,模型是非参数的。d Θ Ñ d → ∞ Ñ → ∞ d / Ñ → 0 Ñ → ∞ΘΘ\ThetadddΘΘ\Thetannnd→∞d→∞d \rightarrow \inftyn→∞n→∞n \rightarrow \inftyd/n→0d/n→0d/n \rightarrow 0n→∞n→∞n \rightarrow \infty 我得到的是,如果模型的维(即我的意思是参数的数量)是有限的,那么这就是参数化模型。 对我而言,没有意义的是如何拥有一个统计模型,该模型具有无限数量的参数,因此我们可以称其为“非参数”。此外,即使是这种情况,如果实际上有无数个维数,为什么还要“非”数呢?最后,由于我是从机器学习的背景出发的,所以这种“非参数统计模型”与“非参数机器学习模型”之间有什么区别吗?最后,这种“非参数无限维模型”的一些具体例子是什么?

2
将Pearson相关系数作为机器学习中的优化目标
在机器学习中(针对回归问题),我经常看到均方误差(MSE)或均方绝对误差(MAE)被用作最小化(加上正则化项)的误差函数。我想知道是否存在使用相关系数更合适的情况?如果存在这种情况,则: 与MSE / MAE相比,在什么情况下相关系数是更好的指标? 在这些情况下,MSE / MAE还是可以使用的良好代理费用功能吗? 直接使相关系数最大化是可能的吗?这是一个稳定的目标函数吗? 我找不到在优化中直接将相关系数用作目标函数的情况。如果有人可以向我介绍该领域的信息,我将不胜感激。

1
LASSO回归系数的解释
我目前正在为具有约300个变量和800个观察值的数据集构建二进制结果的预测模型。我已经在该站点上阅读了很多有关逐步回归相关问题以及为什么不使用它的知识。 我一直在阅读LASSO回归及其功能选择功能,并已成功使用“插入符号”包和“ glmnet”实现了它。 我能够提取与优化模型的系数lambda,并alpha从“插入符号”; 但是,我不熟悉如何解释系数。 LASSO系数的解释方法是否与逻辑回归相同? 在逻辑回归中使用从LASSO中选择的特征是否合适? 编辑 系数的解释(如LASSO回归的指数系数一样)是系数保持1个单位变化时的对数赔率,同时保持所有其他系数不变。 https://stats.idre.ucla.edu/other/mult-pkg/faq/general/faq-how-do-i-interpreting-odds-ratios-in-logistic-regression/

2
交叉熵损失函数的不同定义
我从使用Neuronetworksanddeeplearning点com教程开始学习神经网络。特别是在第三章中,有一节关于交叉熵函数,并将交叉熵损失定义为: C= - 1ñ∑X∑Ĵ(yĴln一种大号Ĵ+ (1 − yĴ)ln(1 − a大号Ĵ))C=-1个ñ∑X∑Ĵ(ÿĴln⁡一种Ĵ大号+(1个-ÿĴ)ln⁡(1个-一种Ĵ大号))C = -\frac{1}{n} \sum\limits_x \sum\limits_j (y_j \ln a^L_j + (1-y_j) \ln (1 - a^L_j)) 但是,阅读Tensorflow简介后,交叉熵损失定义为: C= - 1ñ∑X∑Ĵ(yĴln一种大号Ĵ)C=-1个ñ∑X∑Ĵ(ÿĴln⁡一种Ĵ大号)C = -\frac{1}{n} \sum\limits_x \sum\limits_j (y_j \ln a^L_j)(使用与上面相同的符号时) 然后四处搜寻以查找发生了什么事情,我发现了另一组注释:(https://cs231n.github.io/linear-classify/#softmax-classifier),它使用了完全不同的交叉熵损失定义,尽管这时间用于softmax分类器,而不是神经网络。 有人可以告诉我这是怎么回事吗?为什么会有差异。人们将交叉熵损失定义为什么?是否有一些总体原则?

1
何时使用指数平滑vs ARIMA?
最近,我在工作时进行一些月度预测并阅读Rob Hyndman的书时一直在刷新我的预测知识,但我苦苦挣扎的一个地方是何时使用指数平滑模型与ARIMA模型。根据经验,应该使用一种方法还是另一种方法? 另外,由于您无法使用AIC进行比较,因此您只需要按RMSE,MAE等进行比较? 目前,我只是每个都建立一些并比较错误度量,但是我不确定是否有更好的方法。

2
两个协方差矩阵的和和乘积也是协方差矩阵吗?
假设我有协方差矩阵和。那么,这些选项中的哪一个也是协方差矩阵?ÿXXXYYY X+YX+YX+Y X2X2X^2 XYXYXY 我很难理解要成为协方差矩阵的确切条件。我想这意味着,例如,如果和,则对于1成立,我们应该具有该,其中和是其他一些随机变量。但是,我不明白为什么这对于三个选项都适用。任何见解将不胜感激。Y = cov (Y 1,Y 2)cov (X 1,X 2)+ cov (Y 1,Y 2)= cov (Z 1,Z 2)Z 1 Z 2X=cov(X1,X2)X=cov⁡(X1,X2)X=\operatorname{cov}(X_1,X_2)Y=cov(Y1,Y2)Y=cov⁡(Y1,Y2)Y=\operatorname{cov}(Y_1,Y_2)cov(X1,X2)+cov(Y1,Y2)=cov(Z1,Z2)cov⁡(X1,X2)+cov⁡(Y1,Y2)=cov⁡(Z1,Z2)\operatorname{cov}(X_1,X_2) + \operatorname{cov}(Y_1,Y_2) = \operatorname{cov}(Z_1, Z_2)Z1Z1Z_1Z2Z2Z_2

2
我们可以使用比原始样本小的引导样本吗?
我想使用自举来估计N = 250个公司和T = 50个月的面板数据集中的估计参数的置信区间。由于使用卡尔曼滤波和复杂的非线性估计,参数的估计在计算上是昂贵的(几天的计算)。因此,即使是自举的基本方法,也无法从原始样本中抽取(替换)B(成百上千个)M = N = 250个公司的B个样本并估计参数B次是不可行的。 因此,我正在考虑对引导程序样本使用较小的M(例如10)(而不是N = 250的完整大小),并通过从原始公司替换而随机抽取,然后使用缩放模型参数的引导程序估计协方差矩阵(在上面的示例中为1/25)来计算在完整样本上估算的模型参数的协方差矩阵。1个ñ中号1NM\frac{1}{\frac{N}{M}} 然后,可以基于正态假设或基于经验的估计置信区间,对于较小的样本,可以使用类似的程序进行缩放(例如,缩小。1个ñ中号√1NM\frac{1}{\sqrt{\frac{N}{M}}} 这种解决方法有意义吗?有理论结果证明这一点吗?还有其他解决方案吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.