统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
ETS()函数,如何避免与历史数据不一致的预测?
我正在研究R中的alogorithm,以使每月预测计算自动化。除其他外,我正在使用预报包中的ets()函数来计算预报。运行良好。 不幸的是,对于某些特定的时间序列,我得到的结果很奇怪。 请在下面找到我正在使用的代码: train_ts<- ts(values, frequency=12) fit2<-ets(train_ts, model="ZZZ", damped=TRUE, alpha=NULL, beta=NULL, gamma=NULL, phi=NULL, additive.only=FALSE, lambda=TRUE, lower=c(0.0001,0.0001,0.0001,0.8),upper=c(0.9999,0.9999,0.9999,0.98), opt.crit=c("lik","amse","mse","sigma","mae"), nmse=3, bounds=c("both","usual","admissible"), ic=c("aicc","aic","bic"), restrict=TRUE) ets <- forecast(fit2,h=forecasthorizon,method ='ets') 请在下面的相关历史数据集下面找到: values <- c(27, 27, 7, 24, 39, 40, 24, 45, 36, 37, 31, 47, 16, 24, 6, 21, 35, 36, 21, 40, 32, 33, …

3
神经网络中的tanh与乙状结肠
对于我仍在加快步伐这一事实,我预先表示歉意。我试图了解使用tanh(映射-1到1)与sigmoid(映射0到1)进行神经元激活功能的优缺点。从我的阅读来看,这听起来像是一件微不足道的事情。在实践中,针对我的问题,我发现S型曲线更容易训练,而且奇怪的是,S型曲线似乎可以更好地找到一般的解决方案。我的意思是,当完成了S型曲线的训练后,它在参考(未经训练)的数据集上表现良好,而tanh版本似乎能够在训练数据上获得正确的答案,而对参考的表现却很差。这是针对相同的网络体系结构。 我的直觉是,使用乙状结肠,神经元几乎完全关闭更容易,因此不为后续层提供任何输入。tanh在这里比较困难,因为它需要完全取消其输入,否则它总是为下一层提供一个值。也许这种直觉是错误的。 长帖子。底线是什么,这应该有很大的不同吗?

1
多元高斯数据的PCA分量在统计上是否独立吗?
如果我们的数据是多元正态分布的,PCA成分(在主成分分析中)是否在统计上独立?如果是这样,如何证明/证明这一点? 我之所以问是因为我看到了这篇文章,其中最高答案指出: PCA没有做出明确的高斯假设。它找到使数据中解释的方差最大化的特征向量。主成分的正交性意味着它找到了最不相关的成分来解释尽可能多的数据变化。对于多元高斯分布,组件之间的零相关性意味着独立性,这对于大多数分布而言并非如此。 给出的答案没有证据,并且似乎暗示如果数据是多元正态的,则PCA会产生独立的分量。 具体来说,假设我们的数据来自以下示例: x∼N(μ,Σ)x∼N(μ,Σ)\mathbf{x} \sim \mathcal N(\mathbf{\mu}, \mathbf{\Sigma}) 我们将个样本放入样本矩阵,因此为。计算的SVD (居中后)得出nnnxx\mathbf{x}XX\mathbf{X}XX\mathbf{X}n×mn×mn \times mXX\mathbf{X} X=USVTX=USVT\mathbf{X} = \mathbf{USV}^{T} 我们可以说的列在统计上是独立的,还是的行在统计上是独立的吗?通常,仅对,还是根本不正确?UU\mathbf{U}VTVT\mathbf{V}^Tx∼N(μ,Σ)x∼N(μ,Σ)\mathbf{x} \sim \mathcal N(\mathbf{\mu}, \mathbf{\Sigma})
16 pca  independence  svd 



2
为什么要使用“随机”置信度或可信区间?
我最近正在阅读一篇论文,该论文将随机性纳入其置信度和可信区间中,我想知道这是否是标准的(如果是标准的话,为什么这样做是合理的)。为了设置符号,假设我们的数据是并且我们有兴趣为参数创建间隔。我习惯于通过构建函数来构建置信度/可信度区间:θ ∈ ΘX ∈ XX∈Xx \in Xθ ∈ Θθ∈Θ\theta \in \Theta FX:Θ →交通{ 0 ,1 }FX:Θ→{0,1个}f_{x} : \Theta \rightarrow \{0,1\} 并让我们的间隔为。一世= { θ ∈ Θ:FX(θ )= 1 }一世={θ∈Θ:FX(θ)=1个}I = \{ \theta \in \Theta \, : \, f_{x}(\theta) = 1\} 从某种意义上说,这是随机的,它取决于数据,但条件是它只是一个间隔。相反,本文定义 GX:Θ →交通[ 0 ,1 ]GX:Θ→[0,1个]g_{x} : \Theta \rightarrow [0,1] 以及上的iid统一随机变量的集合。它定义关联的间隔为。请注意,除了数据之外,这很大程度上取决于辅助随机性。 …

2
对于哪种分布,有一个标准差的封闭形式的无偏估计量?
对于正态分布,存在以下标准偏差的无偏估计量: σ^无偏见的= Γ (n − 12)Γ (n2)1个2∑k = 1ñ(x一世− x¯)2------------√σ^unbiased=Γ(n−12)Γ(n2)12∑k=1n(xi−x¯)2\hat{\sigma}_\text{unbiased} = \frac{\Gamma(\frac{n-1}{2})}{\Gamma(\frac{n}{2})} \sqrt{\frac{1}{2}\sum_{k=1}^n(x_i-\bar{x})^2} 这个结果之所以不太为人所知的原因似乎是,它很大程度上是一个古玩,而不是任何重要的事项。证明覆盖在这个线程上 ; 它利用了正态分布的关键属性: 1个σ2∑k = 1ñ(x一世− x¯)2〜χ2n − 11σ2∑k=1n(xi−x¯)2∼χn−12 \frac{1}{\sigma^2} \sum_{k=1}^n(x_i-\bar{x})^2 \sim \chi^{2}_{n-1} 从那里开始,只需做一些工作,就可以期望,并通过将此答案识别为的倍数,我们可以得出。σ σ无偏E (∑ñk = 1(x一世− x¯)2------------√)E(∑k=1n(xi−x¯)2)\mathbb{E}\left( \sqrt{\sum_{k=1}^n(x_i-\bar{x})^2} \right)σσ\sigmaσ^无偏见的σ^unbiased\hat{\sigma}_\text{unbiased} 这让我很好奇,哪些其他分布具有标准差的闭合形式的无偏估计量。与方差的无偏估计器不同,这显然是特定于分布的。此外,要适应证明以找到其他分布的估计量,并非易事。 偏态正态分布的二次形式具有良好的分布特性,我们使用的正态分布特性实际上是一种特殊情况(因为正态是偏态正态的一种特殊类型),因此也许很难将此方法扩展到他们。但是对于其他分配,似乎需要一种完全不同的方法。 是否存在其他已知此类估计量的分布?

2
一个具有极高可能性的真正简单模型的例子将是什么?
近似贝叶斯计算是一种非常酷的技术,适用于基本上所有随机模型,适用于似然性难以解决的模型(例如,如果您固定了参数但无法通过数值,算法或分析方法来计算似然性,则可以从模型中进行采样)。当向观众介绍近似贝叶斯计算(ABC)时,最好使用一些示例模型,该模型非常简单,但仍然有些有趣,并且具有难以克服的可能性。 一个非常简单的模型仍然有难以解决的可能性,这将是一个很好的例子吗?

1
在什么条件下,岭回归能够比普通最小二乘回归有所改善?
岭回归估计参数ββ\boldsymbol \beta中的线性模型y=Xβy=Xβ\mathbf y = \mathbf X \boldsymbol \beta通过β^λ=(X⊤X+λI)−1X⊤y,β^λ=(X⊤X+λI)−1X⊤y,\hat{\boldsymbol \beta}_\lambda = (\mathbf X^\top \mathbf X + \lambda \mathbf I)^{-1} \mathbf X^\top \mathbf y,其中λλ\lambda是正则化参数。众所周知,当有许多相关的预测变量时,它的性能通常优于OLS回归(λ=0λ=0\lambda=0)。 岭回归的存在定理说,总是存在一个参数λ∗>0λ∗>0\lambda^* > 0,使得β^λβ^λ\hat{\boldsymbol \beta}_\lambda均方误差严格小于OLS的均方误差估算β^OLS=β^0β^OLS=β^0\hat{\boldsymbol \beta}_\mathrm{OLS}=\hat{\boldsymbol \beta}_0。换句话说,\ lambda的最佳值λλ\lambda始终为非零。这显然是在1970年的Hoerl和Kennard中首先得到证实的,并且在我在网上找到的许多讲义中都重复了这一点(例如,在这里和在这里)。我的问题是关于该定理的假设: 是否有关于协方差矩阵\ mathbf X ^ \ top \ mathbf X的假设X⊤XX⊤X\mathbf X^\top \mathbf X? 是否有关于\ mathbf X的维数的假设XX\mathbf X? 尤其是,如果预测变量正交(即X⊤XX⊤X\mathbf X^\top \mathbf X是对角线),或者即使\ mathbf …

2
如何进行探索性数据分析以选择合适的机器学习算法
我们正在通过“机器学习:概率论”(Kevin Murphy)研究机器学习。虽然文字解释了每种算法的理论基础,但很少说明哪种情况下哪种算法更好,什么时候做的更好,却没有说明如何判断我所处的情况。 例如,对于内核的选择,有人告诉我进行探索性数据分析以评估数据的复杂程度。在简单的二维数据中,我可以绘图并查看线性或径向核是否合适。但是在更高维度上做什么? 更一般地说,人们在选择算法之前说“开始了解您的数据”是什么意思?现在,我只能区分分类算法与回归算法,以及线性算法与非线性算法(我无法检查)。 编辑:即使我最初的问题是关于普遍的经验法则,我被要求提供有关我的特定问题的更多信息。 数据:每行一个国家/地区月的面板(总计约30,000行,涵盖约15年中的165个国家/地区)。 回应:5个感兴趣的二元变量(例如,该月是否发生抗议/政变/危机等)。 特征:〜400个变量(连续,类别和二进制的混合),详细说明了前两个国家/地区的月份的特征(可以创建更长的滞后时间)。我们只使用滞后变量,因为目标是预测。 例子包括汇率,GDP增长(连续),新闻自由水平(绝对),民主,邻国是否存在冲突(二元)。请注意,这400个功能中有很多是滞后变量。

3
卷积神经网络中的卷积步骤做什么?
由于它们在计算机视觉中的应用,我正在研究卷积神经网络(CNN)。我已经熟悉标准的前馈神经网络,所以我希望这里的某些人可以帮助我在理解CNN方面采取额外的步骤。我对CNN的看法如下: 在传统的前馈神经网络中,我们拥有训练数据,其中每个元素都包含一个特征向量,该特征向量在“输入层”中输入到神经网络,因此在图像识别中,我们可以将每个像素作为一个输入。这些是我们的特征向量。或者,我们可以手动创建其他(可能较小)的特征向量。 CNN的优势在于它可以生成更强大的特征向量,这些特征向量对于图像失真和位置更加不变。如下图所示(来自本教程),CNN生成特征图,然后将其输入到标准神经网络中(因此,这实际上是一个巨大的预处理步骤)。 我们获得这些“更好”特征的方法是通过交替进行卷积和子采样。我了解子采样的工作原理。对于每个特征图,只取像素的一个子集,否则我们可以对像素值求平均值。 但是我主要困惑的是卷积步骤是如何工作的。我很熟悉概率论中的卷积(两个随机变量之和的密度),但是它们在CNN中如何工作,为什么有效? 我的问题与此类似,但是特别是,我不确定为什么第一步卷积有效。

2
为什么将标准偏差定义为方差的平方根而不是N的平方和的平方根?
今天我教了一门统计学入门课,一个学生问我一个问题,在这里我改写为:“为什么标准偏差定义为方差的平方根而不是N的平方和的平方根?” 我们定义总体方差:σ2=1N∑(xi−μ)2σ2=1N∑(xi−μ)2\sigma^2=\frac{1}{N}\sum{(x_i-\mu)^2} 和标准差:。σ=σ2−−√=1N√∑(xi−μ)2−−−−−−−−−−√σ=σ2=1N∑(xi−μ)2\sigma=\sqrt{\sigma^2}=\frac{1}{\sqrt{N}}\sqrt{\sum{(x_i-\mu)^2}} 我们可能对的解释是,它给出了总体中单位与的总体平均值的平均偏差。σσ\sigmaXXX 但是,在sd的定义中,我们将平方和的平方根除以。学生提出的问题是,为什么我们不划分平方庙的开方代替。因此,我们得出了竞争公式:学生认为,这种公式看起来更像由平均通过时分割比一个“平均”偏差如在。N−−√N\sqrt{N}NNNσnew=1N∑(xi−μ)2−−−−−−−−−−√.σnew=1N∑(xi−μ)2.\sigma_{new}=\frac{1}{N}\sqrt{\sum{(x_i-\mu)^2}}.N−−√N\sqrt{N}σσ\sigma 我认为这个问题并不愚蠢。我想给学生一个答案,那就是说sd 定义为方差的平方根,即均方根偏差。换句话说,为什么学生应该使用正确的公式而不遵循她的想法? 该问题与此处提供的旧主题和答案有关。那里的答案有三个方向: σσ\sigma是均方根(RMS)偏差,而不是与平均值的“典型”偏差(即)。因此,它的定义有所不同。σnewσnew\sigma_{new} 它具有良好的数学特性。 此外,sqrt将使“单位”恢复到原始大小。但是,也是如此,它被N除以。σnewσnew\sigma_{new}NNN 第1点和第2点都是支持sd作为RMS的参数,但是我看不到反对使用σnewσnew\sigma_{new}。怎样说服入门级学生使用均方根平均距离σσ\sigma与均值?

2
二项式分布的贝叶斯估计
这个问题的技术跟进这个问题。 我在理解和复制Raftery(1988)中NNN提出的模型时遇到了麻烦:二项式参数的推论: WinBUGS / OpenBUGS / JAGS中的分层贝叶斯方法。它不仅与代码有关,因此在这里应该是主题。 背景 令是一组来自未知和的二项式分布的成功计数。此外,我假设遵循参数的泊松分布(如本文所述)。然后,每个的泊松分布均值为。我想根据和指定先验。ñ θ Ñ μ X 我 λ = μ θ λ θx=(x1,…,xn)x=(x1,…,xn)x=(x_{1},\ldots,x_{n})NNNθθ\thetaNNNμμ\muxixix_{i}λ=μθλ=μθ\lambda = \mu \thetaλλ\lambdaθθ\theta 假设我对或没有任何先验知识,我想为和分配非信息先验。说,我的先验是和。θ λ θ λ 〜ģ 一米米一(0.001 ,0.001 )θ 〜ü Ñ 我˚F ö ř 米(0 ,1 )NNNθθ\thetaλλ\lambdaθθ\thetaλ∼Gamma(0.001,0.001)λ∼Gamma(0.001,0.001)\lambda\sim \mathrm{Gamma}(0.001, 0.001)θ∼Uniform(0,1)θ∼Uniform(0,1)\theta\sim \mathrm{Uniform}(0, 1) 作者使用不当先验,但WinBUGS不接受不当先验。p(N,θ)∝N−1p(N,θ)∝N−1p(N,\theta)\propto N^{-1} 例 在纸(第226)中,提供了观察到的水羚的以下成功计数:。我想估计,即人口的大小。Ñ53,57,66,67,7253,57,66,67,7253, 57, 66, 67, …

3
如果不是Ward的标准,hclust()中的ward.D将执行哪种算法?
选项“ ward.D”(相当于R版本<= 3.0.3中唯一的Ward选项“ ward”)使用的选项不实现Ward(1963)的聚类标准,而选项“ ward.D2”实现该标准( Murtagh and Legendre 2014)。 (http://stat.ethz.ch/R-manual/R-patched/library/stats/html/hclust.html) 显然,ward.D未能正确执行Ward的标准。尽管如此,它似乎在产生的聚类方面做得很好。如果不是Ward的标准,method =“ ward.D”会实现什么? 参考文献 Murtagh,F.,&Legendre,P.(2014年)。沃德的层次聚类聚类方法:哪些算法实现沃德准则?分类杂志,31(3),274-295。
16 r  clustering  ward 

3
Logistic回归与感知器之间的差异
据我了解,具有逻辑S形激活功能的感知器/单层人工神经网络与逻辑回归模型相同。两种模型均由以下方程式给出: F(x )= 11 − e- βXF(X)=1个1个-Ë-βXF(x) = \frac{1}{1-e^{-\beta X}} 感知器学习算法是在线的且受错误驱动,而逻辑回归的参数可以使用多种批处理算法(包括梯度下降和有限内存BFGS)或在线算法(例如随机梯度下降)来学习。Logistic回归与S型感知器之间是否还有其他区别?经过随机梯度下降训练的逻辑回归器的结果是否应该与感知器相似?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.