统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
RMSProp和亚当vs SGD
我正在使用带有RMSProp,Adam和SGD的网络对EMNIST验证集进行实验。我使用SGD(学习率为0.1)和辍学(辍学概率为0.1)以及L2正则化(1e-05惩罚)达到了87%的准确度。当使用RMSProp和Adam测试相同的精确配置以及0.001的初始学习率时,我实现了85%的准确度和明显不那么平滑的训练曲线。我不知道如何解释这种行为。训练曲线缺乏平滑度并导致较低的准确性和较高的错误率的原因是什么?

1
后门和前门调整的因果效应
如果要在下面的因果关系图中计算对的因果关系,则可以使用后门调整定理和前门调整定理,即 Y P (y | do(X = x ))= ∑ u P (y | x ,u )P (u )XXXÿYYP(y| 做(X= x ))= ∑üP(y| X,ù)P(你)P(y|do(X=x))=∑uP(y|x,u)P(u)P(y | \textit{do}(X = x)) = \sum_u P(y | x, u) P(u) 和 P(y|do(X=x))=∑zP(z|x)∑x′P(y|x′,z)P(x′).P(y|do(X=x))=∑zP(z|x)∑x′P(y|x′,z)P(x′).P(y | \textit{do}(X = x)) = \sum_z P(z | x) \sum_{x'} P(y|x', z)P(x'). 是否容易证明这两项调整导致对因果关系相同?ÿXXXYYY

4
ANOVA比较多个组的平均值与ANOVA比较嵌套模型之间有什么关系?
到目前为止,我已经看到ANOVA以两种方式使用: 首先,在我的介绍性统计文本中,引入了ANOVA作为比较三个或更多组均值的一种方法,是对成对比较的改进,目的是确定一种均值是否具有统计学上的显着差异。 第二,在我的统计学习课文中,我已经看到ANOVA用于比较两个(或多个)嵌套模型,以确定使用模型2预测变量子集的模型1是否同样适合数据,或者是否完整模型2是上乘的。 现在,我认为这两者在某种程度上实际上是非常相似的,因为它们都在使用ANOVA测试,但是从表面上看,它们对我来说似乎完全不同。对于第一个方法,第一个用法比较三个或更多组,而第二个方法只能用于比较两个模型。有人请介意阐明这两种用途之间的联系吗?

5
来自同一分布族的两个随机变量是否可能具有相同的期望和方差,但具有更高的矩?
我在考虑位置规模家庭的含义。我的理解是,对于位置标尺族的每个成员,其参数分别位置标尺和b标尺,则Z =(Xa)/ b的分布不取决于任何参数,并且属于该族的每个X都是相同的。XXXaaabbbZ=(X−a)/bZ=(X−a)/bZ =(X-a)/bXXX 所以我的问题是,您能否提供一个示例,其中将来自同一分布族的两个随机数标准化,但不会导致具有相同分布的随机变量? 假设XXX和YYY来自同一个分布族(例如,我所说的族指正态或Gamma等等)。限定: Z1=X−μσZ1=X−μσZ_1 = \dfrac{X-\mu}{\sigma} Z2=Y−μσZ2=Y−μσZ_2 = \dfrac{Y-\mu}{\sigma} 我们知道Z1Z1Z_1和Z2Z2Z_2都具有相同的期望和方差,μZ=0,σ2Z=1μZ=0,σZ2=1\mu_Z =0, \sigma^2_Z =1。 但是他们可以有更高的时刻吗? 我试图回答这个问题的尝试是,如果XXX和Y的分布YYY取决于两个以上的参数。我正在考虑具有3个参数的广义t−studentt−studentt-student。 但是,如果参数数量为≤2≤2\le2并且XXX和YYY来自相同的分布族,并且具有相同的期望和方差,那么是否意味着Z1Z1Z_1和Z2Z2Z_2具有相同的分布(较高的矩)?

2
一个人(理论上)可以用比权重更少的训练样本来训练神经网络吗?
首先:我知道,训练神经网络不需要一般数量的样本。它取决于太多的因素,例如任务的复杂性,数据中的噪音等。而且我拥有的培训样本越多,我的人际网络就会越好。 但是我想知道:如果我假设我的任务足够“简单”,那么在理论上可以用比权重更少的训练样本来训练神经网络吗?有人知道这样做的例子吗?还是该网络几乎肯定会表现不佳? 例如,如果我考虑多项式回归,则无法仅在4个数据点上拟合4级多项式(即具有5个自由参数)。考虑我的权重数量作为自由参数的数量,神经网络是否有类似的规则?


1
变分推理,KL散度要求真
就我(非常适度)对变分推理的理解而言,人们试图通过找到优化以下内容的分布q来近似未知分布:pppqqq KL(p||q)=∑xp(x)logp(x)q(x)KL(p||q)=∑xp(x)logp(x)q(x)KL (p||q) = \sum\limits_{x} p(x)log \frac {p(x)}{q(x)} 每当我花时间去理解变分推理时,我都会不断遵循这个公式,并且不禁觉得自己错过了重点。看来我需要知道ppp才能计算KL(p||q)KL(p||q)KL(p||q)。但总的来说,我不知道该分布ppp。 每当我尝试阅读一些变化的东西时,正是这一点困扰着我。我想念什么? 编辑: 由于@wij的回答,我将在此处添加一些额外的注释,我将尝试更加精确。 在我感兴趣的情况下,考虑以下条件确实是完全合理的; p(θ|D)=p(D|θ)p(θ)p(D)∝p(D|θ)p(θ)p(θ|d)=p(d|θ)p(θ)p(d)∝p(d|θ)p(θ)p(\theta | D) = \frac{p(D|\theta)p(\theta)}{p(D)} \propto p(D|\theta)p(\theta) 在这种情况下,我可以知道应该成比例地显示,因为我将为p (D | θ )和p (θ )做出模型选择。那么,我是否正确地说我需要选择一个家庭分布q [让我们说高斯],这样我现在就可以估计K L (p (θ (D | D )| | q ))。感觉在这种情况下,我试图拟合接近非标准化p (D | θ )的高斯。pppp(D|θ)p(d|θ)p(D|\theta)p(θ)p(θ)p(\theta)qqqKL(p(θ|D)||q)ķ大号(p(θ|d)||q)KL(p(\theta|D) || q)。这个对吗?p(D|θ)p(θ)p(d|θ)p(θ)p(D|\theta)p(\theta) 如果是这样,感觉就像我假设我的后验是正态分布,而我只是试图针对散度找到该分布的可能值。KLķ大号KL

1
看到t-SNE很好地分离了类别后,应该使用哪种分类算法?
假设我们有一个分类问题,首先我们要从数据中获取一些见识,然后进行t-SNE。t-SNE的结果很好地分隔了各个类。这意味着可以建立分类模型,该模型也可以很好地分离类(如果t-SNE不能很好地分离,则意味着没有太大的区别)。 知道t-SNE专注于局部结构并且可以很好地分离类:什么是分类算法才能很好地解决此问题?Scikit建议使用具有高斯RBF内核的SVM,但还有哪些呢?

3
激励神经网络中的S型输出单元,以和线性非标准化对数概率开始
背景:我正在研究Ian Goodfellow,Yoshua Bengio和Aaron Courville撰写的《深度学习》第6章。在第6.2.2.2节(在此处可以查看 183页的182页中,鼓励使用S形输出。P(y=1|x)P(y=1|x)P(y=1|x) 为了总结一些材料,他们使是应用激活之前的输出神经元,其中是先前隐藏层的输出,是权重的向量,是标量偏差。输入向量表示为(是其函数),输出值表示为,其中是S型函数。该书希望使用值定义的概率分布。从第183页的第二段:z=wTh+bz=wTh+bz = w^Th+bhhhwwwbbbxxxhhhy=ϕ(z)y=ϕ(z)y=\phi(z)ϕϕ\phiyyyzzz 我们暂时忽略对的依赖,以讨论如何使用值定义的概率分布。可以通过构造未归一化的概率分布来激发S形,该概率分布之和不等于1。然后,我们可以除以适当的常数以获得有效的概率分布。如果我们假设未归一化的对数概率在和是线性的,则我们可以求幂以获得未归一化的概率。然后,我们进行标准化处理,以查看产生的z的S形变换控制的伯努利分布: xxxyyyzzzP~(y)P~(y)\tilde P(y)yyyzzzlogP~(y)P~(y)P(y)P(y)=yz=exp(yz)=exp(yz)∑1y′=0exp(y′z)=ϕ((2y−1)z)log⁡P~(y)=yzP~(y)=exp⁡(yz)P(y)=exp⁡(yz)∑y′=01exp⁡(y′z)P(y)=ϕ((2y−1)z)\begin{align} \log\tilde P(y) &= yz \\ \tilde P(y) &= \exp(yz) \\ P(y) &= \frac{\exp(yz)}{\sum_{y'=0}^1 \exp(y'z) } \\ P(y) &= \phi((2y-1)z) \end{align} 问题:我对两件事感到困惑,尤其是第一件事: 最初的假设来自哪里?为什么未归一化的对数概率在和呈线性关系?有人可以给我一些有关作者如何以开头的观点吗?yyyzzzlogP~(y)=yzlog⁡P~(y)=yz\log\tilde P(y) = yz 最后一行如何?

2
小批量梯度下降如何批量更新每个示例的权重?
如果我们批量处理10个示例,我理解我们可以将每个示例的损失相加,但是反向传播在更新每个示例的权重方面如何工作? 例如: 示例1->损失= 2 示例2->损失= -2 这导致平均损失为0(E = 0),那么这将如何更新每个权重并收敛呢?仅仅是通过批次的随机化,我们“希望”早晚收敛?难道这还不是只为最后处理的示例计算第一组权重的梯度吗?

3
在计算相关矩阵时,丢弃带有缺失值的观测值是否存在严重问题?
我有2500个变量和142个观测值的庞大数据集。 我想在变量X和其余变量之间运行关联。但是对于许多列,缺少条目。 我尝试使用“成对完成”参数(use=pairwise.complete.obs)在R中执行此操作,并输出了一堆相关性。但是随后StackOverflow上的某人发布了指向本文http://bwlewis.github.io/covar/missing.html的链接,这使R中的“成对完成”方法显得无法使用。 我的问题:我怎么知道什么时候适合使用“成对完成”选项? 我use = complete.obs回来了no complete element pairs,所以如果您能解释一下这也意味着什么,那就太好了。


2
Keras:为什么损失减少而val_loss增加?
我为一组参数设置了网格搜索。我正在尝试为进行二进制分类的Keras神经网络找到最佳参数。输出为1或0。大约有200个要素。当我进行网格搜索时,我得到了一堆模型及其参数。最佳模型具有以下参数: Epochs : 20 Batch Size : 10 First Activation : sigmoid Learning Rate : 1 First Init : uniform 该模型的结果是: loss acc val_loss val_acc 1 0.477424 0.768542 0.719960 0.722550 2 0.444588 0.788861 0.708650 0.732130 3 0.435809 0.794336 0.695768 0.732682 4 0.427056 0.798784 0.684516 0.721137 5 0.420828 0.803048 0.703748 0.720707 …


2
偏差方差方程的数学直觉
我最近问了一个问题,要求在与样品均值和方差有关的基本方程式后面寻求数学解释/直觉:E[X2]=Var(X)+(E[X])2E[X2]=Var(X)+(E[X])2 E[X^2] = Var(X) +(E[X])^2,是几何的还是其他的。 但是现在,我对表面上相似的偏差-方差折衷方程式感到好奇。 MSE(θ^)=E[(θ^−θ)2]==E[(θ^−E[θ^])2]+(E[θ^]−θ)2Var(θ^)+Bias(θ^,θ)2MSE(θ^)=E[(θ^−θ)2]=E[(θ^−E[θ^])2]+(E[θ^]−θ)2=Var(θ^)+Bias(θ^,θ)2 \begin{eqnarray} \text{MSE}(\hat{\theta}) = E [(\hat{\theta}-\theta)^2 ] &=& E[(\hat{\theta} - E[\hat\theta])^2] + (E[\hat\theta] - \theta)^2\\ &=& \text{Var}(\hat\theta) + \text{Bias}(\hat\theta,\theta)^2 \\ \end{eqnarray} (选自式维基百科) 对我来说,与偏差-方差折衷方程的回归有一个表面上的相似之处:三个具有平方的项,两个相加。非常毕达哥拉斯的外观。是否所有这些项目都有相似的矢量关系,包括正交性?还是有其他适用的数学解释? 我正在寻找与其他一些可能会有所启发的数学对象的数学类比。我不是在找精确精度的类比,这里已经介绍了很多。但是,如果人们可以在偏差方差折衷与更基本的均值方差关系之间给出非技术类比,那也将是巨大的。
12 variance  bias 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.