统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
什么时候不使用交叉验证?
当我阅读该站点时,大多数答案都建议交叉验证应在机器学习算法中进行。但是,当我阅读《理解机器学习》一书时,我看到有一种练习,有时最好不要使用交叉验证。我真的很困惑 什么时候对整个数据进行训练算法比交叉验证更好?它是否发生在真实的数据集中? 让是k个假设类。假设你是给米 IID训练例子,你想学习类^ h = ∪ ķ 我= 1 ^ h 我。考虑两种替代方法:H1个,。。。,HķH1,...,HkH_1,...,H_k米mmH= ∪ķ我= 1H一世H=∪i=1kHiH=\cup^k_{i=1}H_i 使用ERM规则在m个示例中学习HHH米mm 划分米实例为训练集的大小的和验证组的大小α 米,对于一些α ∈ (0 ,1 )。然后,使用验证应用模型选择方法。也就是说,第一个训练每个类ħ 我在(1 - α )米使用相对于所述ERM规则训练样例ħ 我,并让ħ 1,... ,ħ ķ(1 - α )米(1−α)m(1−\alpha)mα 米αm\alpha mα ∈ (0 ,1 )α∈(0,1)\alpha\in(0,1)H一世HiH_i(1−α)m(1−α)m(1−\alpha)mHiHiH_ih^1,…,h^kh^1,…,h^k\hat{h}_1,\ldots,\hat{h}_k成为假设。其次,相对于应用该规则ERM到无限类{ ħ 1,... ,ħ ķ }对α 米验证的例子。h^1,…,h^kh^1,…,h^k\hat{h}_1,\ldots,\hat{h}_kαmαm\alpha m 描述第一种方法优于第二种方法的情况,反之亦然。 形象的态度。

2
从不正确的混合物中进行精确采样
假设我要从连续分布进行采样。如果我有的表达的形式pp (x )p(X)p(x)ppp p (x )= ∑我= 1∞一个一世F一世(x )p(X)=∑一世=1个∞一个一世F一世(X)p(x) = \sum_{i=1}^\infty a_i f_i(x) 其中和f_i是可以从中轻松采样的分布,然后我可以通过以下方式轻松地从p生成采样:一个一世⩾ 0 ,Σ一世一个一世= 1一个一世⩾0,∑一世一个一世=1个a_i \geqslant 0, \sum_i a_i= 1F一世F一世f_ippp 以概率a_i对标签一世一世i进行采样一个一世一个一世a_i 采样X〜˚F一世X〜F一世X \sim f_i 如果一个一世一个一世a_i有时为负数,是否可以推广此过程?我怀疑我已经在某个地方看到过此操作-可能在书中,或者可能是在Kolmogorov发行版中-因此,我很高兴接受参考作为答案。 如果一个具体的玩具示例有帮助,假设我要从p (X ,ÿ)∝ exp( - X - ÿ- α X ÿ--√)X ,ÿ> 0p(X,ÿ)∝经验值⁡(-X-ÿ-αXÿ)X,ÿ>0p(x,y) \propto \exp(-x-y-\alpha\sqrt{xy})\qquad x,y > 0然后出于技术上的原因,将α ∈ (0 ,2 )α∈(0,2)\alpha \in …

3
线性回归中的线性假设仅仅是的定义吗?
我正在修改线性回归。 格林的教科书指出: 现在,在线性回归模型上当然会有其他假设,例如。该假设与线性假设(实际上定义为)相结合,将结构置于模型上。E(ϵ|X)=0E(ϵ|X)=0E(\epsilon|X)=0ϵϵ\epsilon 但是,线性假设本身不会在我们的模型中添加任何结构,因为可以是完全任意的。对于任何变量,无论两者之间的关系如何,我们都可以定义一个使得线性假设成立。因此,线性“假设”的确可以称为一个定义的,而不是一个假设。ϵϵ\epsilonX,yX,yX, yϵϵ\epsilon εϵϵ\epsilon 因此我想知道: 格林草率吗?他实际上应该写出:吗?这是一个“线性假设”,实际上将结构放在模型上。E(y|X)=XβE(y|X)=XβE(y|X)=X\beta 还是我必须接受线性假设不将结构放在模型上而是仅定义一个,而其他假设将使用定义将结构放在模型上吗?εϵϵ\epsilonϵϵ\epsilon 编辑:由于其他假设似乎有些混乱,因此让我在此处添加全套假设: 这摘自Greene,《计量经济学分析》,第7版。p。16。

4
如何从内核密度估计中随机得出一个值?
我有一些观察结果,我想根据这些观察结果进行抽样。这里我考虑一个非参数模型,具体地说,我使用核平滑法从有限的观察值估计CDF。然后我从获得的CDF中随机绘制值。以下是我的代码(其思想是随机获得使用均匀分布的概率,并取CDF相对于概率值的倒数) x = [randn(100, 1); rand(100, 1)+4; rand(100, 1)+8]; [f, xi] = ksdensity(x, 'Function', 'cdf', 'NUmPoints', 300); cdf = [xi', f']; nbsamp = 100; rndval = zeros(nbsamp, 1); for i = 1:nbsamp p = rand; [~, idx] = sort(abs(cdf(:, 2) - p)); rndval(i, 1) = cdf(idx(1), 1); end figure(1); hist(x, …

1
与之间的LASSO关系
我对LASSO回归的理解是选择回归系数来解决最小化问题: 分β∥ ÿ- Xβ∥22 s 。Ť 。∥ β∥1个≤ 吨分β‖ÿ-Xβ‖22 s。Ť。‖β‖1个≤Ť\min_\beta \|y - X \beta\|_2^2 \ \\s.t. \|\beta\|_1 \leq t 实际上,这是使用拉格朗日乘数来完成的,从而可以解决问题 分β∥ ÿ- Xβ∥22+ λ ∥ β∥1个分β‖ÿ-Xβ‖22+λ‖β‖1个\min_\beta \|y - X \beta\|_2^2 + \lambda \|\beta\|_1 λλ\lambda和t是什么关系ŤŤt?维基百科无奈地简单地指出“依赖于数据”。 我为什么在乎?首先是出于求知欲。但是我也担心通过交叉验证选择\ lambda的后果λλ\lambda。 具体来说,如果我要进行n倍交叉验证,则可以将n个不同的模型拟合到我的训练数据的n个不同分区中。然后,针对给定的\ lambda,在未使用的数据上比较每个模型的准确性λλ\lambda。但是相同的\ lambda对数据的不同子集λλ\lambda意味着不同的约束(ŤŤt)(即t = f(λ )Ť=F(λ)t=f(\lambda)是“数据相关的”)。 我不是真的要解决交叉验证问题,以找到能够提供最佳偏差精度折衷方案的ŤŤt吗? 通过为每个交叉验证拆分和\ lambda计算\ | \ beta \ | …

2
如果事件的概率之和等于其并集的概率,这是否意味着事件是不相交的?
不言自明,概率函数指派一个实数P (一)给每个事件一个,如果满足三个基本假设(柯尔莫哥洛夫的假设):PPPP(A)P(A)P(A)AAA P(A)≥0 for everyAP(A)≥0 for everyAP(A) \geq 0 \ \text{for every} A P(Ω)=1P(Ω)=1P(\Omega) = 1 If A1,A2,⋯are disjoint, thenP(⋃∞i=1Ai)=∑i=1∞P(Ai)If A1,A2,⋯are disjoint, thenP(⋃i=1∞Ai)=∑i=1∞P(Ai)\text{If} \ A_1, A_2, \cdots \text{are disjoint, then}\\ P\left(\bigcup_{i=1}^{\infty}A_i\right) = \sum\limits_{i=1}^{\infty}P(A_i) 我的问题是,在最后一个假设中,是否假设相反?如果我证明可以将一定数量的事件的概率相加以获得其并集的概率,我是否可以直接使用该公理声称事件是不相交的?

2
为什么估计量被认为是随机变量?
我对估算器和估算值的理解是:估算器:计算估算值的规则估算:根据估算器从一组数据中计算出的值 在这两个术语之间,如果要求我指出随机变量,我会说估计是随机变量,因为它的值将根据数据集中的样本随机变化。但是我得到的答案是,估计量是随机变量,估计量不是随机变量。这是为什么 ?

2
回归中的B样条VS高阶多项式
我没有特定的示例或任务。我只是使用b样条的新手,我想在回归上下文中更好地了解此函数。 假设我们要评估响应变量与某些预测变量x 1,x 2,...之间的关系。。。,X p。预测变量包括一些数值变量和一些分类变量。yyyx1,x2,...,xpx1,x2,...,xpx_1, x_2,...,x_p 假设在拟合回归模型后,数值变量之一(例如是有效的。之后的逻辑步骤是评估是否需要更高阶的多项式,例如:x 2 1和x 3 1,以便在不过度拟合的情况下充分说明该关系。x1x1x_1x21x12x_1^2x31x13x_1^3 我的问题是: 在什么时候选择b样条曲线或简单的高阶多项式。例如在R: y ~ poly(x1,3) + x2 + x3 与 y ~ bs(x1,3) + x2 + x3 您如何使用图来告知您在这两者之间的选择,以及从图上还不清楚时会发生什么情况(例如:由于大量数据点) 您将如何评估和x 3之间的双向交互作用项x2x2x_2x3x3x_3 对于不同类型的模型,上述变化如何 您是否会考虑从不使用高阶多项式并始终拟合b样条并惩罚高灵活性?

1
是Beyer等人的相对对比度定理。论文:“关于高维空间中距离度量的惊人行为”引起误解?
这在提到维数诅咒时经常被引用 (右手公式称为相对对比度) limd→∞var(||Xd||kE[||Xd||k])=0,then:Dmaxkd−DminkdDminkd→0limd→∞var(||Xd||kE[||Xd||k])=0,then:Dmaxdk−DmindkDmindk→0 \lim_{d\rightarrow \infty} \text{var} \left(\frac{||X_d||_k}{E[||X_d||_k]} \right) = 0, \text{then}: \frac{D_{\max^{k}_{d}} - D_{\min^{k}_{d}}}{D_{\min^{k}_{d}}} \rightarrow 0 定理的结果表明,到给定查询点的最大距离和最小距离之间的差不会像在高维空间中到任何点的最近距离一样快。这使得邻近查询变得毫无意义且不稳定,因为最近邻居和最远邻居之间的区分度很差。 链接 但是,如果实际上尝试计算样本值的相对对比度,则意味着要获取一个包含非常小的值的向量,并计算到零向量的距离,然后对包含更大值的向量进行相同的计算,然后将其与尺寸为3且尺寸为10910910^9倍的尺寸,人们会看到,尽管该比例确实减小了,但变化却很小,以至于与实际使用的尺寸数量无关(或者有人知道有人在工作吗?数据的大小与Graham数的大小相同-我想这是描述纸张的效果与实际相关所需的大小-我认为不是)。 如前所述,该定理经常被引用来支持这样的说法,即基于欧几里德空间来测量接近度在高维空间中是一种较差的策略,作者本人也是这样说的,但是建议的行为实际上并未发生,这使我认为该定理已被误导使用。 示例:具有d尺寸 a=np.ones((d,)) / 1e5 b=np.ones((d,)) * 1e5 dmin,dmax=norm(a), norm(b) (dmax-dmin)/dmin 对于d = 3 9999999999.0 对于d = 1e8 9999999998.9996738 并使用 d = 1e8的 d = 3 用1e1代替1e5(假设数据已标准化) 99.0 98.999999999989527


1
我应该使用什么损失函数来对seq2seq RNN模型进行评分?
我正在研究Cho 2014论文,该论文介绍了用于seq2seq建模的编码器-解码器体系结构。 在本文中,他们似乎使用给定输入(或负对数似然)的输出概率作为长度为M的输入和长度为N的输出y的损失函数:xxxMMMyyyNNN P(y1,…,yN|x1,…,xM)=P(y1|x1,…,xm)P(y2|y1,x1,…,xm)…P(yN|y1,…,yN−1,x1,…,xm)P(y1,…,yN|x1,…,xM)=P(y1|x1,…,xm)P(y2|y1,x1,…,xm)…P(yN|y1,…,yN−1,x1,…,xm)P(y_1, …, y_N | x_1, …, x_M) = P(y_1 | x_1, …, x_m) P(y_2 | y_1, x_1, …, x_m) \dots P(y_N | y_1, …, y_N-1, x_1, …, x_m) 但是,我认为将其用作损失函数会遇到一些问题: 似乎假设教师在训练期间是强迫的(即,不是使用解码器的位置猜测作为下一次迭代的输入,而是使用已知标记。 它不会惩罚长序列。由于概率是输出的到N,因此如果解码器生成更长的序列,则第一个N之后的所有内容都不会计入损失。111NNNNNN 如果模型预测字符串尽头的早期令牌,则损失函数仍需要步-这意味着我们将基于未经训练的模型“流形”生成输出。这似乎草率。NNN 这些顾虑是否有效?如果是这样,那么向更高级的损失功能迈进了吗?


2
简单证明吗?
令为独立的标准正态随机变量。有很多(冗长的)证明,表明Z1,⋯,ZnZ1,⋯,ZnZ_1,\cdots,Z_n ∑i=1n(Zi−1n∑j=1nZj)2∼χ2n−1∑i=1n(Zi−1n∑j=1nZj)2∼χn−12 \sum_{i=1}^n \left(Z_i - \frac{1}{n}\sum_{j=1}^n Z_j \right)^2 \sim \chi^2_{n-1} 许多证明都很长,其中一些证明使用归纳法(例如Casella Statistics Inference)。我想知道是否有任何容易证明这一结果的证据。

1
从成对的边际分布获得联合分布
假设我们有3个随机变量,并且我们知道成对的边际分布P (X 1,X 2),P (X 2,X 3),P (X 3,X 1),但是我们什么都不知道(例如条件独立)。我们可以得到联合分布P (X 1,X 2,X 3)X1个,X2,X3X1个,X2,X3X_1,X_2,X_3P(X1个,X2), P(X2,X3), P(X3,X1个)P(X1个,X2),P(X2,X3),P(X3,X1个)P(X_1,X_2), P(X_2,X_3), P(X_3,X_1)P(X1个,X2,X3)P(X1个,X2,X3)P(X_1,X_2,X_3)?

2
辛普森悖论是否涵盖了所有从隐藏变量撤消的情况?
以下是有关作为“辛普森悖论”存在的“图片证明”提供的许多可视化的问题,以及有关术语的问题。 辛普森悖论是一个相当简单的现象来描述,并给予的(原因数值例子,为什么会发生这种情况是深刻而有趣)。矛盾的是,存在2x2x2列联表(Agresti,分类数据分析),其中边际关联与每个条件关联的方向不同。 也就是说,两个亚群中比率的比较都可以朝一个方向进行,但合并总体中的比率可以朝另一个方向进行。在符号中: 存在使得 a + ba ,b ,c ,d,ē ,˚F,g ^,小时一个,b,C,d,Ë,F,G,Ha,b,c,d,e,f,g,h一个+ bc + d&gt; e + fG+ 小时一个+bC+d&gt;Ë+FG+H \frac{a+b}{c+d} > \frac{e+f}{g+h} 但 和一个C&lt; eG一个C&lt;ËG \frac{a}{c} < \frac{e}{g} bd&lt; fHbd&lt;FH \frac{b}{d} < \frac{f}{h} 在以下可视化中(从Wikipedia)可以准确地表示出这一点: 一小部分是简单地对应的矢量的斜率,并且很容易在该示例中看到,较短乙矢量具有比相应的L矢量更大的斜率,但合并乙向量具有较小比组合1载体斜率。 有许多形式的非常常见的可视化,特别是在Simpson上的Wikipedia参考文献的开头: 这是混淆的一个很好的例子,隐藏变量(将两个子种群分开)如何显示不同的模式。 但是,从数学上讲,这样的图像绝不对应于作为基于辛普森悖论现象的现象的列联表的显示。首先,回归线位于实值点集数据之上,而不是对列联表中的数据进行计数。 同样,可以在回归线上创建具有任意斜率关系的数据集,但是在列联表中,斜率的不同程度受到限制。也就是说,总体的回归线可以与给定子群体的所有回归正交。但是,在辛普森悖论中,尽管不是反向回归,但亚群的比率即使偏离另一个方向,也不会偏离合并的人群(同样,请参见维基百科的比率比较图)。 对我来说,每次我将后者视为辛普森悖论的形象时,都足以吓一跳。但是,由于我到处都看到(我称之为错误的)示例,所以我很想知道: 我是否错过了从原始的Simpson / Yule列联表示例到转化为回归线可视化的真实值的微妙转换? 当然,辛普森的错误是一个特殊的例子。已经术语“辛普森悖论”现在已经成为等同于与混杂的错误,所以,无论数学,任何通过隐变量的方向变革,可以称之为辛普森悖论? 附录:以下是对2xmxn(或2乘以m,连续的)表的一般化示例: 如果以投篮方式合并,则防守者越近,球员的投篮机会就越多。按投篮类型分组(实际上是与篮筐的距离),则发生的直观情况越多,则投篮越多,防守队员越远。 我认为此图像是辛普森(Simpson's)对更连续情况(防御者的距离)的概括。但是我仍然看不到回归线示例是Simpson的示例。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.