统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
线性变换的相关不变性:
这实际上是古吉拉特语《基本计量经济学》第4版(Q3.11)中的问题之一,并说相关系数相对于原点和比例的变化是不变的,即,其中,,,是任意常数。corr(aX+b,cY+d)=corr(X,Y)corr(aX+b,cY+d)=corr(X,Y)\text{corr}(aX+b, cY+d) = \text{corr}(X,Y)aaabbbcccddd 但是我的主要问题是:让和成对观察,并假设和正相关,即。我知道基于直觉会为负数。然而,如果我们取,它遵循,其不没有道理。XXXYYYXXXYYYcorr(X,Y)>0corr(X,Y)>0\text{corr}(X,Y)>0corr(−X,Y)corr(−X,Y)\text{corr}(-X,Y)a=−1,b=0,c=1,d=0a=−1,b=0,c=1,d=0a=-1, b=0, c=1, d=0corr(−X,Y)=corr(X,Y)>0corr(−X,Y)=corr(X,Y)>0\text{corr}(-X,Y) = \text{corr}(X,Y) >0 如果有人可以指出差距,我将不胜感激。谢谢。


1
自然界中分布的任何过程是否完全正常?
关于自然中的正态分布的重要性已有很多论述。许多测量值,例如身高或体重,大致呈正态分布。但是据我了解,它们都不是完全正常的。 考虑到正态分布是最大熵分布之一,自然应该“喜欢它”似乎是合理的。但是经过一番思考,我无法提出任何“真正的”正常随机变量的例子。 我的问题是那里有什么很好的例子来说明正态分布的随机变量?

2
聚类问题的特征选择
我正在尝试使用无监督算法(聚类)将不同的数据集组合在一起。问题是我有很多功能(〜500)和少量情况(200-300)。 到目前为止,我以前只做分类问题,对此我总是将数据标记为训练集。在那里,我使用了一些标准(即random.forest.importance或information.gain)来预先选择特征,然后我使用了针对不同学习者的顺序正向选择来找到相关特征。 现在,我看到在无监督学习的情况下,我既没有任何预选标准,也不能使用顺序正向选择(至少在mlr软件包中没有)。 我想知道是否可以先进行主成分分析,然后再找到少量适合我的聚类算法的功能。还是您还有其他想法? 谢谢 编辑: 好的,所以在网上进行了一些研究之后,我可以稍微更新一下我的问题:首先,由于两个原因,我读了一些不鼓励在聚类算法之前使用PCA的文章: PC具有所有功能的功能,因此很难将结果与初始数据集相关联,因此很难解释 此外,如果您有一个问题,就是实际上只有很少一部分功能有助于进行聚类,则不必说这些功能也描述了样本之间最大的差异(PC就是这样做的) 因此PCA不在桌面上... 现在,我回到了最初的想法,对集群进行顺序的前向选择。 您会推荐什么绩效指标?(我想到过Dunn-Index)哪种聚类算法会导致大小大致相同的聚类?(对于分层集群,我通常会得到一个集群,其中有一个异常值,而另一个集群则具有所有其他异常值->因此,我需要某种可以防止异常值的东西) 希望你们能帮助我...

1
使用k折CV的原始(?)模型选择
当使用k-fold CV在回归模型中进行选择时,我通常会针对每个模型及其标准误差SE分别计算CV误差,并且我会在CV误差最低的模型的1 SE中选择最简单的模型(1标准错误规则,请参见此处的示例)。但是,最近有人告诉我,这样我就高估了可变性,并且在选择两个模型A和B之间的特定情况下,我确实应该以不同的方式进行: 对于长度每个折叠,计算两个模型预测之间的逐点差异。然后计算折叠KKKNKNKN_KMSDK=∑NKi=1(y^Ai−y^Bi)2NK−−−−−−−−−−−−−−−√MSDK=∑i=1NK(y^Ai−y^Bi)2NKMSD_K=\sqrt{\frac{\sum_{i=1}^{N_K}\left(\hat{y}_{Ai}-\hat{y}_{Bi}\right)^2}{N_K}} 像往常一样在折痕上平均,并将此CV差值误差(及其标准误差)用作泛化误差的估计量。MSDKMSDKMSD_K 问题: 你能理解这个吗?我知道使用CV错误作为广义错误的估计因素有理论上的原因(我不知道这些原因是什么,但我知道它们存在!)。我不知道使用此“差异” CV错误背后是否有理论上的原因。 我不知道这是否可以推广到两个以上模型的比较中。计算所有成对模型的差异似乎是冒险的(多次比较?):如果您拥有两个以上的模型,该怎么办? 编辑:我的公式是完全错误的,此处描述了正确的指标,而且复杂得多。好吧,我很高兴在盲目应用公式之前在这里问过!感谢@Bay帮助我理解他/她的启发性答案。所描述的正确方法是实验性的,因此我会坚持使用我信任的工作马,CV错误!

3
将离散随机变量减半?
让是一个离散随机变量采取它的值在Ñ。我想将该变量减半,即找到一个随机变量Y,例如:XXXNñ\mathbb{N}YÿY X=Y+Y∗X=ÿ+ÿ∗X = Y + Y^* 其中是一个独立的副本ÿ。Y∗ÿ∗Y^*YÿY 我指的是这个过程减半;这是一个虚构的术语。在文献中是否有合适的术语用于该手术? 在我看来,只有当我们接受负概率时,此类才会一直存在。我的观察正确吗?YÿY 有没有最好的概念正适合?又称随机变量,它是“最接近”求解上述方程式的变量。YÿY 谢谢!

1
无法使此自动编码器网络正常运行(具有卷积层和maxpool层)
自动编码器网络似乎比普通分类器MLP网络更复杂。在使用Lasagne进行了几次尝试之后,我在重构输出中得到的所有内容在最好的情况下类似于MNIST数据库的所有图像的模糊平均,而没有区分输入位数是多少。 我选择的网络结构为以下层叠层: 输入层(28x28) 2D卷积层,滤镜尺寸7x7 最大汇聚层,大小3x3,步幅2x2 密集(完全连接)的展平层,10个单位(这是瓶颈) 密集(完全连接)层,共121个单元 将图层重塑为11x11 2D卷积层,滤镜大小3x3 2D放大层系数2 2D卷积层,滤镜大小3x3 2D放大层系数2 2D卷积层,滤镜尺寸5x5 功能最大池化(从31x28x28到28x28) 所有的2D卷积层都具有无偏差的偏置,S型激活和31个滤波器。 所有完全连接的层均具有S型激活。 使用的损失函数为平方误差,更新函数为adagrad。用于学习的块的长度是100个样本,乘以1000个纪元。 下面是该问题的说明:上面的行是设置为网络输入的一些样本,下面的行是重构: 为了完整起见,以下是我使用的代码: import theano.tensor as T import theano import sys sys.path.insert(0,'./Lasagne') # local checkout of Lasagne import lasagne from theano import pp from theano import function import gzip import numpy as np from …

1
带拉普拉斯误差的线性回归
考虑线性回归模型: yi=xi⋅β+εi,i=1,…,n,yi=xi⋅β+εi,i=1,…,n, y_i = \mathbf x_i \cdot \boldsymbol \beta + \varepsilon _i, \, i=1,\ldots ,n, 其中εi∼L(0,b)εi∼L(0,b)\varepsilon _i \sim \mathcal L(0, b),即,具有000均值的拉普拉斯分布和bbb标度参数都是相互独立的。考虑未知参数\ boldsymbol \ beta的最大似然估计ββ\boldsymbol \beta: −logp(y∣X,β,b)=nlog(2b)+1b∑i=1n|xi⋅β−yi|−log⁡p(y∣X,β,b)=nlog⁡(2b)+1b∑i=1n|xi⋅β−yi| -\log p(\mathbf y \mid \mathbf X, \boldsymbol \beta, b) = n\log (2b) + \frac 1b\sum _{i=1}^n |\mathbf x_i \cdot \boldsymbol \beta - y_i| 从其中 …


3
一组不相关但线性相关的变量
是否可以有一组不相关但线性相关的变量?KKK 即 和∑ K i = 1 a i x i = 0cor(xi,xj)=0cor(xi,xj)=0cor(x_i, x_j)=0∑Ki=1aixi=0∑i=1Kaixi=0 \sum_{i=1}^K a_ix_i=0 如果可以,您可以写一个例子吗? 编辑:从答案中得出结论,这是不可能的。 至少有可能,其中是从变量样本,是与不相关的变量。ρ Ñ v X 我P(|ρ^xi,xj−ρ^xi,v|&lt;ϵ)P(|ρ^xi,xj−ρ^xi,v|&lt;ϵ)\mathbb{P}(|\hat \rho_{x_i, x_j}-\hat \rho_{x_i, v}|<\epsilon)ρ^ρ^\hat\rhonnnvvvxixix_i 我在想类似ķ&gt;&gt;0xK=1K∑K−1i=1xixK=1K∑i=1K−1xix_K=\dfrac{1}{K} \sum_{i=1}^{K-1} x_i K&gt;&gt;0K&gt;&gt;0K>>0

1
为什么不能使用相同的方法估算线性和逻辑回归系数?
我在一本机器学习书中读到,可以通过梯度下降来估算线性回归的参数(以及其他方法),而逻辑回归的参数通常是通过最大似然估计来估算的。 是否可以向新手(我)解释为什么我们需要不同的线性/逻辑回归方法。aka为什么不使用MLE进行线性回归,为什么不使用梯度下降进行logistic回归?

3
旋转PCA组件以均衡每个组件中的方差
我试图通过对数据集执行PCA并丢弃最后几台PC来降低数据集的维数和噪声。之后,我想在其余PC上使用一些机器学习算法,因此我想通过均衡PC的方差来标准化数据,以使算法更好地工作。 一种简单的方法是简单地将方差标准化为单位值。但是,第一台PC与原始数据集相比,包含的原始方差更多,而我仍然希望为其赋予更多的“权重”。因此,我想知道:是否有一种简单的方法可以拆分方差并与方差较小的PC共享? 另一种方法是将PC映射回原始特征空间,但是在那种情况下,维数也会增加到原始值。 我想最好使结果列保持正交,但这时没有必要。

1
如何计算这种复杂的骰子滚动机制的结果概率?
该问题询问角色扮演游戏中成功的可能性。但是,问题及其答案并未涵盖骰子机制的某些复杂性。特别是,它根本没有涵盖错误(一种可能的结果)。 玩家拥有骰子池,该骰池基于游戏中与此问题无关的某种机制。骰子池是玩家可以掷出的可变数量的骰子。有关于玩家掷出多少个骰子的规则,但这与这个问题无关。它可以是从1的任何数量的骰子(单管芯)至约15。我打电话这个P。 骰子的10个边标记为1到10(含1和10)(在我们的领域术语中称为“ d10”) 当掷骰子时,有一个目标数或难度数。如何生成此数字超出了此问题的范围,但是该数字可以在3到9之间(含3和9)。有关此的规则说明如下。我打电话这个牛逼。 当所有骰子都掷出时,有一些规则可以确定结果: 任何等于或大于T的骰子都视为成功 任何等于1的骰子都会减去成功 这样... 如果在减法后(如果适用)没有剩余大于或等于T的模具,则结果为失败。 如果在减法后(如果适用),还剩下至少一个大于或等于T的晶粒,那么结果是成功的。 如果没有任何掷骰的模具大于或等于T,并且至少有一个掷骰为1,则该掷骰是不合格的 对于给定的P池和T目标,如何计算该系统成功,失败或破产的概率?
9 dice 

3
回归系数的偏差方差折衷是什么?如何推导?
在本文中(仅使用误差对比度进行方差分量的贝叶斯推断,Harville,1974年),作者声称 成为“众所周知的线性回归 其中 (y- Xβ)′H− 1(y- Xβ)= (y- Xβ^)′H− 1(y- Xβ^)+ (β- β^)′(X′H− 1X)(β- β^)(ÿ-Xβ)′H-1个(ÿ-Xβ)=(ÿ-Xβ^)′H-1个(ÿ-Xβ^)+(β-β^)′(X′H-1个X)(β-β^)(y-X\beta)'H^{-1}(y-X\beta)=(y-X\hat\beta)'H^{-1}(y-X\hat\beta)+(\beta-\hat\beta)'(X'H^{-1}X)(\beta-\hat\beta)ε 〜ñÿ= Xβ+ϵ,y=Xβ+ϵ,y=X\beta+\epsilon,ϵ∼N(0,H).ϵ∼N(0,H).\epsilon\sim\mathcal{N}(0, H). 这个怎么知名的?证明这一点的最简单方法是什么?

1
我们是否可以始终根据任意分布和对称分布的组成来重写右偏分布?
考虑一个二次可微和对称分布。现在考虑第二个两次可微分布偏斜,其含义是:FXFX\mathcal{F}_XFZFZ\mathcal{F}_Z (1)FX⪯cFZ.(1)FX⪯cFZ.(1)\quad\mathcal{F}_X\preceq_c\mathcal{F}_Z. 其中⪯c⪯c\preceq_c是van Zwet [0]的凸序,因此(1)(1)(1)等效于: (2)F−1ZFX(x) is convex ∀x∈R.(2)FZ−1FX(x) is convex ∀x∈R.(2)\quad F^{-1}_ZF_X(x)\text{ is convex $\forall x\in\mathbb{R}.$} 现在考虑满足以下条件的第三个两次可微分布:FYFY\mathcal{F}_Y (3)FY⪯cFZ.(3)FY⪯cFZ.(3)\quad\mathcal{F}_Y\preceq_c\mathcal{F}_Z. 我的问题是:我们总能找到一个分配和对称分布重写任何 中的一个组成方面(如上定义的所有三种)和 为:FYFY\mathcal{F}_YFXFX\mathcal{F}_XFZFZ\mathcal{F}_ZFXFX\mathcal{F}_XFYFY\mathcal{F}_Y FZ(z)=FYF−1XFY(z)FZ(z)=FYFX−1FY(z)F_Z(z)=F_YF_X^{-1}F_Y(z) 或不? 编辑: 例如,如果是形状参数为3.602349的Weibull(因此它是对称的),而是形状参数为3/2的Weibull分布(因此它是右偏),我懂了F ZFXFX\mathcal{F}_XFZFZ\mathcal{F}_Z maxz|FZ(z)−FYF−1XFY(z)|≈0maxz|FZ(z)−FYFX−1FY(z)|≈0\max_z|F_Z(z)-F_YF_X^{-1}F_Y(z)|\approx 0 通过将为形状参数为2.324553的Weibull分布。请注意,所有三个分布均满足:FYFY\mathcal{F}_Y F−X=FX⪯cFY⪯cFZ,F−X=FX⪯cFY⪯cFZ,\mathcal{F}_{-X}=\mathcal{F}_X\preceq_c\mathcal{F}_Y\preceq_c\mathcal{F}_Z, 根据需要。我不知道这总体上是正确的(在所述条件下)。 [0] van Zwet,WR(1979)。平均值,中位数,模式II(1979)。Statistica Neerlandica。第33卷,第1期,第1--5页。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.