统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
在套索中给出0分量的最小
β^λ=argminβ∈Rp12n∥y−Xβ∥22+λ∥β∥1,β^λ=arg⁡minβ∈Rp12n‖y−Xβ‖22+λ‖β‖1,\hat\beta^\lambda = \arg\min_{\beta \in \mathbb{R}^p} \frac{1}{2n} \|y - X \beta\|_2^2 + \lambda \|\beta\|_1,ithithi^{th}xi∈Rpxi∈Rpx_i \in \mathbb{R}^pX∈Rn×pX∈Rn×pX \in \mathbb{R}^{n \times p}yiyiy_ii=1,…ni=1,…ni=1, \dots n 我们知道,对于,套索估计\ hat \ beta ^ \ lambda = 0。(例如,请参阅Lasso和Ridge调整参数范围。)用另一种表示法表示\ lambda_ \ max = \ frac {1} {n} \ | X ^ T y \ | _ \ infty。请注意,\ lambda_ …

2
神经网络在权宜之计上是否存在卷积的数学原因?
在卷积神经网络(CNN)中,在进行卷积之前,每一步的权重矩阵都需要翻转其行和列以获得内核矩阵。Hugo Larochelle 在以下一系列视频中对此进行了解释: daccess-ods.un.org daccess-ods.un.org计算隐藏映射将对应于使用内核矩阵对来自上一层的信道进行离散卷积,并且该内核是根据隐藏权重矩阵WijWijW_{ij},我们在其中翻转行和列。 如果像其他类型的NN一样将卷积的减少步长与常规矩阵乘法进行比较,权宜之计将是一个明确的解释。但是,这可能不是最相关的比较... 在数字成像处理中,将滤镜卷积到图像上(对于实际直觉来说这是一个很棒的youtube视频)似乎与以下内容有关: 该事实卷积是缔合而(交叉)的相关是没有的。 由于时域中的卷积等效于频域中的乘法(卷积定理),因此可以在图像的频域中将滤波器作为乘法应用。 在这种特定的技术环境中,DSP 相关定义为: F∘I(x,y)=∑j=−NN∑i=−NNF(i,j)I(x+i,y+j)F∘I(x,y)=∑j=−NN∑i=−NNF(i,j)I(x+i,y+j)F\circ I(x,y)=\sum_{j=-N}^{N}\sum_{i=-N}^N\, F(i,j)\,I(x+i, y+j) 这实际上是Hadamard乘积中所有单元的总和: F∘I(x,y)=⎡⎣⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢F[−N,−N]I[x−N,y−N]⋮F[0,−N]I[x,y−N]⋮F[N,−N]I[x+N,y−N]⋯⋱⋯⋱⋯F[−N,0]I[x−N,y−N]⋮F[0,0]I[x,y]⋮F[N,0]I[x+N,y]⋯⋱⋯⋱⋯F[−N,N]I[x−N,y+N]⋮F[0,N]I[x,y+N]⋮F[N,N]I[x+N,y+N]⎤⎦⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥F∘I(x,y)=[F[−N,−N]I[x−N,y−N]⋯F[−N,0]I[x−N,y−N]⋯F[−N,N]I[x−N,y+N]⋮⋱⋮⋱⋮F[0,−N]I[x,y−N]⋯F[0,0]I[x,y]⋯F[0,N]I[x,y+N]⋮⋱⋮⋱⋮F[N,−N]I[x+N,y−N]⋯F[N,0]I[x+N,y]⋯F[N,N]I[x+N,y+N]]\small F\circ I(x,y)=\Tiny\begin{bmatrix}F[-N,-N]\,I[x-N,y-N]&\cdots&F[-N,0]\,I[x-N,y-N]&\cdots& F[-N,N]\,I[x-N,y+N]\\ \vdots&\ddots&\vdots&\ddots&\vdots\\ F[0,-N]\,I[x,y-N]&\cdots&F[0,0]\,I[x,y]&\cdots& F[0,N]\,I[x,y+N]\\ \vdots&\ddots&\vdots&\ddots&\vdots\\ F[N,-N]\,I[x+N,y-N]&\cdots&F[N,0]\,I[x+N,y]&\cdots& F[N,N]\,I[x+N,y+N]\\ \end{bmatrix} 其中是一个滤波函数(表示为矩阵),而I (x ,y )是位置(x ,y )上图像的像素值:F(i,j)F(i,j)F(i,j)I(x,y)I(x,y)I(x,y)(x,y)(x,y)(x,y) 互相关的目的是评估探针图像与测试图像的相似程度。互相关图的计算依赖于卷积定理。 另一方面,卷积定义为: F∗I(x,y)=∑j=−NN∑i=−NNF(i,j)I(x−i,y−j)F∗I(x,y)=∑j=−NN∑i=−NNF(i,j)I(x−i,y−j)F* I(x,y)=\sum_{j=-N}^{N}\sum_{i=-N}^N\, F(i,j)\,I(x-i, y-j) 只要过滤器是对称的,就与过滤器的行和列翻转的相关操作相同: F∗I(x,y)=⎡⎣⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢⎢F[N,N]I[x−N,y−N]⋮F[0,N]I[x,y−N]⋮F[−N,−N]I[x+N,y−N]⋯⋱⋯⋱⋯F[N,0]I[x−N,y−N]⋮F[0,0]I[x,y]⋮F[−N,0]I[x+N,y]⋯⋱⋯⋱⋯F[N,−N]I[x−N,y+N]⋮F[0,−N]I[x,y+N]⋮F[−N,−N]I[x+N,y+N]⎤⎦⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥⎥F∗I(x,y)=[F[N,N]I[x−N,y−N]⋯F[N,0]I[x−N,y−N]⋯F[N,−N]I[x−N,y+N]⋮⋱⋮⋱⋮F[0,N]I[x,y−N]⋯F[0,0]I[x,y]⋯F[0,−N]I[x,y+N]⋮⋱⋮⋱⋮F[−N,−N]I[x+N,y−N]⋯F[−N,0]I[x+N,y]⋯F[−N,−N]I[x+N,y+N]]\small F* I(x,y)=\Tiny\begin{bmatrix}F[N,N]\,I[x-N,y-N]&\cdots&F[N,0]\,I[x-N,y-N]&\cdots& F[N,-N]\,I[x-N,y+N]\\ \vdots&\ddots&\vdots&\ddots&\vdots\\ F[0,N]\,I[x,y-N]&\cdots&F[0,0]\,I[x,y]&\cdots& F[0,-N]\,I[x,y+N]\\ \vdots&\ddots&\vdots&\ddots&\vdots\\ F[-N,-N]\,I[x+N,y-N]&\cdots&F[-N,0]\,I[x+N,y]&\cdots& F[-N,-N]\,I[x+N,y+N]\\ …

6
我们曾经使用最大似然估计吗?
我想知道统计中是否曾经使用过最大似然估计。我们学习了它的概念,但我不知道它何时实际使用。如果我们假设数据的分布,我们会找到两个参数,一个用于平均值,一个用于方差,但是您实际在实际情况下使用它吗? 有人可以告诉我一个简单的例子吗?

2
为什么线性回归对残差有假设,而广义线性模型对响应有假设?
为什么线性回归和广义模型的假设不一致? 在线性回归中,我们假设残差来自高斯 在其他回归(逻辑回归,毒物回归)中,我们假设响应来自某种分布(二项式,泊松等)。 为什么有时会假设剩余而其他时间会在响应时?是因为我们要导出不同的属性? 编辑:我认为mark999的显示两种形式是相等的。但是,我对iid还有其他疑问: 我的另一个问题 是,逻辑回归是否有iid假设?显示广义线性模型没有iid假设(独立但不相同) 对于线性回归,是否真的成立,如果我们对残差进行假设,我们将有iid,但是如果对响应进行假设,我们将拥有独立但不相同的样本(具有不同不同高斯样本)?μμ\mu



7
直观地理解为什么泊松分布是二项式分布的极限情况
在DS Sivia的“数据分析”中,从二项式分布推导了泊松分布。 他们认为,当M→∞M→∞M\rightarrow\infty,泊松分布是二项式分布的极限情况,其中MMM是试验次数。 问题1:如何直观地理解该论点? 问题2:为什么large- MMM的限制M!N!(M−N)!M!N!(M−N)!\frac{M!}{N!(M-N)!}等于MNN!MNN!\frac{M^{N}}{N!},其中M次试验的成功次数为?(此步骤用于推导中。)NNNMMM

2
对于什么模型,MLE的偏差下降快于方差?
θ^\hat\thetaθ∗\theta^*nn‖ˆθ−θ∗‖∥θ^−θ∗∥\lVert\hat\theta-\theta^*\rVertO(1/√n)O(1/n−−√)O(1/\sqrt n)‖Eˆθ−θ∗‖∥Eθ^−θ∗∥\lVert \mathbb E\hat\theta - \theta^*\rVert‖Eˆθ−ˆθ‖∥Eθ^−θ^∥\lVert \mathbb E\hat\theta - \hat\theta\rVertO(1/√n)O(1/n−−√)O(1/\sqrt{n}) 我对具有比更快地收缩的偏差的模型感兴趣,但是其中的误差不会以这种更快的速率收缩,因为偏差仍以收缩。特别是,我想知道足够的条件来使模型的偏差以的速率收缩。O(1/√n)O(1/n−−√)O(1/\sqrt n)O(1/√n)O(1/n−−√)O(1/\sqrt n)O(1/n)O(1/n)O(1/n)

3
当其中一个变量是分类变量时,为什么相关性不是很有用?
这只是一个小小的检查,请帮助我看看我是否误解了这个概念,以及以什么方式。 我对相关性有一个功能上的理解,但我感到有些困惑,要真正自信地解释该功能性理解背后的原理。 据我了解,统计相关性(相对于该术语的更一般用法)是一种理解两个连续变量以及它们以相似的方式趋向或不趋于上升或下降的方式。 您无法对一个连续的和一个分类变量进行相关性的原因是,由于无法计算两者之间的协方差,因此无法计算 两者之间的协方差,因为按定义,分类变量不能产生均值,因此甚至不能输入第一个统计分析的步骤。 那正确吗?

3
协方差等于零是否意味着二进制随机变量具有独立性?
如果XXX和YYY是两个只能具有两个可能状态的随机变量,我如何证明Cov(X,Y)=0Cov(X,Y)=0Cov(X,Y) = 0表示独立性?这种违背了我回想起Cov(X,Y)=0Cov(X,Y)=0Cov(X,Y) = 0并不意味着独立... 提示说从111和开始000作为可能的状态,并从那里开始进行概括。我可以这样做并显示E(XY)=E(X)E(Y)E(XY)=E(X)E(Y)E(XY) = E(X)E(Y),但这并不意味着独立? 我猜这有点困惑如何数学上做到这一点。

1
仅观察一次的随机效应将如何影响广义线性混合模型?
我有一个数据集,在该数据集中,我想用作随机效果的变量在某些级别上只有一个观察值。基于对先前问题的回答,我认为原则上可以。 我可以将混合模型与只有1个观察值的对象拟合吗? 随机截距模型-每个科目一次测量 但是,在第二个链接中,第一个答案指出: “ ...假设您没有使用广义线性混合模型GLMM,在这种情况下,过度分散的问题将发挥作用” 我正在考虑使用GLMM,但我真的不了解单次观察的随机效应水平将如何影响模型。 这是我要拟合的模型之一的示例。我正在研究鸟类,我想模拟人口和季节对迁徙期间停留次数的影响。我想将个人用作随机效应,因为对于某些个人,我拥有长达5年的数据。 library(dplyr) library(lme4) pop <- as.character(c("BF", "BF", "BF", "BF", "BF", "BF", "BF", "BF", "BF", "BF", "BF", "BF", "BF", "BF", "BF", "BF", "BF", "BF", "BF", "BF", "BF", "MA", "MA", "MA", "MA", "MA", "MA", "MA", "MA", "MA", "MA", "MA", "MA", "MA", "MA", "MA", "NU", "NU", …

1
两个世界碰撞:使用ML处理复杂的调查数据
我似乎很容易遇到问题,但是好几个星期以来我一直没有找到合适的解决方案。 我有很多民意测验/调查数据(成千上万的受访者,说每个数据集为5万),这些数据我希望将其称为复杂设计的调查,包括权重,分层,特定路由等。对于每个受访者,都有数百个变量,例如人口统计(年龄,地区...),然后是二进制变量(最多是分类变量)。 我更多地来自计算机科学/机器学习背景,我必须学习很多有关经典调查统计数据和方法的知识。现在,我想将经典机器学习应用于这些数据(例如,预测受访者子集的某些缺失值-基本上是分类任务)。但是,等等,我找不到合适的方法来做到这一点。我应该如何合并这些层次,权重或路由(例如:如果问题1回答了选项2,请问问题3,否则跳过它)? 简单地应用我的模型(树,逻辑回归,SVM,XGBoost ...)似乎很危险(并且在大多数情况下它们会失败),因为它们通常假定数据来自简单的随机样本或iid。 许多方法至少都具有权重,但并没有太大帮助。此外,不清楚如何将不平衡的类和调查定义所给出的权重结合在一起,而不是讨论那些分层的东西。此外,结果模型应进行良好的校准-预测的分布应与原始模型非常接近。预测的良好性能并不是这里的唯一标准。我还更改了优化指标,以考虑到这一点(例如预测分布与真实分布的距离 +准确度/ MCC),并且在某些情况下有所帮助,为什么会破坏其他性能。 有什么规范的方法可以解决这个问题吗?对我来说,这似乎是一个严重未被重视的领域。IMO的许多调查都可以从ML的功能中受益,但没有消息来源。像这些一样,是两个彼此不相互作用的世界。 到目前为止,我发现了什么: http://civilstat.com/2014/08/statistical-modeling-the-two-cultures-breiman/ 例如,当您的数据来自复杂的样本调查时,我仍然只知道一篇关于如何进行回归树的论文(Toth&Eltinge,2011)。 http://ccsg.isr.umich.edu/index.php/chapters/statistical-analysis-chapter#nine 在最近对150份采样研究论文的荟萃分析中,分析了具有复杂采样设计的多项调查,发现由于无知或对复杂样品设计特征的不正确使用而导致的分析错误非常频繁。 https://www.fhwa.dot.gov/2015datapalooza/presentations/PolicyDev.4_Pierce.pdf 相关的简历问题,但没有一个包含如何解决这个问题的可用答案(要么为否,不是我所要的,要么提出具有误导性的建议): 与复杂调查数据进行匹配分析 带有加权/复杂调查数据的机器学习 复杂调查数据中LASSO之后的交叉验证 复杂调查中逻辑回归的分离? 将多级模型拟合到R中的复杂测量数据

1
(近似)依赖于极值的自变量的任何示例吗?
我正在寻找2个随机变量XXX,的示例,YYY这样 |cor(X,Y)|≈0|cor(X,Y)|≈0\newcommand{\cor}{{\rm cor}}|\cor(X,Y)| \approx 0 但是当考虑分布的尾部时,它们是高度相关的。(我尝试避免尾部的“相关” /“相关”,因为它可能不是线性的)。 大概使用这个: |cor(X′,Y′)|≫0|cor(X′,Y′)|≫0|\cor(X', Y')| \gg 0 其中的条件是的,而的定义与此相同。X′X′X'X>90%X>90%X > 90\%XXXY′Y′Y'

3
为什么在RNN中通过时间反向传播?
在递归神经网络中,通常会向前传播几个时间步骤,“展开”网络,然后在输入序列中向后传播。 为什么不只在序列中的每个步骤之后更新权重?(等效于使用1的截断长度,因此没有展开的空间),这完全消除了消失的梯度问题,大大简化了算法,可能会减少陷入局部极小值的机会,并且最重要的是看起来工作正常。我以这种方式训练了一个模型来生成文本,结果似乎与从BPTT训练后的模型中看到的结果相当。我对此仅感到困惑,因为我所见过的每个有关RNN的教程都说要使用BPTT,几乎就像是正确学习所必需的那样,事实并非如此。 更新:我添加了一个答案

3
β随机变量的反正态CDF遵循什么分布?
假设您定义: X∼Beta(α,β)X∼Beta(α,β)X\sim\mbox{Beta}(\alpha,\beta) Y∼Φ−1(X)Y∼Φ−1(X)Y\sim \Phi^{-1}(X) 其中Φ−1Φ−1\Phi^{-1}是的逆标准正态分布的CDF。 我的问题是:Y是否遵循简单分布,或者可以近似于Y?YYYYYY我问,因为我有一个基于模拟结果强烈怀疑(如下图所示),其YYY收敛为正态分布时,αα\alpha和ββ\beta都很高,但我不知道为什么它会数学。(当然,当α=1;β=1α=1;β=1\alpha=1;\beta=1,XXX将是均匀的,而YYY将是标准法线,但是为什么对于更高的值会成立呢?) 如果确实收敛到法线,那么就αα\alpha和而言,该法线的参数是什么ββ\beta?(我预计平均将Φ−1(αα+β)Φ−1(αα+β)\Phi^{-1}(\frac{\alpha}{\alpha+\beta})因为那是模式的变换,但我不知道标准差)。 (换句话说,这可能会问“ 对于μ和σ的某个方向,Φ(Norm(μ,σ))Φ(Norm(μ,σ))\Phi(\mbox{Norm}(\mu, \sigma))收敛到beta分布吗?”我不确定这是否更容易回答)。μμ\muσσ\sigma 仿真结果 在这里,我展示了为什么我怀疑结果是正常的(因为我无法用数学来支持它)。可以使用和在R中完成模拟。例如,选择较高的参数α = 3000和β = 7000:YYYqnormrnormα=3000α=3000\alpha=3000β=7000β=7000\beta=7000 hist(qnorm(rbeta(5000, 3000, 7000))) 这看起来很正常,qqnorm与夏皮罗-威尔克测试(其中正常是零假设),建议左右为好: qqnorm(qnorm(rbeta(5000, 3000, 7000))) shapiro.test(qnorm(rbeta(5000, 3000, 7000))) #> #> Shapiro-Wilk normality test #> #> data: qnorm(rbeta(5000, 3000, 7000)) #> W = 0.99954, p-value = 0.2838 为了更深入地探讨正态性,我执行了2,000次仿真,每次都模拟 5,000个值,然后执行测试以将其与正常值进行比较。(我选择5K值是因为这是可以处理的最大值,并且可以最大程度地检测出偏离规范的能力)。YYYshapiro.test 如果分布确实是正态分布,我们将期望p值是均匀的(因为null为true)。它们确实接近均匀,表明分布非常接近正态: hist(replicate(2000, shapiro.test(qnorm(rbeta(5000, 3000, …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.