统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
集成学习:为什么模型堆叠有效?
最近,我对模型堆叠作为集成学习的一种形式感兴趣。特别是,我对回归问题进行了一些玩具数据集实验。我基本上已经实现了单个“ 0级”回归器,将每个回归器的输出预测存储为新功能,以供“元回归器”作为其输入,并将此元回归器适应这些新功能(来自该层的预测0个回归指标)。当针对验证集测试元回归器时,我对单个回归器的适度改进感到非常惊讶。 所以,这是我的问题:为什么模型堆叠有效?凭直觉,我希望进行堆叠的模型表现不佳,因为与每个0级模型相比,它的要素表示似乎很差。也就是说,如果我在具有20个特征的数据集上训练3个0级回归变量,并使用这些0级回归变量的预测作为我的元回归变量的输入,这意味着我的元回归变量只有3个特征可供学习。似乎0级回归器用于训练的20种原始功能中编码的信息比元回归器用于训练的3种输出功能要多。


1
为什么中位数的95%CI应该是?
在各种来源中(例如参见此处),给出了以下中位数的置信区间的公式(尤其是在箱须图上画凹口的目的): 95% CImedian=Median±1.57×IQRN−−√95% CImedian=Median±1.57×IQRN 95\%\ CI_{\rm median} = {\rm Median} \pm \frac{1.57\times IQR}{\sqrt{N}} 魔法常数使我发疯,我无法弄清楚它是如何获得的。各种近似值(例如,假设我们的分布是高斯分布且大)都没有任何线索-我得到的常数值不同。1.571.571.57NNN

5
贝叶斯定理的解释适用于乳腺X线摄影阳性结果
我正在尝试将贝叶斯定理的结果应用于经典的乳房X射线照片示例,而乳房X射线照片的扭曲是完美的。 那是, 癌症发生率:.01.01.01 假设患者患有癌症,则乳房X光检查阳性的可能性:1个1个1 假设患者未患癌症,乳房X光检查呈阳性的可能性:.01.01.01 贝叶斯: P(癌症|乳房X线照片+)= 1个 ⋅ 0.01(1 ⋅ 0.01 )+ (0.091 ⋅ 0.99 )1个⋅.01(1个⋅.01)+(.091⋅.99)\dfrac {1 \cdot .01}{(1 \cdot .01) + (.091 \cdot .99)} = .5025=.5025 = .5025 因此,如果人口中有一个随机的人进行乳房X光检查并获得阳性结果,那么他们有50%的机会患上癌症吗?我无法直觉地理解在1%的人口中只有1%的假阳性几率会触发50%的结果。从逻辑上讲,我认为具有很小的假阳性率的完全正确的乳房X线照片会更加准确。

1
在回归设置中,什么时候不能将频繁样本抽样分布解释为贝叶斯后验?
我的实际问题在最后两段中,但是要激发他们: 如果我试图估计遵循具有已知方差的正态分布的随机变量的均值,则我已经读过,在均值上放置均等的先验会导致与似然函数成正比的后验分布。在这些情况下,贝叶斯可信区间与频密者置信区间完全重叠,并且贝叶斯最大值后验估计等于频密者最大似然估计。 在简单的线性回归设置中, Y=Xβ+ϵ,ϵ∼N(0,σ2)Y=Xβ+ϵ,ϵ∼N(0,σ2)Y = \textbf{X}\beta+\epsilon, \hspace{1cm} \epsilon\sim N(0,\sigma^2) 推杆上形成均匀的前和前上逆伽马σ 2与后部小的参数值结果β中号甲P,这将是非常相似的频率论β中号大号ë,而对于后验分布的可靠区间的β | X,它将与最大似然估计值周围的置信区间非常相似。他们不会完全一样,因为之前上σ 2ββ\betaσ2σ2\sigma^2β^MAPβ^MAP\hat\beta^{MAP}β^MLEβ^MLE\hat\beta^{MLE}β|Xβ|X\beta|Xσ2σ2\sigma^2施加的影响小的量,并且如果后估计经由MCMC仿真,将介绍差异的另一来源进行,但围绕贝叶斯置信区间β中号甲P和周围频率论置信区间β中号大号ë将彼此之间非常接近,当然,随着样本数量的增加,随着似然性的影响逐渐占主导,它们应该收敛。β^MAPβ^MAP\hat\beta^{MAP}β^MLEβ^MLE\hat\beta^{MLE} 但是我已经读到,在有些回归情况下,这些近等值不成立。例如,具有随机效应的层次回归或逻辑回归-在我所了解的情况下,没有“良好”的目标或参考先验条件。 所以我的一般问题是-假设我想推断P(β|X)P(β|X)P(\beta|X)并且我没有要合并的先前信息,为什么我不能在这些情况下进行频繁的最大似然估计,并将所得的系数估计和标准误解释为贝叶斯MAP估计和标准差,并隐式地对待这些由先验得出的“后验”估计必须是“无信息的”,而没有试图找到会导致这种后验的先验的明确表述?通常,在回归分析领域中,什么时候可以按照这些原则行事(将似然性当作后验对待),什么时候不行?对于不是基于似然性的频繁性方法(例如准似然方法), 答案是否取决于我的推论目标是系数点估计,还是系数在特定范围内的概率,或预测分布的数量?

2
卷积神经网络中的过滤器和激活图如何连接?
给定层的激活图如何连接到该层的过滤器?我不是在问如何在过滤器和激活图之间进行卷积运算,我是在问这两个具有的连接类型。 例如,假设您要进行完全连接。在给定的层中,您有f个过滤器和n个激活图。您将在下一层获得f * n个激活图,激活图的数量将随每个新层的增加而增加。这是我认为完成的方式。 或者您可以说每个过滤器仅连接到一个激活图。在这种情况下,过滤器的数量将等于激活图的数量,并且每个层将具有相同数量的过滤器和激活图。这是我的网络的当前体系结构,似乎学习得很好。 我感到困惑的主要原因是看网上看到的卷积图。其中一些在过滤器和激活图之间具有“完全连接”,例如- 在第一层中,您有4个激活图,大概有2个过滤器。每个图都与每个过滤器卷积,从而在下一层生成8个图。看起来很棒。 但是,这里的架构对我来说没有意义- 您如何从第一层的6张地图转到第二层的16张地图?我可以想到从6张地图中获取16张地图的方法,但这样做毫无意义。


3
每个相关矩阵都是正定的吗?
我在这里谈论的是Pearson相关矩阵。 我经常听到它说所有相关矩阵都必须是正半定数。我的理解是,正定矩阵必须具有特征值,而正半定矩阵必须具有特征值。这使我认为我的问题可以改写为“相关矩阵的特征值吗?”&gt;0&gt;0> 0≥0≥0\ge 0=0=0= 0 相关矩阵(根据经验数据生成,没有缺失数据)是否可能具有特征值或特征值?如果它是人口相关矩阵呢?=0=0= 0&lt;0&lt;0< 0 我在上面复读约协方差矩阵这个问题是 考虑三个变量,和。它们的协方差矩阵不是正定的,因为存在一个向量(),其中不是正数。XXXYÿYZ=X+Yž=X+ÿZ = X+YM中号Mzžz=(1,1,−1)′=(1个,1个,-1个)′= (1, 1, -1)'z′Mzž′中号žz'Mz 但是,如果我不是使用协方差矩阵对相关矩阵进行计算,则为正。因此,我认为对于相关和协方差矩阵来说情况可能有所不同。z′Mzž′中号žz'Mz 我问的原因是,我被问到了关于stackoverflow的问题。

1
在SVD之前在单词共生矩阵上应用逐点互信息的利弊是什么?
生成单词嵌入的一种方法如下(mirror): 获得一个语料库,例如“我喜欢飞行。我喜欢NLP。我喜欢深度学习。” 从中建立单词共现矩阵: 在上执行SVD ,并保留U 的前列。XXXķķk 子矩阵每一行都是该行表示的单词的单词嵌入(行1 =“ I”,行2 =“ like”,…)。ü1 : | V| ,1:kü1个:|V|,1个:ķU_{1:|V|,1:k} 在第2步和第3步之间,有时会应用逐点相互信息(例如A. Herbelot和EM Vecchi。2015。构建共享世界:映射分布到模型理论语义空间。)在2015年自然语言处理经验方法会议上的发言(葡萄牙里斯本)。 在SVD之前在单词共生矩阵上应用逐点互信息的利弊是什么?

1
衡量工作日内分布的均匀性
我有一个与此问题类似的问题: 如何测量分布的不均匀性? 我在一周中的每一天都有一组概率分布。我想测量每个分布与(1 / 7,1 / 7,...,1/7)的接近程度。 目前,我正在使用上述问题的答案;L2-范数,当分布在一天中的某一天质量为1时,值为1,对于(1 / 7,1 / 7,...,1/7)最小。我线性缩放它,使其在0到1之间,然后将其翻转,使0表示完全不均匀,而1表示完全均匀。 这很好用,但是我有一个问题。它将每个工作日均视为7维空间中的一个维度,因此不考虑天数的接近性;换句话说,即使(1 / 2,1 / 2,0,0,0,0,0)和(1 / 2,0,0,1 / 2,0,0,0)的得分相同尽管从某种意义上说,后者更“分散”和统一,理想情况下应该获得更高的分数。显然增加了复杂性,即天的顺序是循环的。 我该如何改变这种启发式方法来考虑天的临近?



1
引导方法。为什么用“替换”重新采样而不是随机子采样?
近年来,bootstrap方法得到了极大的推广,我也经常使用它,特别是因为背后的原因很直观。 但这是我不明白的一件事。为什么埃夫隆选择通过替换进行重采样,而不是通过随机包含或排除单个观测值来简单地进行二次采样? 我认为随机二次抽样具有非常好的质量,理想地代表了现实生活中的情况,在这种情况下,我们在研究中得到的观察值是假设总体的子集。我没有看到在重采样期间增加观察数的优势。在实际情况下,没有观察到与其他观察相似的情况,尤其是对于复杂的多元情况。

1
带身份链接的OLS与Poisson GLM
我的问题表明我对泊松回归和GLM总体上了解不足。以下是一些虚假数据来说明我的问题: ### some fake data x=c(1:14) y=c(0, 1, 2, 3, 1, 4, 9, 18, 23, 31, 20, 25, 37, 45) 一些返回psuedo-R2的自定义函数: ### functions of pseudo-R2 psuR2 &lt;- function(null.dev, model.dev) { 1 - (model.dev / null.dev)} predR2 &lt;- function(actuals, predicted) { 1 - (sum((actuals - predicted)^2)) / sum((actuals - mean(actuals))^2)} 适合四种模型:OLS,带身份链接的高斯GLM,带日志链接的Poisson …

2
如何通过反向传播训练SVM?
我想知道是否可以使用反向传播训练SVM(例如,将其简化为线性模型)? 目前,我处于障碍之中,因为我只能考虑将分类器的输出编写为 F(X ; θ ,b )= SGN (θ &CenterDot;&X - (b + 1 ))= SGN (克(x ; θ ,b ))f(x;θ,b)=sgn(θ⋅x−(b+1))=sgn(g(x;θ,b)) f(\mathbf{x};\theta,b) = \text{sgn}(\theta\cdot\mathbf{x} - (b+1)) = \text{sgn}(g(\mathbf{x};\theta,b)) 因此,当我们尝试计算“向后传递”(传播错误)时,我们得到 因为的导数是 sgn(x)dsgn(x)∂Ë∂X= ∂Ë∂F(x ; θ ,b )∂F(x ; θ ,b )X= ∂Ë∂F(x ; θ ,b )∂SGN (克(x ; θ ,b ))∂G(x …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.