统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
如何计算Fisher标准权重?
我正在研究模式识别和机器学习,并且遇到了以下问题。 考虑一个具有相同先验概率的两类分类问题P(D1)=P(D2)=12P(D1)=P(D2)=12P(D_1)=P(D_2)= \frac{1}{2} 以及每个类中实例的分布 p(x|D1)=N([00],[2001]),p(x|D1)=N([00],[2001]), p(x|D_1)= {\cal N} \left( \begin{bmatrix} 0 \\0 \end{bmatrix}, \begin{bmatrix} 2 & 0 \\ 0 & 1 \end{bmatrix} \right), p(x|D2)=N([44],[1001]).p(x|D2)=N([44],[1001]). p(x|D_2)= {\cal N} \left( \begin{bmatrix} 4 \\ 4 \end{bmatrix}, \begin{bmatrix} 1 & 0 \\ 0 & 1 \end{bmatrix} \right). 如何计算Fisher标准权重? 更新2:我的书提供的计算权重为: 。W=[−43−29]W=[−43−29]W=\begin{bmatrix} \frac{-4}{3} \\ \frac{-2}{9} \end{bmatrix} …

3
为什么增强方法对异常值敏感
我发现有许多文章指出增强方法对异常值很敏感,但没有文章解释原因。 以我的经验,离群值对于任何机器学习算法都是不利的,但是为什么提升方法特别敏感? 下列算法如何在对异常值的敏感性方面进行排名:增强树,随机森林,神经网络,SVM和简单回归方法(例如逻辑回归)?


2
置信区间实际上是否可以衡量参数估计的不确定性?
我正在阅读统计学家威廉·布里格斯(William Briggs)的博客文章,以下说法至少使我感兴趣。 你是怎么做的? 什么是置信区间?当然,这是一个方程式,它将为您提供数据间隔。旨在提供对参数估计值不确定性的度量。现在,严格按照频率论者的理论(甚至可以假设它是真实的),您可以说的关于现有CI的唯一一件事就是参数的真实值位于其中或不存在。这是重言式,因此始终如此。因此,CI根本无法提供不确定性的度量:实际上,计算不确定性是无用的。 链接:http://wmbriggs.com/post/3169/

1
方差分析:测试多组正常性的假设,每组样本很少
假定以下情况: 我们有大量(例如20个),小组规模较小(例如n = 3)。我注意到,如果我从均匀分布生成值,则即使误差分布均匀,残差也将看起来近似正态。以下R代码演示了此行为: n.group = 200 n.per.group = 3 x <- runif(n.group * n.per.group) gr <- as.factor(rep(1:n.group, each = n.per.group)) means <- tapply(x, gr, mean) x.res <- x - means[gr] hist(x.res) 如果我查看三个一组的样本的残差,则很明显会出现这种情况: [R1个= x1个− 平均值(x 1 ,x 2 ,x 3 )= x 1 − x1个+ x2+ x33= 23X1个− x2− …

2
MCMC什么时候有用?
我在理解MCMC方法在哪种情况下实际有用时遇到了麻烦。我正在阅读Kruschke的书中的一个玩具示例“做贝叶斯数据分析:R和BUGS教程”。 到目前为止,我的理解是我们需要一个与成正比的目标分布,p(D|θ)p(θ)p(D|θ)p(θ)p(D|\theta)p(\theta)以便获得的样本P(θ|D)P(θ|D)P(\theta|D)。但是,在我看来,一旦我们有了p(D|θ)p(θ)p(D|θ)p(θ)p(D|\theta)p(\theta)我们只需要对分布进行归一化就可以得到后验,并且归一化因子很容易在数值上找到。那么在什么情况下不可能呢?
12 mcmc 

2
使用行增强的Ridge惩罚GLM?
我已经读过可以通过简单地将数据行添加到原始数据矩阵中来实现岭回归,其中每行使用0表示因变量,而平方根或使用0表示自变量。然后为每个自变量添加额外的一行。kkk 我想知道是否有可能针对所有情况(包括逻辑回归或其他GLM)得出证明。

3
连续变量的条件概率
假设随机变量遵循具有参数0至10的连续均匀分布(即û 〜ù(0 ,10 ))üUUü〜ù(0 ,10 )U∼U(0,10)U \sim \rm{U}(0,10) 现在,我们将A表示 = 5的事件和B表示U等于5或6的事件。根据我的理解,这两个事件的发生概率均为零。üUUüUU555 现在,如果我们考虑到计算,我们不能使用条件法律 P (一|乙) = P (一∩ 乙)P(A | B )P(A|B)P(A|B),因为P(B)等于零。然而,我的直觉告诉我,P(一|乙)=1/2。P(A | B) = P(甲∩ 乙)P(B )P(A|B)=P(A∩B)P(B)P\left( {A|B} \right) = \frac{{P\left( {A \cap B} \right)}}{{P\left( B \right)}}P(B )P(B)P(B)P(甲|乙)= 1 / 2P(A|B)=1/2P(A|B) = 1/2


1
k均值|| 又名可扩展K均值++
Bahman Bahmani等。引入了k-means ||,这是k-means ++的更快版本。 此算法取自其论文的第4页,Bahmani,B.,Moseley,B.,Vattani,A.,Kumar,R.,&Vassilvitskii,S.(2012)。可扩展的k-均值++。VLDB基金会论文集,5(7),622-633。 不幸的是,我不理解那些花哨的希腊字母,因此我需要一些帮助以了解其工作原理。据我了解,该算法是k-means ++的改进版本,它使用过采样来减少迭代次数:k-means ++必须迭代次,其中k是所需簇的数量。ķkkķkk 通过一个有关k-means ++如何工作的具体示例,我得到了很好的解释,因此我将再次使用相同的示例。 例 我有以下数据集: (7,1),(3,4),(1,5),(5,8),(1,3),(7,8),(8,2),(5,9),(8 ,0) (所需簇数)k = 3k=3k = 3 (过采样因子)ℓ = 2ℓ=2\ell = 2 我开始进行计算,但是不确定是否正确,也不知道第2步,第4步或第5步。 步骤1:从X随机地均匀采样一个点C←C←\mathcal{C} \leftarrowXXX 比方说,所述第一质心是(同k均值++)(8,0)(8,0)(8,0) 步骤2:ψ←ϕX(C)ψ←ϕX(C)\psi \leftarrow \phi_X(\mathcal{C}) 不知道 第三步: d2(x,C)=[2,41,74,73,58,65,4,90]d2(x,C)=[2,41,74,73,58,65,4,90]d^2(x, \mathcal{C}) = [2, 41, 74, 73, 58, 65, 4, 90] 我们计算到每个点最近的中心的平方距离。在这种情况下,我们只有一个中心,到目前为止,。(8,0)(8,0)(8,0) ℓ⋅d2(x,C)=[4,81,148,146,116,130,8,180]ℓ⋅d2(x,C)=[4,81,148,146,116,130,8,180]\ell \cdot d^2(x, \mathcal{C}) = …

1
千斤顶有当代用途吗?
问题是: 自举优于捆绑。但是,我想知道是否存在套刀技术是唯一或至少可行的方法来表征参数估计值的不确定性。此外,在实际情况下,相对于自举,斜切是如何产生偏见/不准确的,在开发更复杂的引导程序之前,斜切结果能否提供初步的见解? 某些情况: 朋友正在使用黑盒机器学习算法(MaxEnt)对“仅在场”或“仅在场”的地理数据进行分类。一般模型评估通常使用交叉验证和ROC曲线进行。但是,她正在使用模型的输出来导出模型输出的单个数字描述,并希望该数字周围有一个置信区间;折磨似乎是表征此值不确定性的一种合理方法。引导似乎没有意义,因为每个数据点都是地图上的唯一位置,无法通过替换进行重新采样。建模程序本身也许能够最终提供她所需要的东西。但是,我对一般情况是否有用/什么时候使您感兴趣。


1
男性和女性国际象棋选手-分布尾部的预期差异
我对2009年这篇论文的发现感兴趣: 为什么(最好的)女人擅长下象棋?知识领域的参与率和性别差异 本文试图解释为什么最好的国际象棋选手似乎比最好的女选手好得多(女选手仅占世界上最好的1000名选手的2%)。具体来说,他们声称最好的国际象棋棋手和最好的国际象棋棋手之间的巨大差异完全由两个事实解释: 男性下棋的人数是女性下棋人数的15倍 我们完全出于统计原因,预计该比率在分布的两端会加剧。引用本文: 即使两组的平均值(均值)和变异性(sd)相同,绩效最高的个人也更有可能来自较大的人群。两组之间的差异越大,两组中表现最好的组织之间的差异也就越大 然后再次, 这项研究表明,男女象棋选手的顶级表现差异很大,这在很大程度上可以归因于一个简单的统计事实-在较大的人群中发现了更多的极限值。 因此,根据作者的说法,如果只有6%的国际象棋棋手是女性,那么我们期望他们在前1000名中仅占2%,因此不需要其他有关生物学差异或社会偏见的解释。 我的问题 我无法理解这样一个想法,即人口规模的微小差异会在分布的极端加剧。特别是,此反例出了什么问题: 一月份出生的棋手约占十分之一。因此,它们只占所有棋手的一小部分。通过这些统计方法,我们希望他们在最高级别上的代表性不足-可能只有30名顶尖球员中有1名会在一月份出生。但是,当然,您可以对每个月应用相同的逻辑,最终得出一个荒谬的结论。 在我看来,如果将人群分为两组,那么在各个方面,您都期望拥有相同比例的表演者。 由于我与已发表论文的结果矛盾,我想我必须要问-我做错了什么?

1
带有偏移的Poisson随机效应模型中的超分散和建模替代方案
使用主题内实验对来自实验研究的计数数据进行建模时,我遇到了许多实际问题。我简要描述了实验,数据以及到目前为止所做的事情,然后提出了我的问题。 依次向受访者展示了四部不同的电影。在每部电影之后,我们进行了一次采访,我们对RQ感兴趣的某些语句(预测计数变量)的出现次数进行了计数。我们还记录了可​​能出现的最大次数(编码单位;偏移量变量)。另外,电影的几个特征以连续的比例进行了测量,其中一个具有因果关系,即电影特征对陈述数量的影响的因果假设,而其他则为控制(预测变量)。 到目前为止采用的建模策略如下: 估计一个随机效应泊松模型,其中因果变量用作协变量,其他变量用作控制协变量。该模型的偏移量等于“ log(单位)”(编码单位)。跨对象产生随机效果(特定于电影的计数嵌套在对象中)。我们发现因果假设得到了确认(因果变量的系数)。在估算中,我们在R中使用了lme4包,特别是功能glmer。 现在我有以下问题。泊松回归中的一个常见问题是过度分散。我知道可以通过使用负二项式回归并评估其色散参数是否可以改善简单泊松模型的模型拟合性来进行测试。但是,我不知道如何在随机效果的情况下这样做。 在我的情况下,我应该如何测试过度分散?我在简单的泊松/负二项式回归(无随机效应)中测试了超分散,我知道该如何拟合。该测试表明存在过度分散。但是,由于这些模型未考虑聚类,因此我认为此测试不正确。此外,我不确定偏移量在过度分散测试中的作用。 是否存在负二项式随机效应回归模型之类的东西,该如何在R中拟合呢? 您是否对我应该尝试使用数据的替代模型有任何建议,即考虑重复测量结构,计数变量和暴露(编码单位)?

1
默认的lme4优化器需要对高维数据进行大量迭代
TL; DR:lme4优化似乎是线性在默认情况下,模型参数数量,并且是这样慢比等效的glm与组虚拟变量模型。我有什么可以加快速度的吗? 我正在尝试适应一个相当大的分层logit模型(约5万行,100列,50组)。将正常的logit模型拟合到数据(带有用于组的虚拟变量)可以很好地工作,但是层次模型似乎被卡住了:第一个优化阶段可以很好地完成,但是第二个阶段需要进行很多迭代,而无需进行任何更改并且不停止。 编辑:我怀疑问题主要是我有这么多的参数,因为当我尝试将其设置maxfn为较低的值时会给出警告: Warning message: In commonArgs(par, fn, control, environment()) : maxfun < 10 * length(par)^2 is not recommended. 但是,参数估计在优化过程中完全没有改变,因此我仍然对执行该操作感到困惑。当我尝试设置maxfn优化器控件(尽管有警告)时,它似乎在完成优化后挂起。 这是一些重现随机数据问题的代码: library(lme4) set.seed(1) SIZE <- 50000 NGRP <- 50 NCOL <- 100 test.case <- data.frame(i=1:SIZE) test.case[["grouping"]] <- sample(NGRP, size=SIZE, replace=TRUE, prob=1/(1:NGRP)) test.case[["y"]] <- sample(c(0, 1), size=SIZE, replace=TRUE, prob=c(0.05, 0.95)) …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.