统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
帕兰蒂尔(Palantir)的亚洲歧视案:概率是如何计算的?
我读了这篇有关Palantir案的文章,该案涉及劳动部指责他们歧视亚洲人。有谁知道他们从哪里获得这些概率估计值的? 我在项目(a)中得不到1/741。 (a)对于QA工程师职位,Palantir从730多名合格的申请人(其中约77%是亚洲人)中聘用了6名非亚洲人申请者,并且仅雇用了一名亚洲人申请者。OFCCP计算出的不利影响超过了三个标准偏差。根据机会发生此结果的可能性约为741。 (b)在软件工程师职位中,Palantir雇用了1,160多名合格的申请者,其中大约85%是亚洲人,Palantir雇用了14名非亚洲人申请者,仅雇用了11名亚洲人申请者。OFCCP计算出的不利影响超过了五个标准偏差。该结果根据偶然发生的可能性约为340万。 (c)对于QA工程师实习生职位,Palantir雇用了130多名合格的申请人(其中约73%是亚洲人)聘用了17名非亚洲人申请者,仅雇用了4名亚洲人申请者。OFCCP计算出的不利影响超过了六个标准偏差。根据机会发生此结果的可能性约为十亿分之一。

2
给定两个线性回归模型,哪种模型效果更好?
我在学院上过机器学习课程。在其中一项测验中,有人问了这个问题。 模型1:y=θx+ϵy=θx+ϵ y = \theta x + \epsilon 模型2:y=θx+θ2x+ϵy=θx+θ2x+ϵ y = \theta x + \theta^2 x + \epsilon 以上哪个模型更适合数据?(假设数据可以使用线性回归建模) 正确的答案(根据教授)是,两个模型的性能都一样好。但是我相信第一个模型会更合适。 这就是我回答背后的原因。第二个模型,其可以被重写为,α = θ + θ 2将不一样的第一模型。α事实上是一个抛物线,因此具有一个最小值(- 0.25在这种情况下)。因此,第一模型中的θ的范围大于第二模型中的α的范围。因此,如果数据是这样的,最适合的有坡度小于- 0.25,所述第二模式将非常差相比于第一个作为执行。但是,如果最佳拟合的斜率大于αx+ϵαx+ϵ \alpha x + \epsilon α=θ+θ2α=θ+θ2\alpha = \theta + \theta^2αα\alpha−0.25−0.25 -0.25 θθ \theta αα \alpha −0.25−0.25-0.25,两个模型的性能相同。−0.25−0.25-0.25 那么第一个比较好,还是两者完全一样?


3
模式识别任务中最先进的集成学习算法?
这个问题的结构如下:首先,我提供整体学习的概念,进一步提供模式识别任务的列表,然后给出整体学习算法的示例,最后介绍我的问题。那些不需要所有补充信息的人可能只是看标题,直接回答我的问题。 什么是整体学习? 根据维基百科的文章: 在统计和机器学习中,集成方法使用多种学习算法来获得比单独从任何组成学习算法中获得的更好的预测性能。与通常是无限的统计力学中的统计集合不同,机器学习集合仅指的是一组有限的替代模型的具体有限集合,但通常允许在这些替代模型之间存在更灵活的结构。 模式识别任务的示例: 光学字符识别 条码识别 车牌识别 人脸检测 语音识别 影像辨识 文件分类 集成学习算法的示例: 以下用于PR任务的集成学习算法(根据Wiki): 集成学习算法(将多种学习算法结合在一起的监督元算法): Boosting(主要用于减少偏见的机器学习集成元算法,以及在监督学习中的差异,以及将弱学习者转换为强学习者的一系列机器学习算法) Bootstrap聚合(“ 装袋 ”)(一种机器学习集成元算法,旨在提高统计分类和回归中使用的机器学习算法的稳定性和准确性)。 集合平均(创建多个模型并将其组合以产生所需输出的过程,而不是仅创建一个模型。通常,一组模型的性能要优于任何单个模型,因为模型的各种错误会“平均化”。 ) 专家混合,专家分层混合 不同的实现 神经网络的集合(一组神经网络模型,通过对各个模型的结果求平均值来进行决策)。 随机森林(一种用于分类,回归和其他任务的整体学习方法,通过在训练时构造大量决策树并输出作为个体的类(分类)或均值预测(回归)模式的类来进行操作树木)。 AdaBoost(将其他学习算法(“弱学习者”)的输出合并为一个加权总和,该总和代表增强分类器的最终输出)。 另外: 使用一个神经网络组合不同分类器的方法 胜任范围法 我的问题 哪种集成学习算法被认为是当今最先进的,并且在企业和组织中实际用于实践中(用于面部检测,车牌识别,光学字符识别等)?应该使用集成学习算法来提高识别精度并导致更好的计算效率。但是,现实中的事情会这样吗? 哪种集成方法可能在模式识别任务中显示出更好的分类准确性和性能?也许,某些方法现在已经过时,或者已经证明无效。由于某些新算法的优势,现在可能不再使用集成方法了。那些在该领域有经验或在该领域有足够知识的人,您能帮助澄清问题吗?

1
训练神经网络时有多少训练示例太少了?
我是一个初学者,试图整理我的第一个项目。我有一个歌曲分类项目,但是由于要手动标记,因此我只能合理地组合大约1000首歌曲或60个小时的音乐。 我将按几个班级进行分类,因此一个班级可能在训练集中只有50-100首歌曲-这似乎太少了!是否有一般的经验法则来训练一个神经网络需要多少数据才能发挥作用? 编辑:我正在考虑使用香草LSTM。输入要素的尺寸为39,输出尺寸为6,我对隐藏层尺寸的首次尝试将是100。

1
诸如加权相关之类的东西?
我收到了一些有趣的数据,其中涉及最受欢迎的音乐艺术家,按地点划分为大约200个国会区。我想看看是否有可能针对某人的音乐偏好来对其进行投票,并确定该人是“像民主党人一样听”还是“像共和党人一样听”。(自然这很轻松,但是数据中确实存在熵!) 我有大约100位艺术家的数据,以及过去三个选举周期中每个地区共和党人和民主党人的平均投票百分比。因此,我对每位艺术家进行了相关分析,以了解哪些听众与民主党人的投票份额成比例最不均衡。对于任何给定的艺术家,这些相关性从大约-0.3到0.3之间变化,中间的很多值几乎没有或没有预测能力。 我有两个问题:首先,每个地区的溪流总数差异很大。现在,我正在将每个地区(例如,碧昂斯)中所有流的百分比与为民主党人投票的百分比相关联。但是,一个地区的总流量可能为数百万,而另一个地区的总流量则为10万。我需要以某种方式加权相关性来解决这个问题吗? 其次,我很好奇如何将这些相关性组合成关于用户政治的综合猜测。假设我选取了绝对相关值最高(正值和负值)的20位艺术家,每个方向上的十位艺术家,然后调查用户对他或她的喜欢程度。因此,我对每位艺术家都投了赞成票或反对票,并加上了所有20个值与政治的相关性。是否存在将这些相关性组合为单个估计的标准方法?(我在想类似《纽约时报》著名的方言测验,它将测验 25个问题的区域概率结合到热点图中。但是在这种情况下,我只需要一个单一的值来了解民主党或共和党人在音乐上的品味如何。 谢谢!

1
样本相关系数是总体相关系数的无偏估计量吗?
这是真的,是一个无偏估计ρ X ,ÿ?也就是说,ë [ - [R X ,ÿ ] = ρ X ,ÿ?RX,YRX,YR_{X,Y}ρX,YρX,Y\rho_{X,Y}E[RX,Y]=ρX,Y?E[RX,Y]=ρX,Y?\mathbf{E}\left[R_{X,Y}\right]=\rho_{X,Y}? 如果没有,什么是一个无偏估计?(也许有一个标准的无偏估计器被使用?而且,它类似于无偏样本方差,我们可以简单地进行调整,将有偏样本方差乘以nρX,YρX,Y\rho_{X,Y}?)nn−1nn−1\frac{n}{n-1} 人口相关系数被定义为同时将样品相关系数被定义为- [RX,ÿ=Σ Ñ 我= 1(X我- ˉ X)(Ý我- ˉ ÿ)ρX,Y=E[(X−μX)(Y−μY)]E[(X−μX)2]−−−−−−−−−−−−√E[(Y−μY)2]−−−−−−−−−−−−√,ρX,Y=E[(X−μX)(Y−μY)]E[(X−μX)2]E[(Y−μY)2],\rho_{X,Y}=\frac{\mathbf{E}\left[\left(X-\mu_{X}\right)\left(Y-\mu_{Y}\right)\right]}{\sqrt{\mathbf{E}\left[\left(X-\mu_{X}\right)^{2}\right]}\sqrt{\mathbf{E}\left[\left(Y-\mu_{Y}\right)^{2}\right]}},RX,Y=∑ni=1(Xi−X¯)(Yi−Y¯)∑ni=1(Xi−X¯)2−−−−−−−−−−−−−√∑ni=1(Yi−Y¯)2−−−−−−−−−−−−√.RX,Y=∑i=1n(Xi−X¯)(Yi−Y¯)∑i=1n(Xi−X¯)2∑i=1n(Yi−Y¯)2.R_{X,Y}=\frac{\sum_{i=1}^{n}\left(X_{i}-\bar{X}\right)\left(Y_{i}-\bar{Y}\right)}{\sqrt{\sum_{i=1}^{n}\left(X_{i}-\bar{X}\right)^{2}}\sqrt{\sum_{i=1}^{n}\left(Y_{i}-\bar{Y}\right)^{2}}}.

2
您能用方程式而不是列联表来解释辛普森悖论吗?
我可能对辛普森的悖论并不清楚。我非正式地知道,对所有可能水平的因子A进行分组的响应Y1的平均值都可以高于对所有水平A的响应Y2的平均值,即使每个水平A(每个组)的Y1平均值为始终小于Y2的相应平均值。我已经阅读了示例,但是每次看到示例时我仍然感到惊讶,这可能是因为我对特定示例的学习不够好:我很难归纳它们。我学得最好,并且宁愿看到公式中的解释。您能否解释依赖方程而不是计数表的悖论? 另外,我认为令我惊讶的原因是,我可能会不知不觉地对涉及悖论的平均值做出一些假设,但总体上可能并不正确。也许我忘了按每组样本的数量来加权?但是然后,我想看到一个方程式,该方程式向我显示,如果我按每个组中的样本数对每个组的平均值加权,则总平均值的估计会更准确,因为(如果是真的)这并不明显对我而言 天真的,我认为当我有更多样本时,的估计值E[Y1]E[Y1]\mathbf{E}[Y_1]具有较低的标准误差,而与加权无关。

2
哈密​​尔顿蒙特卡洛
有人可以解释汉密尔顿蒙特卡罗方法背后的主要思想吗?在哪种情况下,它们会比马尔可夫链蒙特卡罗方法产生更好的结果?
14 bayesian  mcmc  hmc 

1
Jeffreys先验多个参数
在某些情况下,前一个完整的多维模型的杰弗里被generaly视为不足,这是例如的情况下: (其中, ε 〜Ñ (0 ,σ 2),具有 μ和 σ未知),其中事先下面是首选(与全杰弗瑞斯现有 π (μ ,σ )α σ - 2): p (μ ,σ )= π (μ )·&π (σ )α σ - 1yi=μ+εi,yi=μ+εi, y_i=\mu + \varepsilon_i \, , ε∼N(0,σ2)ε∼N(0,σ2)\varepsilon \sim N(0,\sigma^2)μμ\muσσ\sigmaπ(μ,σ)∝σ−2π(μ,σ)∝σ−2\pi(\mu,\sigma)\propto \sigma^{-2} 其中 π (μ )是保持 σ固定时(以及类似的 p (σ ))获得的Jeffreys先验值。当在单独的组中处理 σ和 μ时,该先验与参考先验重合。p(μ,σ)=π(μ)⋅π(σ)∝σ−1,p(μ,σ)=π(μ)⋅π(σ)∝σ−1, p(\mu,\sigma) = \pi(\mu) …

2
MCMC的性能基准
是否有大规模的MCMC方法研究在一组测试密度上比较了几种不同算法的性能?我想到的是与Rios和Sahinidis的论文(2013)相同的东西,该论文将大量无衍生的黑盒优化器在几种测试函数上进行了全面比较。 对于MCMC,可以通过例如每个密度评估的有效样本数(ESS)或其他一些适当的指标来评估性能。 一些评论: 我理解性能将在很大程度上取决于目标pdf的细节,但是对于优化而言,类似的参数(可能不相同)成立,尽管如此,仍有大量基准测试功能,套件,竞赛,论文等用于基准测试优化。算法。 同样,MCMC与优化的不同之处还在于,需要更多的用户关注和调整。但是,现在有几种MCMC方法几乎不需要调整:在老化阶段,采样过程中适应的方法,或演化多个交互链并使用的多状态(也称为ensemble)方法(例如Emcee)。来自其他链条的信息以指导抽样。 我对标准方法与多状态(又称为合奏)方法之间的比较特别感兴趣。有关多状态的定义,请参阅MacKay的书的 30.6节: 在多状态方法中,多个参数向量被保留;它们在大都会和吉布斯等举动下各自发展;向量之间也存在相互作用。XX\textbf{x} 这个问题起源于这里。 更新资料 对于一个有趣采取多态又名集成方法,请参阅本博客文章由鲍勃·卡彭特格尔曼的博客,我的评论指这CV职位。

4
为什么
注意:SSTSSTSST =总和的平方和,SSESSESSE =误差平方和,SSRSSRSSR =回归平方和。标题中的等式通常写为: ∑我=1ñ(y一世-ÿ¯)2= ∑我= 1ñ(y一世- ÿ^一世)2+ ∑我= 1ñ(y^一世- ÿ¯)2∑一世=1个ñ(ÿ一世-ÿ¯)2=∑一世=1个ñ(ÿ一世-ÿ^一世)2+∑一世=1个ñ(ÿ^一世-ÿ¯)2\sum_{i=1}^n (y_i-\bar y)^2=\sum_{i=1}^n (y_i-\hat y_i)^2+\sum_{i=1}^n (\hat y_i-\bar y)^2 问题很简单,但我正在寻找一个直观的解释。直观地说,在我看来,像会更有意义。例如,假设点X 我已对应的y值ÿ 我 = 5和ÿ我 = 3,其中ÿ我是关于回归线的对应点。还假定对于该数据集的平均值y值是ˉ Ŷ小号小号Ť≥S小号Ë+SSRSST≥SSE+SSRSST\geq SSE+SSRxixix_iyi=5yi=5y_i=5y^i=3y^i=3\hat y_i=3y^iy^i\hat y_i。那么对于这个特定点我, Sy¯=0y¯=0\bar y=0,而小号小号Ë = (5 - 3 )2 = 2 2 = 4和小号小号- [R = (3 - 0 )2 = 3 2 …

1
受限制的最大似然比小于
此问题处理线性模型的特定版本中的受限最大似然(REML)估计,即: Y=X(α)β+ϵ,ϵ∼Nn(0,Σ(α)),Y=X(α)β+ϵ,ϵ∼Nn(0,Σ(α)), Y = X(\alpha)\beta + \epsilon, \\ \epsilon\sim N_n(0, \Sigma(\alpha)), 其中为(Ñ × p)矩阵由参数化α ∈ [R ķ,因为是Σ (α )。β是令人讨厌的参数的未知向量;兴趣是在估计α,我们有ķ ≤ p « Ñ。通过最大可能性估计模型没有问题,但是我想使用REML。众所周知,参见例如LaMotte的,即似然甲' ÿ,其中阿是任何半正交矩阵,使得X(α)X(α)X(\alpha)n×pn×pn \times pα∈Rkα∈Rk\alpha \in \mathbb R^kΣ(α)Σ(α)\Sigma(\alpha)ββ\betaαα\alphak≤p≪nk≤p≪nk\leq p\ll nA′YA′YA'YAAA可以写成A′X=0A′X=0A'X=0 LREML(α∣Y)∝|X′X|1/2|Σ|−1/2|X′Σ−1X|−1/2exp{−12r′Σ−1r},r=(I−X(X′Σ−1X)+X′Σ−1)Y,LREML(α∣Y)∝|X′X|1/2|Σ|−1/2|X′Σ−1X|−1/2exp⁡{−12r′Σ−1r},r=(I−X(X′Σ−1X)+X′Σ−1)Y, L_{\text{REML}}(\alpha\mid Y) \propto\vert X'X\vert^{1/2} \vert \Sigma\vert^{-1/2}\vert X'\Sigma^{-1}X\vert^{-1/2}\exp\left\{-\frac{1}{2} r'\Sigma^{-1}r \right\}, \\ r = (I - X(X'\Sigma^{-1}X)^+X'\Sigma^{-1})Y, 当为完整列等级时XXX。 我的问题是,对于某些完全合理且科学有趣的,矩阵X (α …

2
如何平滑数据并强制单调性
我有一些要平滑的数据,以使平滑点单调递减。我的数据急剧下降,然后开始稳定。这是使用R的示例 df <- data.frame(x=1:10, y=c(100,41,22,10,6,7,2,1,3,1)) ggplot(df, aes(x=x, y=y))+geom_line() 我可以使用什么好的平滑技术?另外,如果我可以强制第一个平滑点接近观察点,那就太好了。

2
机器学习中的能量最小化是什么?
我正在阅读有关计算机视觉中不适定问题的优化的信息,并且遇到了以下有关Wikipedia的优化的解释。我不明白的是,为什么他们在计算机视觉中将这种优化称为“ 能量最小化 ”? 优化问题可以通过以下方式表示: 给定:函数从某些集合A到实数f:A→Rf:A→Rf: A \to RAAA 寻求:元件在甲使得˚F (X 0)≤ ˚F (X )对于所有X中阿 ( “最小化”)或使得˚F (X 0)≥ ˚F (X )对于所有X中阿 (”最大化”)。x0x0x_0AAAf(x0)≤f(x)f(x0)≤f(x)f(x_0) ≤ f(x)xxxAAAf(x0)≥f(x)f(x0)≥f(x)f(x_0) ≥ f(x)xxxAAA 这种表述称为优化问题或数学编程问题(该术语与计算机编程不直接相关,但仍在线性编程中使用,例如,请参见下面的历史记录)。在这个通用框架中可以模拟许多现实和理论问题。在物理学和计算机视觉领域中,使用该技术提出的问题可能将该技术称为能量最小化,说到函数的值代表正在建模的系统的能量。fff

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.