统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
为什么特征选择对于分类任务很重要?
我正在学习功能选择。我明白了为什么它对于模型构建非常重要和有用。但是,让我们专注于监督学习(分类)任务。为什么特征选择对于分类任务很重要? 我看到许多关于特征选择及其在监督学习中的使用的文献,但这使我感到困惑。功能选择与确定要丢弃的功能有关。直观地讲,丢弃某些功能似乎是自欺欺人的:它是在丢弃信息。似乎抛出信息应该无济于事。 即使删除某些功能确实有帮助,但如果我们抛弃某些功能,然后将其余功能馈入有监督的学习算法中,为什么我们需要自己做,而不是让有监督的学习算法来处理呢?如果某个功能没有帮助,难道没有任何像样的监督学习算法会隐式地发现这一点并学习不使用该功能的模型吗? 因此,从直觉上讲,我希望功能选择是毫无意义的练习,永远无济于事,有时甚至会受伤。但是,事实是如此广泛地使用和撰写,使我怀疑我的直觉是错误的。在进行监督学习时,任何人都可以提供任何直觉来说明为什么功能选择有用且重要吗?为什么它可以提高机器学习的性能?是否取决于我使用的分类器?

1
从性能上考虑词嵌入算法
我试图将大约6000万个短语嵌入向量空间,然后计算它们之间的余弦相似度。我一直在使用sklearn's CountVectorizer和一个自定义的生成标记器的函数,该函数会产生字母和二字组。事实证明,要获得有意义的表示,我必须允许大量列,行数成线性。这会导致矩阵稀疏,从而导致性能下降。如果只有大约10,000列,那还不错,我认为这对于单词嵌入来说是相当合理的。 我正在考虑尝试使用Google,word2vec因为我敢肯定它会产生低得多的尺寸和更密集的嵌入。但是在此之前,还有其他嵌入值得一看吗?关键要求是能够扩展大约6000万个短语(行)。 我对词嵌入领域还很陌生,因此任何建议都将对您有所帮助。 我还应该补充一点,我已经在使用奇异值分解来提高性能。

3
检测共线性的不同方法的优点是什么?
我想检测共线性是否是我的OLS回归中的问题。我知道方差膨胀因子和条件指数是两种常用的度量,但是我发现很难找到每种方法的优劣或分数应该是确定的任何东西。 指出执行方法和/或适当分数的突出来源将非常有用。 在“是否有理由偏爱多重共线性的特定度量?”时提出了类似的问题。但是我理想的是可以引用一个参考。

1
从地理坐标计算内核密度估计的正确方法是什么?
我必须从经度和纬度坐标列表中计算2d内核密度估计值(kde)。但是,纬度一度与经度一度的距离是不同的,这意味着各个内核将是椭圆形的,尤其是该点距赤道越远。 在我的情况下,这些点都足够接近,因此将它们转换为平坦的地球不会引起很多问题。但是,我仍然对在不正确的情况下应该如何正确处理感到好奇。

2
使用部分“未知”数据进行分类
假设我想学习一个分类器,该分类器将数字向量作为输入,并给类标签作为输出。我的训练数据由大量输入输出对组成。 但是,当我要测试一些新数据时,该数据通常仅部分完成。例如,如果输入向量的长度为100,则可能仅给30个元素提供值,其余的为“未知”。 例如,考虑在已知图像部分被遮挡的情况下进行图像识别。或考虑已知部分数据已损坏的一般意义上的分类。在所有情况下,我都确切知道数据向量中的哪些元素是未知部分。 我想知道如何学习适用于此类数据的分类器?我可以将“未知”元素设置为随机数,但是鉴于已知元素通常比已知元素更多,所以这听起来不是一个好的解决方案。或者,我可以将训练数据中的元素随机更改为“未知”,并使用这些而不是完整的数据进行训练,但这可能需要详尽地采样已知和未知元素的所有组合。 我特别在考虑神经网络,但是我对其他分类器持开放态度。 有任何想法吗?谢谢!

1
似然比检验的“理想”统计特性是什么?
我正在阅读一篇文章,其方法完全基于似然比检验。作者说,针对单方面选择的LR测试是UMP。他继续声称 “ ...即使无法证明[LR测试]的功能最强大,LR测试通常也具有理想的统计特性。“ 我想知道这里的统计属性是什么意思。鉴于作者提到的是顺带一提,我认为它们是统计学家中的常识。 到目前为止,我设法找到的唯一理想的属性是(在某些规则性条件下)的渐近卡方分布,其中是LR比率。λλ− 2 日志λ−2log⁡λ-2 \log \lambdaλλ\lambda 我还要感谢对经典文本的引用,在该文本中可以阅读有关这些所需属性的信息。


2
高斯过程中的观测合并
我正在使用高斯过程(GP)进行回归。 在我的问题中,两个或多个数据点相对于长度彼此接近是很常见的问题的规模。此外,观察结果可能会非常嘈杂。为了加快计算速度并提高测量精度,只要我关心更大范围的预测,合并/积分彼此接近的点的群集就显得很自然。x⃗ (1),x⃗ (2),…x→(1),x→(2),…\vec{x}^{(1)},\vec{x}^{(2)},\ldots 我想知道什么是快速但半原则的方法。 如果两个数据点完全重叠,则,并且观察噪声(即似然性)是高斯分布,可能是异方差但已知,处理的自然方式似乎是将它们合并到一个数据点中:x⃗ (1)=x⃗ (2)x→(1)=x→(2)\vec{x}^{(1)} = \vec{x}^{(2)} x¯⃗ ≡x⃗ (k)x¯→≡x→(k)\vec{\bar{x}} \equiv \vec{x}^{(k)},其中。k=1,2k=1,2k=1,2 观测值是观测值平均值,以其相对精度加权:。y¯y¯\bar{y}y(1),y(2)y(1),y(2)y^{(1)}, y^{(2)}y¯=σ2y(x⃗ (2))σ2y(x⃗ (1))+σ2y(x⃗ (2))y(1)+σ2y(x⃗ (1))σ2y(x⃗ (1))+σ2y(x⃗ (2))y(2)y¯=σy2(x→(2))σy2(x→(1))+σy2(x→(2))y(1)+σy2(x→(1))σy2(x→(1))+σy2(x→(2))y(2)\bar{y} = \frac{\sigma_y^2(\vec{x}^{(2)})}{\sigma_y^2(\vec{x}^{(1)}) + \sigma_y^2(\vec{x}^{(2)})} y^{(1)} + \frac{\sigma_y^2(\vec{x}^{(1)})}{\sigma_y^2(\vec{x}^{(1)}) + \sigma_y^2(\vec{x}^{(2)})} y^{(2)} 与观察相关的噪声等于:。σ2y(x¯)=σ2y(x⃗ (1))σ2y(x⃗ (2))σ2y(x⃗ (1))+σ2y(x⃗ (2))σy2(x¯)=σy2(x→(1))σy2(x→(2))σy2(x→(1))+σy2(x→(2))\sigma_y^2(\bar{x}) = \frac{\sigma_y^2(\vec{x}^{(1)}) \sigma_y^2(\vec{x}^{(2)})}{\sigma_y^2(\vec{x}^{(1)}) + \sigma_y^2(\vec{x}^{(2)})} 但是,如何合并两个相近但不重叠的点呢? 我认为应该仍然是两个位置的加权平均值,再次使用相对可靠性。理由是质量中心论证(即,将非常精确的观察视为一堆不太精确的观察)。x¯⃗ x¯→\vec{\bar{x}} 对于与上述公式相同。y¯y¯\bar{y} 对于与观测相关的噪声,我想知道是否除了上面的公式之外,还应该在噪声中添加一个校正项,因为我正在移动数据点。本质上,我会得到与和有关的不确定性增加(分别是信号方差和协方差函数的长度尺度)。我不确定这个术语的形式,但是在给定协方差函数的情况下,我对如何计算它有一些初步的想法。σ2fσf2\sigma_f^2ℓ2ℓ2\ell^2 在继续之前,我想知道那里是否已经有东西。如果这似乎是明智的处理方法,或者有更好的快速方法。 我在文献中能找到的最接近的东西是这篇论文:E. …

1
统计人员在实际应用工作中是否使用Jeffreys先验?
当我在研究生统计推断课程中了解Jeffreys的先驱时,我的教授们听起来听起来像是有趣的,主要是出于历史原因,而不是因为有人会使用它。然后,当我进行贝叶斯数据分析时,我们从未被要求使用杰弗里斯的先验知识。有人实际使用这些吗?如果是这样(如果不是),为什么或为什么不呢?为什么有些统计学家不重视它?

4
如何使用概率论选择退出公共汽车队列还是留在那里?
我已经思考了一段时间了,由于我不太精通概率论,所以我认为这可能是一个问这个问题的好地方。在长途公共交通中,这是我想到的。 假设您在汽车站,并且知道将来(白天)肯定会有一辆(或多辆)公共汽车,但您不知道确切的时间。您想象公交车将在五分钟内到达的可能性。因此,您等待五分钟。但是公共汽车没有到。现在该概率是否小于或大于您想象的原始概率? 问题是,如果您使用过去来预测未来,也许您对公交车的到来不会很乐观。但是也许您还可以认为,这实际上使事件更有可能发生:由于公交车尚未到达,因此当天的可用时间更少,因此发生的可能性更高。 想一想一天的最后五分钟。您整天都去过那里,没有公共汽车来过。因此,仅从过去来看,您无法预测公交车将在接下来的五分钟内到达。但是,由于您确定公交车会在一天结束之前到达,并且一天只有五分钟,因此您可以100%确保公交车会在五分钟内到达。 因此,问题是,如果我要计算概率并退出队列,应该使用哪种方法?这是因为有时我退出,然后突然公交车到了,但是有时我又等待又等待,而公交车没有来。还是整个问题都是胡说八道,那简直是随机的?

2
按家庭划分的错误界限:重用关于独立问题的不同研究的数据集是否会导致多个测试问题?
如果一组研究人员对给定的数据集执行多项(假设)检验,则有大量文献断言,即使检验是独立的,他们也应使用某种形式的校正进行多重检验(Bonferroni等)。我的问题是:这种逻辑是否适用于多个团队在同一数据集上测试假设?换句话说,家庭误差计算的障碍是什么?研究人员应该被限制为仅将数据集用于勘探吗?

1
PyMC3中的贝叶斯模型选择
我正在使用PyMC3在数据上运行贝叶斯模型。 我是贝叶斯建模的新手,但是根据一些博客文章,该站点的Wikipedia和QA所述,使用贝叶斯因子和BIC准则来选择最能代表我的数据的模型似乎是一种有效的方法(我的数据)。 要计算贝叶斯因子,我需要要比较的模型的相对可能性。这可能会让我感到困惑,但是我认为有两种方法可以获取可能性(如果我错了,请纠正我): 模型简单时的代数方式:请参阅Wikipedia示例贝叶斯因子页面 数字方式:这就是PyMC3与MCMC算法的区别 如何获得可能性并比较PyMC3中的模型?我发现model.logp根据doc是“对数概率密度函数”的方法。我可以用它来获得可能性吗? 奖励问题:比较两个模型时,会计算两个似然比。如果要比较多个模型会怎样? 一个具体的PyMC3示例将非常有帮助!

1
如果总体平均值已知,则估算总体方差
我知道我们用来估计群体的方差。我记得可汗学院的一段视频,根据直觉,我们的估计均值可能与实际均值因此距离实际上会更大,因此我们除以除以(而不是)获得更大的价值,从而得到更好的估计。 我记得读书的地方,我如果我有实际人口平均不需要这个修正μ代替 ˉ X。所以我估计11个n − 1∑一世(x一世− x¯)21个ñ-1个∑一世(X一世-X¯)2\frac1{n-1}\sum\limits_i(x_i - \bar{x})^2 ñ - 1个ñX一世− x¯X一世-X¯x_i - \bar{x}n − 1ñ-1个n-1ññnμμ\muX¯X¯\bar{x} ,但我无法找到它了。是真的吗 有人可以给我指点吗?1个ñ∑一世(x一世- μ )21个ñ∑一世(X一世-μ)2\frac1{n}\sum\limits_i(x_i - \mu)^2
11 variance  sample 

1
GLM中有多少个分布?
我在教科书中确定了多个位置,其中用5种分布(即Gamma,Gaussian,Binomial,Inverse Gaussian和Poisson)描述了GLM。R中的族函数也对此进行了举例说明。 有时,我会遇到对GLM的引用,其中包括其他发行版(示例)。有人可以解释为什么这5个特殊或始终在GLM中出现,但有时其他情况如此吗? 根据我到目前为止的了解,指数族中的GLM分布都适合以下形式: 其中是色散参数,而是规范参数。φθf(y;θ,ϕ)=exp{yθ−b(θ)ϕ+c(y,ϕ)}f(y;θ,ϕ)=exp⁡{yθ−b(θ)ϕ+c(y,ϕ)}f(y;\theta,\phi)=\exp\left\{\frac{y\theta-b(\theta)}{\phi}+c(y,\phi)\right\}ϕϕ\phiθθ\theta 不能对任何发行版进行转换以使其适合GLM吗?

2
贝叶斯logit模型-直观的解释?
我必须承认,我以前从未在本科或研究生班上听说过该词。 Logistic回归为贝叶斯是什么意思?我正在寻找从常规物流到贝叶斯物流的过渡解释,类似于以下内容: 这是线性回归模型的方程:E(y)=β0+β1x1+...+βnxnË(ÿ)=β0+β1个X1个+。。。+βñXñE(y) = \beta_0 + \beta_1x_1 + ... + \beta_nx_n。 这是逻辑回归模型中的方程式:。当y是绝对值时完成此操作。ln(E(y)1−E(y))=β0+β1x1+...+βnxnln⁡(Ë(ÿ)1个-Ë(ÿ))=β0+β1个X1个+。。。+βñXñ\ln(\frac{E(y)}{1-E(y)}) = \beta_0 + \beta_1x_1 + ... + \beta_nx_n 我们要做的是将更改为。E(y)Ë(ÿ)E(y)ln(E(y)1−E(y))ln⁡(Ë(ÿ)1个-Ë(ÿ))\ln(\frac{E(y)}{1-E(y)}) 那么在贝叶斯逻辑回归中对逻辑回归模型做了什么?我猜想这与方程式无关。 这本书的预览似乎定义了,但我不太了解。这些先前的可能性是什么?是什么?有人可以用另一种方式解释本书的这一部分或贝叶斯逻辑模型吗?αα\alpha 注意:这是我之前问过的,但回答得不是很好。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.