统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
加权数据的两样本T检验
我想执行两个样本的T检验,以测试两个独立样本之间的差异,每个样本都遵循T检验的假设(每个分布都可以假设是独立的,并且与正态分布相同且方差相等) 。基本的两样本T检验的唯一复杂之处在于对数据进行了加权。我使用加权平均值和标准偏差,但是加权N会人为地增加样本的大小,因此会使结果产生偏差。这仅仅是用未加权的Ns代替加权的Ns的情况吗?
12 t-test 


2
NXM列联表的统计测试
我有一个由三组元素组成的数据集,我们称它们为G1,G2和G3。我分析了这些元素的某些特征,并将它们分为“行为” T1,T2和T3 3种类型(我使用聚类分析来完成)。 因此,现在我有了一个3 x 3的列联表,其中三个组中的元素计数按类型划分: | T1 | T2 | T3 | ------+---------+---------+---------+--- G1 | 18 | 15 | 65 | ------+---------+---------+---------+--- G2 | 20 | 10 | 70 | ------+---------+---------+---------+--- G3 | 15 | 55 | 30 | 现在,我可以对R中的这些数据进行Fisher测试 data <- matrix(c(18, 20, 15, 15, 10, 55, 65, …

3
带重量的费舍尔精确检验?
有谁知道费舍尔精确检验的一种变化,它考虑了权重?例如采样权重。 因此,代替通常的2x2交叉表,每个数据点都有一个权重该点的“质量”或“大小”值。 示例数据: A B weight N N 1 N N 3 Y N 1 Y N 2 N Y 6 N Y 7 Y Y 1 Y Y 2 Y Y 3 Y Y 4 然后,费舍尔精确测试使用此2x2交叉表: A\B N Y All N 2 2 4 Y 2 4 6 All …



2
集合的度量指数的无偏估计量?
假设我们有一个设置(可测量并适当地表现良好)S⊆B⊂RnS⊆B⊂RnS\subseteq B\subset\mathbb R^n,其中BBB紧凑。此外,假设我们可以从Lebesgue测度λ (⋅ )的BBB的均匀分布中抽取样本,并且知道测度λ (B )。例如,也许乙是一个盒子[ - Ç ,Ç ] Ñ含有小号。λ(⋅)λ(⋅)\lambda(\cdot)λ(B)λ(B)\lambda(B)BBB[−c,c]n[−c,c]n[-c,c]^nSSS 对于固定α∈Rα∈R\alpha\in\mathbb R,是否有来估计一个简单的无偏方式e−αλ(S)e−αλ(S)e^{-\alpha \lambda(S)}通过均匀采样以点BBB并且如果它们是内部或外部的检查SSS? 由于东西完全不是那么回事的例子,假设我们样本kkk点p1,…,pk∼Uniform(B)p1,…,pk∼Uniform(B)p_1,\ldots,p_k\sim\textrm{Uniform}(B)。然后,我们可以使用蒙特卡洛估计λ(S)≈λ^:=#{pi∈S}kλ(B).λ(S)≈λ^:=#{pi∈S}kλ(B).\lambda(S)\approx \hat\lambda:= \frac{\#\{p_i\in S\}}{k}\lambda(B). 但是,尽管 λ是一个无偏估计λ(小号),我不认为它的情况下ë-α λ是一个无偏估计ë-αλ(小号)。有什么方法可以修改此算法?λ^λ^\hat\lambdaλ(S)λ(S)\lambda(S)e−αλ^e−αλ^e^{-\alpha\hat\lambda}e−αλ(S)e−αλ(S)e^{-\alpha\lambda(S)}

3
基于诊断指标( / AUC /精度/ RMSE等)的值,我的模型是否还好?
我已经安装好模型,并试图了解它是否有好处。我已经计算出推荐的指标进行评估( / AUC /准确性/预测误差等),但不知道如何解释它们。简而言之,如何根据指标判断我的模型是否良好?例如,为0.6是否足以让我继续进行推断或做出科学/商业决策?[R2R2R^2[R2R2R^2 这个问题是有意的,涵盖了会员经常遇到的各种情况;这样的问题可以作为此问题的副本来解决。欢迎进行修改以扩大范围,使其超出此处提到的指标,还有其他答案-尤其是那些提供有关其他类别指标的见解的答案。

2
在贝叶斯推断中,为什么某些项从后验预测中删除?
在Kevin Murphy 对高斯分布的共轭贝叶斯分析中,他写道,后验预测分布是 p (x ∣ D )= ∫p (X | θ )p (θ | d )dθp(x∣D)=∫p(x∣θ)p(θ∣D)dθ p(x \mid D) = \int p(x \mid \theta) p(\theta \mid D) d \theta 其中是适合模型的数据,而是看不见的数据。我不明白的是为什么对的依赖性在积分的第一项中消失了。使用基本的概率规则,我期望:dDDXxxdDD p (a )p (a ∣ b )p (x ∣ D )= ∫p (a ∣ c )p (c )dC= ∫p …

2
为什么0-1损失函数很难处理?
在伊恩·古德费洛(Ian Goodfellow)的深度学习书中,写道 有时,我们实际上关心的损失函数(例如分类错误)并不是可以有效优化的函数。例如,即使对于线性分类器,精确地将期望的0-1损失最小化通常也是棘手的(输入维度上的指数)。在这种情况下,通常通常会优化替代损失函数,该函数充当代理但具有优势。 为什么0-1损失难以解决,或者在输入维度中它如何指数化?


4
是什么导致套索对于特征选择不稳定?
在压缩感知中,有一个定理保证 具有唯一的稀疏解c(有关更多详细信息,请参见附录)。argmin∥c∥1subject to y=Xcargmin‖c‖1subject to y=Xc\text{argmin} \Vert c \Vert_1\\ \text{subject to } y = Xc ccc 套索有类似的定理吗?如果有这样一个定理,那么它不仅可以保证套索的稳定性,而且还可以为套索提供更有意义的解释: 套索可以发现稀疏回归系数向量ccc,该向量用于通过y = Xc生成响应y。yyyy=Xcy=Xcy = Xc 我问这个问题有两个原因: 我认为“套索偏爱稀疏解决方案”并不能解决为什么使用套索进行特征选择的问题,因为我们甚至无法分辨选择特征的优势。 我了解到套索因功能选择不稳定而臭名昭著。在实践中,我们必须运行引导程序样本以评估其稳定性。导致这种不稳定的最关键原因是什么? 附录: 给定XN×M=(x1,⋯,xM)XN×M=(x1,⋯,xM)X_{N \times M} = (x_1, \cdots, x_M)。ccc是ΩΩ\Omega稀疏向量(Ω⩽MΩ⩽M\Omega \leqslant M)。过程y=Xcy=Xcy = Xc生成响应yyy。如果XXX具有\ Omega阶的NSP(零空间属性),ΩΩ\Omega并且X的协方差矩阵的XXX特征值都不接近零,则 argmin∥c∥1subject to y=Xcargmin‖c‖1subject to y=Xc\text{argmin} \Vert c \Vert_1\\ \text{subject to } y …


1
了解负岭回归
我正在寻找有关负脊回归的文献。 总之,它是用负线性岭回归的一般化λλ\lambda的估计公式β^=(X⊤X+λI)−1X⊤y.β^=(X⊤X+λI)−1X⊤y.\hat\beta = ( X^\top X + \lambda I)^{-1} X^\top y.肯定的案例有一个很好的理论:作为损失函数,作为约束,作为贝叶斯先验...但我仅凭上述公式感到对否定版本感到迷惑。它恰好对我正在做的事情有用,但是我无法清楚地解释它。 您是否了解有关负山脊的严肃入门文字?如何解释?


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.