统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
推导概率密度函数变量的变化?
在书本模式识别和机器学习(公式1.27)中, pÿ(y)= pX(x )∣∣∣dXdÿ∣∣∣= pX(克(y))| G′(y)|pÿ(ÿ)=pX(X)|dXdÿ|=pX(G(ÿ))|G′(ÿ)|p_y(y)=p_x(x) \left | \frac{d x}{d y} \right |=p_x(g(y)) | g'(y) | 其中x=g(y)x=g(y)x=g(y),px(x)px(x)p_x(x),是pdf对应于py(y)py(y)p_y(y)相对于所述变量的变化。 这些书说,这是因为在观察范围内的下降(x,x+δx)(x,x+δx)(x, x + \delta x)会,为小值δxδx\delta x,转化为范围(y,y+δy)(y,y+δy)(y, y + \delta y)。 这是如何正式得出的? 来自Dilip Sarwate的更新 仅当GGg是严格单调递增或递减函数时,结果才成立。 一些小修改以LV Rao的答案 因此,如果gP(是≤ ÿ)= P(克(X)≤ ÿ)= { P(X≤ 克− 1(y)),P(X≥ 克− 1(y)),如果g 单调增加如果g 单调递减P(ÿ≤ÿ)=P(G(X)≤ÿ)={P(X≤G-1(ÿ)),如果 G 单调增加P(X≥G-1(ÿ)),如果 G 单调递减 \begin{equation} …

2
ROC曲线下精度与面积的关系
我为诊断系统构建了ROC曲线。然后非参数地将曲线下的面积估计为AUC = 0.89。当我尝试在最佳阈值设置(最接近点(0,1)的点)上计算精度时,诊断系统的精度为0.8,小于AUC!当我在另一个阈值设置(与最佳阈值相差很远)下检查精度时,我得到的精度等于0.92。是否可以使诊断系统在最佳阈值设置下的准确度低于另一个阈值的准确度,并且也低于曲线下的面积?请参阅所附图片。

1
偏最小二乘,减少秩回归和主成分回归之间有什么联系?
缩减秩回归和主成分回归只是偏最小二乘的特殊情况吗? 本教程(第6页,“目标比较”)指出,当我们在不投影X或Y的情况下进行偏最小二乘时(即“不偏”),相应地,它变成了降低秩回归或主成分回归。 在此SAS文档页面的 “降低的等级回归”和“方法之间的关系”部分中做出了类似的说明。 一个更基本的跟进问题是他们是否具有相似的潜在概率模型。





3
判别分析与逻辑回归
我发现了判别分析的一些优点,对此我也有疑问。所以: 当这些类很好地分开时,逻辑回归的参数估计出乎意料地不稳定。系数可能达到无穷大。LDA不会遭受此问题的困扰。 如果特征数量少并且每个类别中的预测变量的分布 近似正态,则线性判别模型比逻辑回归模型更加稳定。XXX 什么是稳定性,为什么重要?(如果逻辑回归能够很好地完成工作,那么为什么我要关心稳定性?) 当我们有两个以上的响应类时,LDA很流行,因为它还提供了数据的低维视图。 我只是不明白。LDA如何提供低维视图? 如果您可以命名更多利弊,那将是很好的。

2
方差的线性
我认为以下两个公式是正确的: Var(aX)=a2Var(X)Var(aX)=a2Var(X) \mathrm{Var}(aX)=a^2 \mathrm{Var}(X) 而a是一个常数 如果,独立Var(X+Y)=Var(X)+Var(Y)Var(X+Y)=Var(X)+Var(Y) \mathrm{Var}(X + Y)=\mathrm{Var}(X)+\mathrm{Var}(Y) XXXYYY 但是,我不确定以下内容有什么问题: Var(2X)=Var(X+X)=Var(X)+Var(X)Var(2X)=Var(X+X)=Var(X)+Var(X)\mathrm{Var}(2X) = \mathrm{Var}(X+X) = \mathrm{Var}(X) + \mathrm{Var}(X) 不等于,即。22Var(X)22Var(X)2^2 \mathrm{Var}(X)4Var(X)4Var(X)4\mathrm{Var}(X) 如果假设是从总体中抽取的样本,我想我们总是可以假设与其他 s 独立。XXXXXXXXX 那么我的困惑到底出了什么问题?


1
加权随机森林的R包?classwt选项?
我正在尝试使用随机森林来预测极端不平衡的数据集的结果(少数族裔比率仅为1%甚至更低)。因为传统的随机森林算法将总错误率降到最低,而不是特别注意少数类,所以它不能直接应用于不平衡数据。因此,我想为少数群体的错误分类分配高昂的成本(成本敏感型学习)。 我阅读了一些可以在R中使用选项classwt的资料randomForest,但我不知道如何使用它。我们还有其他替代randomForest功能吗?
16 r  random-forest 

1
在统计学习理论中,是否存在过度拟合测试集的问题?
让我们考虑有关对MNIST数据集进行分类的问题。 根据Yann LeCun的MNIST网页,“ Ciresan等” 使用卷积神经网络在MNIST测试集上获得了0.23%的错误率。 让我们将MNIST训练集表示为,将MNIST测试集表示为,将他们使用获得的最终假设设为,并将它们在MNIST测试集上的错误率设为作为。DtrainDtrainD_{train}DtestDtestD_{test}DtrainDtrainD_{train}h1h1h_{1}h1h1h_{1}Etest(h1)=0.0023Etest(h1)=0.0023E_{test}(h_{1}) = 0.0023 在他们看来,由于是从输入空间中随机采样的测试集,而与无关,因此他们可以坚持认为,最终假设的样本外误差性能为由Hoeffding不等式界定 ,其中。DtestDtestD_{test}h1h1h_{1}Eout(h1)Eout(h1)E_{out}(h_{1})P[|Eout(h1)−Etest(h1)|&lt;ϵ|]≥1−2e2ϵ2NtestP[|Eout(h1)−Etest(h1)|&lt;ϵ|]≥1−2e2ϵ2NtesŤ P[|E_{out}(h_{1}) - E_{test}(h_{1})| < \epsilon|] \geq 1 - 2e^{2\epsilon^{2}N_{test}} ñ牛逼Ë 小号ŧ= | d牛逼Ë 小号ŧ|ñŤËsŤ=|dŤËsŤ|N_{test}=|D_{test}| 换句话说,至少为, Ë Ö ù 吨(ħ 1)≤ Ë 吨ë 小号吨(ħ 1)+ √1 - δ1-δ1-\deltaËØ ü Ť(小时1)≤ Ë牛逼Ë 小号ŧ(小时1)+ 12 N牛逼Ë 小号ŧ升Ñ 2δ---------√ËØüŤ(H1)≤ËŤËsŤ(H1)+12ñŤËsŤ升ñ2δE_{out}(h_1) \leq E_{test}(h_1) + \sqrt{{1 \over …

3
分布到底是什么?
我对概率统计不了解,并且希望学习。我看到“分布”一词在不同的上下文中到处使用。 例如,离散随机变量具有“概率分布”。我知道这是什么 连续随机变量具有概率密度函数,则对于,概率密度函数从到的积分是在评估的累积分布函数。x∈Rx∈Rx\in\mathbb{R}−∞−∞-\inftyxxxxxx 显然,至少在谈论连续随机变量时,“分布函数”与“累积分布函数”同义(问题:它们是否总是同义词?)。 然后是许多著名的发行。 分布分布,等等。但是分布到底是什么?它是Γ随机变量的累积分布函数吗?还是Γ随机变量的概率密度函数?ΓΓ\Gammaχ2χ2\chi^2ΓΓ\GammaΓΓ\GammaΓΓ\Gamma 但是,有限数据集的频率分布似乎是直方图。 长话短说:在概率统计中,“分布”一词的定义是什么? 我知道数学中的分布定义(配备归纳极限拓扑的测试函数集合的对偶空间的一个元素),而不是概率和统计。

2
卡方拟合优度检验的事后检验
我正在对三个类别进行卡方拟合优度(GOF)测试,并且特别想测试每个类别中的人口比例是否相等(即每个组中的比例为1/3)的零值: 观察到的数据 组1 组2 组3 总计 686 928 1012 2626 因此,对于此GOF测试,预期计数为2626(1/3)= 875.333,该测试得出的p值非常显着&lt;0.0001。 现在,很明显,第1组与第2组和第3组明显不同,第2组和第3组也不大可能明显不同。但是,如果我确实想对所有这些进行正式测试并能够为每种情况提供p值,那么什么是合适的方法? 我在网上搜索了所有内容,似乎有不同的意见,但没有正式的文档。我想知道是否有文本或经过同行评审的论文可以解决这个问题。 对于我来说,似乎很合理的方法是,根据显着的总体检验,对每对比例的差异进行z检验,并可能对值进行校正(例如,可能是Bonferroni)。αα\alpha

3
为什么足够的统计信息包含计算参数估计值所需的所有信息?
我刚刚开始研究统计信息,但我对直觉性没有一个直观的了解。更准确地说,我无法理解如何证明以下两段是等效的: 大致地,给定一组以未知参数θ为条件的独立相同分布的数据X,足够的统计量是函数T(X),其值包含计算该参数的任何估计所需的所有信息。 如果在给定统计量T(X)的情况下数据X的条件概率分布不依赖于参数θ,则统计量T(X)足以满足基础参数θ的需要。 (我引用了足够的统计信息中的引号) 尽管我理解第二条语句,并且我可以使用分解定理来说明给定的统计量是否足够,但是我不明白为什么具有这样一个属性的统计量还具有“包含计算任何数据所需的所有信息”的属性。参数估计”。我不是要寻找正式的证明,无论如何这将有助于我的理解,我想对为什么这两个陈述是等效的进行直观的解释。 回顾一下,我的问题是:为什么两个陈述是相等的?有人可以为他们的等效性提供直观的解释吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.