统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
报告随机森林的训练错误有哪些措施?
我目前正在使用randomForestR中的程序包为分类问题拟合随机森林,并且不确定如何报告这些模型的训练错误。 当我使用通过命令获得的预测来计算时,我的训练误差接近0%: predict(model, data=X_train) X_train训练数据在哪里。 在回答一个相关问题时,我读到一个人应该使用袋外(OOB)训练误差作为随机森林的训练误差度量。该数量是通过使用以下命令获得的预测计算得出的: predict(model) 在这种情况下,OOB训练误差非常接近平均10-CV测试误差,即11%。 我想知道: 报告OOB训练错误作为随机森林的训练错误度量通常被接受吗? 传统的训练误差测量值人为地低是真的吗? 如果传统的训练误差度量是人为地降低的,那么我可以比较哪两个度量来检查RF是否过拟合?

5
内核SVM:我想对映射到更高维度的特征空间有一个直观的了解,以及这如何使线性分离成为可能
我试图了解内核SVM背后的直觉。现在,我了解了线性SVM的工作原理,通过决策线可以最大程度地分割数据。我也了解将数据移植到高维空间的原理,以及如何使在新空间中找到线性决策线变得更容易。我不了解的是如何使用内核将数据点投影到这个新空间。 我对内核的了解是,它有效地表示了两个数据点之间的“相似性”。但这与预测有何关系?



1
如果研究中验证准确性高而测试准确性低怎么办?
我对机器学习研究中的验证有一个特定的问题。 众所周知,机器学习机制要求研究人员在训练数据上训练他们的模型,通过验证集从候选模型中进行选择,并报告测试集的准确性。在非常严格的研究中,测试集只能使用一次。但是,它永远不可能成为研究方案,因为在发表(甚至提交)论文之前,我们必须提高性能,直到测试准确性优于最新结果为止。 现在出现了问题。假设50%是最先进的结果,而我的模型通常可以达到50--51的精度,平均而言更好。 但是,我的最佳验证准确性(52%)产生了非常低的测试准确性,例如49%。然后,如果我无法进一步提高验证acc,则必须报告49%的总体性能,这对我来说是没有希望的。这确实使我无法研究问题,但是对我的同伴来说并不重要,因为他们没有看到52%的符合率,我认为这是一个离群值。 那么,人们通常在研究中如何做? ps k-fold验证没有帮助,因为相同的情况仍然可能发生。

1
两计数之差的意义
有没有一种方法可以确定时间1处的道路交通事故计数与时间2处的交通事故计数之间的差异是否显着不同? 我发现了不同的方法来确定不同时间的观察组之间的差异(例如比较泊松均值),而不是仅比较两个计数。还是尝试无效?任何建议或指示,将不胜感激。我很高兴跟进自己。

3
样条曲线与高斯过程回归
我知道高斯过程回归(GPR)是使用样条曲线拟合弹性非线性模型的替代方法。我想知道哪种情况比另一种情况更合适,尤其是在贝叶斯回归框架中。 我已经看过使用样条线,平滑样条线和高斯过程仿真器的优点/缺点是什么?但这篇文章中似乎没有关于GPR的任何内容。


1
PCA是否需要任何数量的方差以进行以后的分析?
我有一个包含11个变量的数据集,并进行了PCA(正交)处理以减少数据量。根据我对主题和碎石图的了解,确定要保留的组成部分数量对我来说很明显,两个主要组成部分(PC)足以解释数据,而其余组成部分仅提供较少的信息。 具有并行分析的Scree图:观察到的特征值(绿色)和基于100次仿真的模拟特征值(红色)。Scree图建议使用3台PC,而并行测试仅建议使用前两台PC。 如您所见,前两台PC只能捕获到48%的方差。 由前两台PC在第一平面上绘制的观测结果显示,使用分层聚类聚类(HAC)和K均值聚类,得到了三个不同的聚类。事实证明这3个类别与所讨论的问题非常相关,并且也与其他发现一致。因此,除了仅捕获了48%的方差这一事实以外,其他一切都很好。 我的两位审稿人中的一位说:一位不能太依赖于这些发现,因为只能解释48%的方差,而且这个方差小于要求。 问 是否有任何需要多大的变化应该由PCA捕捉到有效的价值?它不依赖于所使用的领域知识和方法吗?有人可以仅根据所解释的方差的值来判断整个分析的优点吗? 笔记 数据是通过一种称为实时定量聚合酶链反应(RT-qPCR)的分子生物学中非常敏感的方法测量的11个基因变量。 使用R进行分析。 数据分析人员基于他们在微阵列分析,化学计量学,光谱分析等领域中解决现实生活问题的个人经验,给出了很多答案。 请考虑为您的回答提供尽可能多的参考。
15 variance  pca 

1
CNN如何避免消失的梯度问题
我已经阅读了很多有关卷积神经网络的文章,并且想知道它们如何避免消失的梯度问题。我知道深度信任网络会堆叠单级自动编码器或其他经过预先训练的浅层网络,因此可以避免此问题,但是我不知道如何在CNN中避免这种情况。 根据维基百科: “尽管存在上述“消失的梯度问题”,但GPU的优越处理能力使普通的反向传播对于多层多层前馈神经网络来说是可行的。” 我不明白为什么GPU处理会消除此问题?

4
卷积神经网络需要多少数据?
如果我有一个卷积神经网络(CNN),它具有大约1000000个参数,则需要多少训练数据(假设我正在进行随机梯度下降)?有什么经验法则吗? 附加说明:当我执行随机梯度下降(例如,1次迭代使用64个色块)时,在〜10000次迭代之后,分类器的精度可以达到大致的稳定值)。这是否意味着不需要太多数据?就像100k-1000k的数据一样。

3
为KNN选择最佳K
我执行了5倍CV选择KNN的最佳K。似乎K越大,误差越小... 抱歉,我没有图例,但不同的颜色代表不同的尝试。总共有5个,似乎它们之间几乎没有差异。当K变大时,误差似乎总是会减小。那么如何选择最佳K?在这里K = 3会是一个很好的选择,因为在K = 3之后图形会趋于平稳吗?

2
方差不等的t检验中非整数自由度的解释
SPSS t检验程序在比较2个独立均值时报告2次分析,其中1次假设均等方差,1次假设均等方差。假设方差相等时的自由度(df)始终是整数值(等于n-2)。如果未假定等方差,则df为非整数(例如11.467),并且不接近n-2。我正在寻求对用于计算这些非整数df的逻辑和方法的解释。

4
潜在功能的含义?
我试图理解推荐系统的矩阵分解模型,并且我总是读“潜在特征”,但这意味着什么?我知道功能对训练数据集意味着什么,但我无法理解潜在功能的概念。我所能找到的有关该主题的每篇论文都太浅了。 编辑: 如果您至少可以指出一些指导我想法的论文。

3
在实践中计算Kullback-Leibler散度?
我使用KL散度作为2 之间差异的量度。米。f 。p.m.f.p.m.f.p.m.f. PPP和QQQ。 DKL(P||Q)=∑i=1Nln(PiQi)PiDKL(P||Q)=∑i=1Nln⁡(PiQi)PiD_{KL}(P||Q) = \sum_{i=1}^N \ln \left( \frac{P_i}{Q_i} \right) P_i =−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=-\sum P(X_i)ln\left(Q(X_i)\right) + \sum P(X_i)ln\left(P(X_i)\right) 如果P(Xi)=0P(Xi)=0P(X_i)=0 那么我们可以轻松地计算出 P(Xi)ln(Q(Xi))=0P(Xi)ln(Q(Xi))=0P(X_i)ln\left(Q(X_i)\right)=0 P(Xi)ln(P(Xi))=0P(Xi)ln(P(Xi))=0P(X_i)ln\left(P(X_i)\right)=0 但是,如果且Q (X i)= 0,则 如何计算P (X i)l n ( Q (X i))P(Xi)≠0P(Xi)≠0P(X_i)\ne0Q(Xi)=0Q(Xi)=0Q(X_i)=0P(Xi)ln(Q(Xi))P(Xi)ln(Q(Xi))P(X_i)ln\left(Q(X_i)\right)

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.