统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
如何将样条曲线拟合到包含值和一阶/二阶导数的数据?
我有一个数据集,其中包含一些位置,速度和加速度的测量值。全部来自同一“运行”。我可以构造一个线性系统,并将多项式拟合所有这些度量。 但是我可以用样条线做同样的事情吗?这样做的“ R”方式是什么? 这是一些我想拟合的模拟数据: f <- function(x) 2+x-0.5*x^2+rnorm(length(x), mean=0, sd=0.1) df <- function(x) 1-x+rnorm(length(x), mean=0, sd=0.3) ddf <- function(x) -1+rnorm(length(x), mean=0, sd=0.6) x_f <- runif(5, 0, 5) x_df <- runif(8, 3, 8) x_ddf <- runif(10, 4, 9) data <- data.frame(type=rep('f'), x=x_f, y=f(x_f)) data <- rbind(data, data.frame(type=rep('df'), x=x_df, y=df(x_df))) data <- …

5
随机森林和决策树算法
随机森林是遵循装袋概念的决策树的集合。当我们从一个决策树移动到下一个决策树时,从上一个决策树中学到的信息将如何前进到下一个决策树? 因为,按照我的理解,没有什么像训练过的模型那样可以为每个决策树创建然后在下一个决策树开始从错误分类的错误中学习之前加载的。 那么它是怎样工作的?

1
REML是否存在贝叶斯解释?
是否存在REML的贝叶斯解释?根据我的直觉,REML与所谓的经验贝叶斯估计程序非常相似,我想知道是否已经证明了某种渐近等价性(例如,在某种合适的先验条件下)。例如,经验贝叶斯和REML都似乎是面对麻烦参数而采取的“折衷”估计方法。 主要是,我通过这个问题寻求的是这种观点倾向于产生的高级洞察力。当然,如果不能出于某种原因对REML 进行这种性质的论证,那么对为什么这样做的解释也将提供令人欢迎的见解!

3
比较两个分类器的(均值)ROC AUC,敏感性和特异性的统计显着性(p值)
我有一个包含100个案例和两个分类器的测试集。 我为这两个分类器生成了预测并计算了ROC AUC,敏感性和特异性。 问题1:如何计算p值,以检查一个总分(ROC AUC,敏感性,特异性)是否明显优于另一个? 现在,对于100个案例的相同测试集,我为每种案例分配了不同且独立的功能。这是因为我的功能是固定的,但主观的,并且由多(5)个主题提供。 因此,我针对我的测试集的5个“版本”再次评估了两个分类器,并获得了5个ROC AUC,5个敏感性和5个特异性。然后,我计算了两个分类器的5个主题的每个性能指标的平均值(平均ROC AUC,平均灵敏度和平均特异性)。 问题2:如何计算p值,以检查一个均值(平均ROC AUC,平均敏感性,平均特异性)是否明显好于另一个? 最好提供一些示例python(最好)或MatLab代码的答案。

1
Oracle Inequality:基本而言
我正在阅读一篇使用oracle不等式证明某事的论文,但我什至无法理解它甚至试图做些什么。当我在线搜索有关“ Oracle不等式”时,一些消息源将我引向了文章“ Candes,Emmanuel J.'通过Oracle不等式的现代统计估计”。可以在这里找到https://statweb.stanford.edu/~candes/papers/NonlinearEstimation.pdf。但是这本书对我来说似乎太重了,我认为我缺少一些先决条件。 我的问题是:您如何解释非数学专业(包括工程师)的Oracle不平等?其次,在尝试学习上述书籍之类的东西之前,您将如何推荐他们去研究先决条件/主题。 我强烈建议在高维统计方面有具体把握和丰富经验的人来回答这个问题。

1
我们为什么要关心MA过程是否可逆?
我很难理解为什么我们要关心MA过程是否可逆。 如果我错了,请纠正我,但我可以理解为什么我们关心AR进程是否是因果关系的,也就是说,如果我们可以“重写它”,可以说是某些参数和白噪声的总和-即移动平均过程。如果是这样,我们可以很容易地看到AR过程是因果的。 但是,我很难理解为什么我们要通过显示可逆性来表示是否可以将MA流程表示为AR流程。我不太了解我们为什么在乎。 任何见识都会很棒。

1
训练与测试错误差距及其与过拟合的关系:调解相互矛盾的建议
关于如何处理火车与测试错误的比较,似乎存在相互矛盾的建议,尤其是当两者之间存在差距时。在我看来,似乎有两种流派。我想了解如何调和两者(或了解我在这里缺少的内容)。 思想#1:仅培训和测试集性能之间的差距并不表示过拟合 首先,(在这里也进行了讨论:训练和测试错误比较如何指示过度拟合?),仅火车和测试集之间的差异就不能表明过度拟合的想法。这与我在例如集成树方法方面的实践经验相吻合,在集成方法中,即使在基于交叉验证的超参数调整之后,训练误差和测试误差之间的差距仍会保持较大。但是(无论模型类型如何)只要您不会验证错误,就可以了。至少,这就是想法。 思想#2:当您看到培训和测试性能之间存在差距时:做一些可以防止过度拟合的事情 但是,您会从非常好的来源中看到一些建议,这些建议表明训练误差和测试误差之间的差距表明过度拟合。这是一个示例:Andrew Ng的“深度学习的要点”演讲(精彩演讲)https://www.youtube.com/watch?v=F1ka6a13S9I在大约48:00的时间戳上,他绘制了流程图表示“如果火车设置误差很小,而火车-dev设置误差很大,则应该添加正则化,获取更多数据或更改模型架构” ...这都是您可能要采取的应对过度拟合的措施。 带我去... :我在这里想念什么吗?这是特定于模型的经验法则吗(通常更简单的模型似乎在训练和测试之间的差距较小)?还是仅仅存在两种不同的思想流派?

2
如何实现2D中的空间缺失?
这参考了论文《使用卷积网络进行有效对象本地化》,据我了解,辍学是在2D中实现的。 从Keras阅读有关如何实现Spatial 2D Dropout的代码后,基本上实现了形状为[batch_size,1,1,num_channels]的随机二进制掩码。但是,此空间2D Dropout对形状为[batch_size,height,width,num_channels]的输入卷积块究竟做了什么? 我目前的猜测是,对于每个像素,如果像素的任何层/通道具有负值,则该一个像素的整个通道将默认为零。它是否正确? 但是,如果我的猜测是正确的,那么如何使用与原始输入块的尺寸完全相同的形状[batch_size,height,width,num_channels]的二进制掩码会产生通常的按元素丢弃(这是根据tensorflow的原始dropout实现将二进制掩码的形状设置为输入的形状)?因为这意味着如果conv块中的任何像素为负,则整个conv块将默认为0。这是我不太了解的令人困惑的部分。

1
深度神经网络中的灵敏度分析
在回答一个已经回答的问题之后(从单层前馈网络提取权重重要性),我正在寻找关于神经网络中输入相关性的推论。 考虑到一个深层网络,通过从感兴趣的输出节点向后遍历各层来重建输入的重要性可能很困难或很耗时,我想知道在进行神经网络的敏感性分析时是否存在一些理论框架,基本上改变了一个输入并考虑感兴趣的输出节点如何变化。 在神经网络中是否存在执行某种敏感性分析的规范方法? 如果有的话,我真的很欢迎一些Python代码这样做

1
NumPy如何解决不确定系统的最小二乘问题?
假设我们有形状为(2,5)的X和形状为(2,)的 y 这有效: np.linalg.lstsq(X, y) 我们希望只有在X的形状为(N,5)且N> = 5的情况下,此方法才起作用。 我们确实获得了预期的5倍权重,但是该问题如何解决? 就像我们有2个方程和5个未知数吗? numpy如何解决这个问题? 它必须执行类似插值的操作才能创建更多的人工方程式吗?

3
为什么高阳性峰度对于假设检验有问题?
我听说过(抱歉,我无法提供到文本的链接,有人告诉我)对于正确的假设检验和置信区间,残差的高正峰度可能会成问题(因此存在统计推断问题)。这是真的吗?如果是这样,为什么?残差的高正峰度是否不表示大部分残差都接近零均值,因此存在的残差较小?(如果您有答案,请尝试在数学方面不多的情况下给出答案,因为我不太喜欢数学)。


3
在Logistic回归中用WoE(证据权重)替换变量
这是我的一些同事遵循的有关实践或方法的问题。在建立逻辑回归模型时,我已经看到人们用各自的证据权重(WoE)代替了分类变量(或分类的连续变量)。据说这样做是为了在回归变量和因变量之间建立单调关系。现在,据我了解,一旦建立了模型,方程式中的变量就不是数据集中的变量。相反,方程式中的变量现在在隔离因变量时就显得很重要或很重要。 我的问题是:我们现在如何解释模型或模型系数?例如,对于以下等式: 日志( p1 − p) =β0+ β1个X1个log⁡(p1−p)=β0+β1x1 \log\bigg(\frac{p}{1-p}\bigg) = \beta_0 + \beta_1x_1 我们可以说, 是奇数的比率为在可变增加1个单位相对增加X 1。经验值(β1个)exp⁡(β1)\exp(\beta_1) X1个x1x_1 但是,如果将变量替换为其WoE,则解释将更改为:变量的重要性/重量增加1单位时,奇数比的相对增加 我已经在互联网上看到了这种做法,但是没有一个地方找到这个问题的答案。来自该社区本身的此链接与某个类似的查询相关,其中有人写道: WoE与优势比的自然对数显示线性关系,优势比是对数回归中的因变量。因此,当我们使用WoE而不是变量的实际值时,逻辑回归中不会出现模型错误指定的问题。 但是我仍然没有得到解释。请帮助我了解我所缺少的。

4
带有延迟和时间序列的多元线性回归之间的“机械”区别是什么?
我是商业和经济学专业的毕业生,目前正在攻读数据工程硕士学位。在研究线性回归(LR)然后进行时间序列分析(TS)时,我想到了一个问题。为什么要创建一种全新的方法,即时间序列(ARIMA),而不是使用多元线性回归并向其添加滞后变量(使用ACF和PACF确定滞后的顺序)?所以老师建议我写一篇关于这个问题的文章。我不会徒劳地寻求帮助,所以我做了关于该主题的研究。 我已经知道使用LR时,如果违反了高斯-马尔可夫假设,则OLS回归是不正确的,并且在使用时间序列数据(自相关等)时会发生这种情况。(与此有关的另一个问题是,一个通用汽车假设是自变量应该是正态分布的?还是仅以自变量为条件的因变量?) 我也知道,当使用分布式滞后回归(这是我在这里提出的建议)并使用OLS估计参数时,变量之间的多重共线性可能(显然)会出现,因此估计将是错误的。 在关于TS和LR的类似帖子中,@ IrishStat说: ...回归模型是传递函数模型的一种特殊情况,也称为动态回归模型或XARMAX模型。重点是在时间序列中进行模型识别,即适当的差异,适当的X滞后,适当的ARIMA结构,适当的未确定的确定性结构的识别,例如脉冲,水平移动,本地时间趋势,季节性脉冲和合并必须考虑参数变化或误差变化。 (我也在Autobox中阅读了他关于Box Jenkins vs LR的论文。)但这仍然不能解决我的问题(或者至少没有为我澄清RL和TS的不同机制)。 显然,即使存在滞后变量,OLS也会出现问题,而且效率不高也不正确,但是如果使用最大可能性,这些问题是否还会持续存在?我已经读过ARIMA是通过最大似然估计的,因此,如果使用ML而不是OLS估计带有滞后的LR,它是否会产生“正确”的系数(让我们假设还包括滞后误差项,例如阶次MA) q)。 简而言之,是OLS问题吗?应用ML是否解决了问题?

1
贝叶斯套索vs钉和板
问题:在变量选择上使用一个优先于另一个的优点/缺点是什么? 假设我有可能性: 其中I可以把任一先验之一: 或: 瓦特我〜π δ 0 + (1 - π )Ñ(0 ,100 )ÿ〜ñ(Xw ^ ,σ2一世)y∼N(Xw,σ2I)y\sim\mathcal{N}(Xw,\sigma^2I)w ^ 我〜EXP (- λ | W ^ 我|)wi∼πδ0+(1−π)N(0,100)π=0.9,wi∼πδ0+(1−π)N(0,100)π=0.9, w_i\sim \pi\delta_0+(1-\pi)\mathcal{N}(0,100)\\ \pi=0.9\,, wi∼exp(−λ|wi|)λ∼Γ(1,1).wi∼exp⁡(−λ|wi|)λ∼Γ(1,1). w_i\sim \exp(-\lambda|w_i|)\\ \lambda \sim \Gamma(1,1)\,. 我用来强调大多数权重为零,并在上加一个伽玛来选择'regularizing'参数。λπ=0.9π=0.9\pi=0.9λλ\lambda 但是,我的教授一直坚持认为套索版本会“缩小”系数,实际上并没有进行适当的变量选择,即相关参数甚至都过度缩小。 由于使用贝叶斯变换,我个人觉得实现套索版本更容易。实际上,有效地使用的稀疏贝叶斯学习论文甚至提供了稀疏解决方案。1|wi|1|wi|\frac{1}{|w_i|}

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.