统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

8
“把手”图的替代图形
在我的研究领域中,一种流行的数据显示方式是将条形图与“把手”组合使用。例如, 根据作者的不同,“把手”在标准误差和标准偏差之间交替显示。通常,每个“条”的样本大小都非常小-大约六个。 这些图似乎在生物科学中特别受欢迎-例如,请参阅BMC Biology第3卷的前几篇论文。 那么,您将如何呈现这些数据? 为什么我不喜欢这些情节 我个人不喜欢这些情节。 当样本量较小时,为什么不显示单个数据点呢? 显示的是sd还是se?没有人同意使用哪种。 为什么要使用酒吧。数据通常不会从0开始,但是图表的第一遍显示确实如此。 图表无法说明数据的范围或样本大小。 R脚本 这是我用来生成绘图的R代码。这样,您可以(如果需要)使用相同的数据。 #Generate the data set.seed(1) names = c("A1", "A2", "A3", "B1", "B2", "B3", "C1", "C2", "C3") prevs = c(38, 37, 31, 31, 29, 26, 40, 32, 39) n=6; se = numeric(length(prevs)) for(i in 1:length(prevs)) se[i] = sd(rnorm(n, prevs, …

4
为什么我们需要一个估计量来保持一致?
我认为,我已经理解了一致估计量的数学定义。如果我错了纠正我: WnWnW_n如果则 W n是的一致估计量θθ\theta∀ϵ>0∀ϵ>0\forall \epsilon>0 limn→∞P(|Wn−θ|>ϵ)=0,∀θ∈Θlimn→∞P(|Wn−θ|>ϵ)=0,∀θ∈Θ\lim_{n\to\infty} P(|W_n - \theta|> \epsilon) = 0, \quad \forall\theta \in \Theta 其中,是参数空间。但我想了解估计量必须保持一致的必要性。为什么一个不一致的估计是不好的?你能给我一些例子吗?ΘΘ\Theta 我接受R或python中的模拟。

5
如何同时处理多次序列?
我有一个数据集,其中包括25个期间的几种产品(1200种产品)的需求,我需要预测下一个时期每种产品的需求。起初,我想使用ARIMA并为每种产品训练一个模型,但是由于产品数量和(p,d,q)参数的调整,这非常耗时且不切实际。是否建议在先前需求为自变量的情况下使用回归(自回归)? 我能否知道是否有任何方法可以训练一个模型来预测所有1200种产品的需求?如果您能建议使用Python中的任何库,我将不胜感激,因为我正在使用Python。


2
什么是功能分配?
我正在阅读CE Rasmussen和CKI Williams 的教科书《高斯机器学习过程》,并且在理解函数分布的含义时遇到了一些麻烦。在教科书中,给出了一个示例,该示例将一个函数想象为一个很长的向量(实际上,它应该无限长吗?)。因此,我认为函数上的分布是这样的矢量值“上方”绘制的概率分布。那么函数是否有可能采用该特定值呢?还是函数将采用给定范围内的值的可能性?还是在函数上分配是分配给整个函数的概率? 从教科书中引用: 第1章:简介,第2页 高斯过程是对高斯概率分布的概括。概率分布描述的是标量或向量的随机变量(对于多元分布),而随机过程控制函数的属性。抛开数学的复杂性,人们可以松散地将函数视为一个很长的向量,向量中的每个条目都在特定输入x处指定函数值f(x)。事实证明,尽管这个想法有些天真,但却令人惊讶地接近了我们所需要的。确实,我们如何在计算上处理这些无限维对象的问题具有可以想象到的最令人愉悦的分辨率:如果仅要求函数在有限数量的点上的属性, 第2章:回归,第7页 有几种解释高斯过程(GP)回归模型的方法。可以认为高斯过程定义了函数的分布,并且推理直接在函数空间即函数空间视图中进行。 从最初的问题: 我拍了这张概念图,试图自己想象一下。我不确定我自己所做的解释是否正确。 更新后: 在回答Gijs之后,我将图片更新为概念上更像这样的东西:

4
什么是人工神经网络?
深入研究神经网络文献时,我们发现了具有神经形态拓扑结构的其他方法(“神经网络”架构)。而且我并不是在说通用逼近定理。示例如下。 然后,让我感到奇怪的是:人工神经网络的定义是什么?它的拓扑似乎涵盖了所有内容。 例子: 我们做出的第一个标识是在PCA和线性自动编码器之间,编码器和解码器具有约束权重,而瓶颈层则具有阈值激活。 此外,在线性模型(特殊情况下为逻辑回归)和没有隐藏层且只有一个输出层的神经网络之间进行了通用标识。此标识打开了几扇门。 傅里叶和泰勒级数?人工神经网络。SVM?人工神经网络。高斯过程?ANN(具有无限隐藏单元的单个隐藏层)。 因此,同样容易地,我们可以将具有这些算法的专门损失函数的任意正则化版本合并到神经网络框架中。 但是,我们挖掘的越多,相似之处就越多。我只是偶然发现了深度神经决策树,该树通过决策树来识别特定的ANN架构,并允许通过ANN方法(例如Gradient Descent反向传播)来学习这些决策树。由此,我们可以仅从神经网络拓扑结构构建随机森林和梯度增强决策树。 如果一切都可以表示为人工神经网络,那么什么定义了人工神经网络呢?

5
线性回归中的假设条件是什么?
在线性回归中,我们做出以下假设 每个预测变量值的响应平均值 E(Yi)E(Yi)E(Y_i)是预测变量的线性函数。(x1i,x2i,…)(x1i,x2i,…)(x_{1i}, x_{2i},…) 误差εiεiε_i是独立的。 在预测变量的每个值集(x_ {1i},x_ {2i},…)处的误差ε_i正态分布。εiεiε_i(x1i,x2i,…)(x1i,x2i,…)(x_{1i}, x_{2i},…) 每个预测变量值 (x_ {1i},x_ {2i},...)的误差ε_i具有相等的方差(表示为σ2)。εiεiε_i(x1i,x2i,…)(x1i,x2i,…)(x_{1i}, x_{2i},…)σ2σ2σ2 解决线性回归的方法之一是通过正态方程,我们可以写成 θ=(XTX)−1XTYθ=(XTX)−1XTY\theta = (X^TX)^{-1}X^TY 从数学的角度来看,上述等式仅需要XTXXTXX^TX是可逆的。那么,为什么我们需要这些假设呢?我问了几个同事,他们提到这是要获得良好的结果,而正规方程是实现该目标的算法。但是在那种情况下,这些假设有何帮助?坚持使用它们如何有助于建立更好的模型?

1
最小化解释模型中的偏见,为什么?(Galit Shmueli的“解释或预测”)
这个问题参考了Galit Shmueli的论文“解释或预测”。 具体而言,Shmueli教授在1.5节“解释和预测不同”中写道: 在解释性建模中,重点是最小化偏差以获得最准确的基础理论表示。 每当我读这篇论文时,这都会使我感到困惑。从什么意义上说,最小化估计偏差可以最准确地表示基础理论吗? 我还在这里观看了Shmueli教授在2017年JMP探索峰会上的演讲,她说: ...像收缩模型,集合体之类的东西,您将永远不会看到它们。因为这些模型通过设计引入了偏差,以减少总体偏差/方差。这就是为什么他们不在那里的原因,这样做没有任何理论意义。您为什么要使模型有目的地偏见? 这并不能真正阐明我的问题,只是重申我不理解的说法。 如果理论有很多参数,而我们没有足够的数据来估计它们,那么估计误差将由方差决定。为什么在这种情况下使用像岭回归这样的有偏估计程序(导致较低方差的有偏估计)是不合适的?

2
神经网络与其他一切
我没有从google找到满意的答案。 当然,如果我拥有的数据量达到数百万,那么深度学习就是一种方法。 我已经读到,当我没有大数据时,也许最好在机器学习中使用其他方法。给出的原因是过度拟合。机器学习:即查看数据,特征提取,从收集的内容中构建新特征等。例如删除高度相关的变量等。整个机器学习9码。 我一直想知道:为什么具有一层隐藏层的神经网络不是解决机器学习问题的灵丹妙药?它们是通用估计器,可以通过辍学,l2正则化,l1正则化,批归一化来管理过度拟合。如果我们只有50,000个培训示例,那么培训速度通常不会成为问题。在测试时,它们比随机森林要好。 那么为什么不呢?-像通常那样清理数据,估算缺失值,将数据居中,标准化数据,将其扔到具有一个隐藏层的神经网络集合中并应用正则化,直到看不到过度拟合为止,然后进行训练他们到最后。梯度爆炸或梯度消失是没有问题的,因为它只是2层网络。如果需要较深的层,则意味着要学习分层功能,然后其他机器学习算法也不好。例如,SVM是仅具有铰链损耗的神经网络。 一个示例,其中其他一些机器学习算法的性能将超过经过精心调整的2层(也许是3?)神经网络。您可以给我链接到问题,然后我将训练最好的神经网络,我们可以看到2层或3层神经网络是否低于其他任何基准机器学习算法。


1
Newey-West(1987)和Hansen-Hodrick(1980)的比较
问题:使用Newey-West(1987)和Hansen-Hodrick(1980)标准错误之间的主要区别和相似之处是什么?在哪些情况下应优先选择其中一种? 笔记: 我确实知道每个调整程序如何工作;但是,无论是在网上还是在我的教科书中,我还没有找到可以比较它们的文档。欢迎参考! Newey-West往往被用作“包罗万象”的HAC标准错误,而Hansen-Hodrick经常在数据点重叠的情况下出现(例如,请参见此问题或此问题)。因此,我的问题的一个重要方面是,关于Hansen-Hodrick的事情是否比Newey-West 更适合处理重叠数据?(毕竟,重叠的数据最终会导致与序列相关的错误术语,Newey-West也要处理。) 作为记录,我知道这个类似的问题,但是它提出的条件相对较差,被否决了,最终我所问的问题没有得到回答(仅与编程相关的部分得到了回答)。

2
为什么对时间序列的这种预测“非常糟糕”?
我正在尝试学习如何使用神经网络。我正在阅读本教程。 使用时间的值拟合神经网络以预测时间的值后,作者获得以下曲线图,其中蓝线是时间序列,绿色是对火车数据的预测,红色是对测试数据进行预测(他使用了测试序列拆分)ŤŤtt + 1Ť+1个t+1 并将其称为“我们可以看到该模型在拟合训练数据和测试数据集方面做得很差。它基本上预测出与输出相同的输入值。” 然后,作者决定使用,和来预测处的值。这样做获得ŤŤtt − 1Ť-1个t-1t − 2Ť-2t-2t + 1Ť+1个t+1 并说:“看图表,我们可以在预测中看到更多的结构。” 我的问题 为什么第一个“可怜”?在我看来,它几乎是完美的,它可以完美地预测每个变化! 同样,为什么第二个更好?“结构”在哪里?在我看来,这比第一个要差得多。 通常,对时间序列的预测什么时候好,什么时候不好?

3
支持向量机和超平面的直觉
在我的项目中,我想创建一个逻辑回归模型来预测二进制分类(1或0)。 我有15个变量,其中2个是分类变量,其余的则是连续变量和离散变量的混合。 为了适应逻辑回归模型,建议我使用SVM,感知器或线性编程检查线性可分离性。这与此处提出的有关线性可分离性测试的建议有关。 作为机器学习的新手,我了解上述算法的基本概念,但从概念上讲,我很难想象如何分离具有多个维度(例如15个)的数据。 在线资料中的所有示例通常都显示两个数值变量(高度,重量)的二维图,这些二维变量在类别之间显示出明显的差距,并且易于理解,但在现实世界中,数据通常具有更高的维度。我一直被虹膜数据集吸引,试图通过这三个物种拟合一个超平面,以及如何在两个物种之间做到这一点特别困难,即使不是不可能,这两个类现在也让我无法幸免。 当我们具有更高的维数时,如何假设当我们超过一定数量的特征时,我们使用内核映射到更高的维空间以实现这种可分离性,这是怎么实现的? 同样为了测试线性可分离性,使用的度量标准是什么?是SVM模型的准确性,即基于混淆矩阵的准确性吗? 任何有助于更好地理解该主题的帮助将不胜感激。下面也是我的数据集中两个变量的图的样本,它显示了这两个变量的重叠程度。


3
ANOVA假设(方差相等,残差的正态性)为何重要?
在运行方差分析时,我们被告知必须进行某些测试假设才能使其适用于数据。对于测试起作用的必要条件,我从未理解以下原因: 在设计的每个单元格中,因变量(残差)的方差应相等 对于设计的每个单元,您的因变量(残差)应近似正态分布 我了解关于是否需要满足这些假设存在一些灰色区域,但是出于争论的目的,如果在给定的数据集中完全不满足这些假设,那么使用ANOVA将会带来什么问题?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.