统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
防止在小数据集上过拟合LSTM
我正在对15000条推文进行建模,以使用具有128个隐藏单元的单层LSTM(使用类似于word2vec的表示形式,具有80个维度)来进行情感预测。1个纪元后,我获得了下降精度(38%,随机= 20%)。随着训练准确性的提高,更多的训练使验证准确性开始下降-这是过度拟合的明显标志。 因此,我正在考虑进行正则化的方法。我不希望减少隐藏单元的数量(128个似乎已经有点低了)。我目前以50%的概率使用辍学率,但这可能会增加。优化器是Adam,具有Keras的默认参数(http://keras.io/optimizers/#adam)。 有什么有效的方法可以减少我的数据集对此模型的过度拟合?

4
箱形图提供的直方图没有提供哪些信息?
直方图可以很好地理解变量的分布。箱形图试图做同样的事情,但是,并不能很好地说明这个变量的分布情况。 我不明白为什么人们使用箱形图。直方图在各个方面都更好。我有理由同时使用它们吗? 我认为箱形图提供的唯一内容是:离群值!它告诉我们哪些观测值可能是异常值。

2
独立样本t检验:真的需要对大样本数据进行正态分布吗?
假设我要测试两个独立样本是否具有不同的均值。我知道基础分布不正常。 如果我理解正确,则我的检验统计量就是平均值,并且对于足够大的样本量,即使没有样本,平均值也应呈正态分布。因此,在这种情况下,参数显着性检验应该有效,对吗?我已阅读了与此相关的令人困惑和令人困惑的信息,因此,我希望获得一些确认(或解释我错了的原因)。 另外,我已经读过,对于大样本量,我应该使用z统计量而不是t统计量。但是实际上,t分布将收敛于正态分布,并且两个统计量应该相同,不是吗? 编辑:以下是一些描述z检验的资料。他们都声明必须按正态分布人口: 在这里,它说:“无论使用哪种Z检验,都假定抽取样本的总体是正常的。” 而在这里,对于Z测试的要求,被列为“两正态分布,但独立的群体,σ被称为”。

2
混沌理论在数据挖掘中已知的,现有的实际应用是什么?
在过去几年中随便阅读一些有关混沌理论的大众市场作品时,我开始想知道它的各个方面如何应用于数据挖掘和相关领域,例如神经网络,模式识别,不确定性管理等。到目前为止,我在已发表的研究中遇到了如此少的此类应用实例,我想知道是否a)它们实际上已在已知的,已发表的实验和项目中付诸实践,b)如果没有,为什么在这些相互关联的过程中却很少使用它们领域? 迄今为止,我所看到的大多数关于混沌理论的讨论都围绕着完全有用的科学应用展开,但与数据挖掘和模式识别等相关领域关系不大。物理学上的三体问题就是一个典型的例子。我想放弃对此类普通科学应用程序的讨论,而仅将问题局限于那些与数据挖掘和相关领域显然相关的应用程序,这些应用程序在文献中似乎很少。下面的潜在应用程序列表可以用作搜索已发表研究的起点,但是我只对那些实际上已经投入实践的应用程序感兴趣(如果有的话)。我正在寻找的是混沌理论对数据挖掘的已知实现,与潜在应用的清单相反,后者的范围要广得多。这是我在阅读时想到的有关数据挖掘应用程序的现成想法的一小部分;也许它们都不是实用的,也许有些在我们讲话时已经投入实际使用,但是按照我还不熟悉的术语去讲: 像几十年前Mandelbrot在模拟电话线中出现错误突发的情况下,Mandelbrot实际采用的方式一样,它可以识别模式识别中的相似结构。 在挖掘结果中遇到费根堡姆常数(也许以类似于弦理论家的方式震惊,他们发现麦克斯韦方程组在研究过程中突然出现在意外的地方)。 确定神经网络权重和各种挖掘测试的最佳位深度。我想知道这一点是因为数值尺度逐渐消失,对初始条件的敏感性开始发挥作用,部分原因是与混沌相关的函数的不可预测性。 以其他不一定与迷人的分形好奇心相关的方式使用分数维的概念,例如Menger Sponges,Koch Curves或Sierpinski Carpets。通过将该概念视为分数,可以以某种有益的方式将其应用于挖掘模型的维度吗? 推导幂函数定律,例如在分形中起作用的定律。 由于分形中遇到的函数是非线性的,所以我想知道非线性回归是否有实际应用。 混沌理论与熵之间存在切线(有时被夸大)关系,因此我想知道是否存在某种方法可以根据混沌理论中使用的函数来计算香农的熵(或对其及其亲属的限制),反之亦然。 识别数据中的周期倍增行为。 通过以一种有用的方式智能地选择最有可能“自我组织”的神经网络,从而确定神经网络的最佳结构。 混沌和分形等也与计算复杂度成切线关系,因此我想知道是否可以使用复杂度来识别混沌结构,反之亦然。 我首先听说了有关混沌理论的李雅普诺夫指数,从那时起,在特定神经网络的配方和熵的讨论中已经注意到了几次。 我可能没有在这里列出其他数十种关系。所有这些都浮现在我的头上。我对这些推测的具体答案并没有特别的兴趣,只是将它们作为可能在野外存在的应用程序类型的示例而扔掉了。我希望看到包含当前研究示例和此类想法的现有实现的答复,只要这些应用程序特别适用于数据挖掘。 即使在我更熟悉的领域(例如信息论,模糊集和神经网络),可能还有其他一些我不知道的现有实现,而我在其他领域的能力更弱,例如回归,因此输入更多不客气。我在这里的实际目的是确定是否对学习混沌理论的特定方面进行更多的投资,如果找不到明显的实用性,我将把它放在后面。 我搜索了CrossValidated,但没有看到任何直接解决混沌理论在数据挖掘中的功利性应用的主题。我能找到的最接近的主题是混沌理论,无方程建模和非参数统计。与特定的子集。

3
机器学习模型(GBM,NN等)如何用于生存分析?
我知道传统的统计模型,例如Cox比例风险回归和一些Kaplan-Meier模型,可以用来预测直到下次事件发生的天数,例如失败等,例如生存分析 问题 机器学习模型(例如GBM,神经网络等)的回归版本如何用于预测事件发生之前的天数? 我相信仅将发生之前的天数用作目标变量并仅运行回归模型是行不通的?为什么不起作用?如何解决? 我们可以将生存分析问题转换为分类,然后获得生存概率吗?如果那么该如何创建二进制目标变量? 机器学习方法与Cox比例风险回归和Kaplan-Meier模型等的优缺点是什么? 想象一下样本输入数据的格式如下 注意: 传感器每隔10分钟对数据进行ping操作,但有时由于网络问题等原因可能会丢失数据,如带有NA的行所示。 var1,var2,var3是预测变量,解释变量。 failure_flag告知计算机是否发生故障。 每个机器ID每10分钟间隔有最近6个月的数据 编辑: 预期的输出预测应采用以下格式 注意:我想预测未来30天每天每台计算机发生故障的可能性。

3
罗纳德·费舍尔的主要统计贡献是什么?
理查德·道金斯(Richard Dawkins)将罗纳德·费舍尔(Ronald Fisher)描述为 “现代统计和实验设计之父”,费舍尔的维基百科传记中引用了这句话。安德斯·霍尔德( Anders Hald)也在他的《数理统计史》一书中称他为 “几乎单枪匹马为现代统计科学奠定基础的天才” 。 我只是想知道他到底做了什么,所以人们给予他如此高的评价?

1
评估随机森林:OOB与CV
当我们例如使用AUC评估随机森林的质量时,是否更适合在“外出样品”或交叉验证的保留集内计算这些数量? 我听说在OOB Samples上计算得出的结果更为悲观,但我不知道为什么。

2
赖曼在生存分析中对审查的解释
我已经阅读了什么是审查,以及如何在生存分析中考虑它,但是我想听听它的数学定义少而定义直观(图片很棒!)。谁能为我提供以下解释:1)审查和2)它如何影响像Kaplan-Meier曲线和Cox回归之类的事情?


1
偏差方差分解
在Bishop的模式识别和机器学习的 3.2节中,他讨论了偏差方差分解,指出对于平方损失函数,预期损失可以分解为平方偏差项(它描述了平均预测与真实预测之间的距离。模型),方差项(描述了平均值周围的预测范围)和噪声项(给出了数据的固有噪声)。 可以使用除平方损失以外的损失函数执行偏差方差分解吗? 对于给定的模型数据集,是否有多个模型的预期损失在所有模型中均是最小的,如果是这样,是否意味着可能会有不同的偏差和方差组合产生相同的最小预期损失? 如果模型涉及正则化,则偏差,方差和正则化系数之间是否存在数学关系?λλ\lambda 如果您不知道真实的模型,如何计算偏差? 在某些情况下,将偏差或方差最小化而不是预期损失(偏差和方差的平方和)更有意义吗?

4
绘制小样本
我有一个单独的14次小数据集来完成一项任务。但是,我很难找到合适的图形来绘制数据。如果样本较大,我将使用箱形图或直方图,但是如果样本如此小,我不确定在这种情况下是否适合使用。 更新:时间是5.2、3.9、5.6、4.2、3.8、4.1、6.0、5.6、4.4、4.5、4.9、4.5、4.9、4.2


1
方差分析是否依靠矩量法而不是最大似然法?
我在不同地方看到提到ANOVA使用矩量法进行估算。 我对这个说法感到困惑,因为即使我不熟悉矩量法,但我的理解是,它不同于最大似然法,并且不等同于最大似然法。另一方面,方差分析可以看作是具有类别预测变量的线性回归,回归参数的OLS估计是最大可能性。 所以: 什么使方差分析程序符合力矩方法? 鉴于ANOVA等同于带有分类预测变量的OLS,这不是最大可能性吗? 如果这两种方法在常规ANOVA的特殊情况下以某种方式等效,那么当差异变得重要时,是否存在某些特定的ANOVA情况?不平衡的设计?重复措施?混合(学科间+学科内)设计?

1
多重条件的贝叶斯定理
我不明白这个方程式是如何得出的。 P(我| 中号1个∩ 中号2)≤ P(我)P(我′)⋅ P(M1个| 一世)P(M2| 一世)P(M1个| 一世′)P(M2| 一世′)P(I|M1∩M2)≤P(I)P(I′)⋅P(M1|I)P(M2|I)P(M1|I′)P(M2|I′)P(I|M_{1}\cap M_{2}) \leq \frac{P(I)}{P(I')}\cdot \frac{P(M_{1}|I)P(M_{2}|I)}{P(M_{1}|I')P(M_{2}|I')} 该方程式来自“概率试验”,其中以OJ Simpson的情况为例。被告正在接受双重谋杀的审判,并提出了两项​​针对他的证据。 中号1个M1M_{1}是被告的血液与犯罪现场发现的一滴血相匹配的事件。是受害者的血液与属于被告的袜子上的血液相匹配的事件。假设有罪,一个证据的出现增加了另一个证据的可能性。 是事件被告是无辜的,而是当他是有罪的。我I '中号2M2M_{2}一世II一世′I′I' 根据这两个证据,我们正在尝试确定被告无罪的可能性的上限。 给出了一些变量的值,但我感兴趣的是方程的推导方式。我尝试了,但是一无所获。 是的,我已经检查了“可能已经有了答案的问题”。

1
为什么丹尼尔·威尔克斯(Daniel Wilks,2011)说主成分回归将“有偏见”?
在在大气科学的统计方法,丹尼尔·威尔克斯指出,多元线性回归可以,如果有该预测结果中很强的互关联(第3版,559-560页)导致的问题: 多重线性回归中可能出现的一种病理现象是,一组具有强互相关性的预测变量会导致计算不稳定的回归关系。 (...) 然后,他介绍了主成分回归: 解决此问题的方法是先将预测变量转换为其主成分,其相关系数为零。 到目前为止,一切都很好。但是接下来,他发表了一些他不解释的声明(或者至少没有足够详细的信息让我理解): 如果所有主成分都保留在主成分回归中,则与整个预测变量集的常规最小二乘拟合没有任何关系。 (..)和: 可以根据原始预测变量重新表达主成分回归,但是即使只使用了一个或几个主成分预测变量,结果通常也将包含所有原始预测变量。尽管通常方差要小得多,但这种重构的回归将是有偏差的,从而导致总体MSE较小。 我不明白这两点。 当然,如果保留了所有主要成分,我们将使用与在原始空间中使用预测变量时相同的信息。但是,通过在主成分空间中进行操作,可以消除互相关的问题。我们可能仍然过拟合,但这是唯一的问题吗?为什么什么都得不到? 其次,即使我们确实截断了主要成分(也许是为了降低噪声和/或防止过度拟合),为什么以及如何导致偏向的重构回归?偏向哪种方式? 本书出处:Daniel S. Wilks,《大气科学中的统计方法》,第三版,2011年。《国际地球物理学丛书》第100卷,学术出版社。
13 regression  pca  bias 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.