统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
为什么要使用某种预测误差度量(例如MAD),而不是另一种度量度量(例如MSE)?
MAD =平均绝对偏差MSE =均方误差 我已经从各个地方看到了建议,尽管使用了MSE,但仍存在一些不良质量(例如http://www.stat.nus.edu.sg/~staxyc/T12.pdf,其在第8页上指出:“人们普遍认为MAD是比MSE更好的标准。但是,从数学上讲,MSE比MAD更方便。“) 除此之外,还有什么呢?是否有一篇论文彻底分析了各种测量预测误差的方法是否合适的情况?我的Google搜索未显示任何内容。 在/programming/13391376/how-to-decide-the-forecasting-method-from-the-me-mad-mse-sde中询问了与此类似的问题,并要求用户张贴在stats.stackexchange.com上,但我认为他们从未这样做过。
15 forecasting  error  mse  mae 

1
可视化混合模型结果
我对混合模型经常遇到的问题之一是弄清楚数据可视化效果-可能会出现在纸或海报上的数据可视化效果-一旦获得结果即可。 现在,我正在研究一个Poisson混合效果模型,其公式如下所示: a <- glmer(counts ~ X + Y + Time + (Y + Time | Site) + offset(log(people)) 有了glm()中所装的东西,就可以轻松地使用predict()来获取新数据集的预测,并以此为基础进行构建。但是,使用这样的输出-您如何构建从X偏移(可能设置为Y)随时间变化的速率图?我认为仅凭固定效果估算值就可以很好地预测拟合度,但是95%CI呢? 还有其他人能想到的有助于可视化结果的东西吗?该模型的结果如下: Random effects: Groups Name Variance Std.Dev. Corr Site (Intercept) 5.3678e-01 0.7326513 time 2.4173e-05 0.0049167 0.250 Y 4.9378e-05 0.0070270 -0.911 0.172 Fixed effects: Estimate Std. Error z value Pr(>|z|) (Intercept) …

7
随机森林过度拟合
我正在尝试在scikits-learn中使用随机森林回归。问题是我遇到了很高的测试错误: train MSE, 4.64, test MSE: 252.25. 这是我的数据的样子:(蓝色:真实数据,绿色:预测的): 我将90%用于培训,将10%用于测试。这是我尝试几种参数组合后使用的代码: rf = rf = RandomForestRegressor(n_estimators=10, max_features=2, max_depth=1000, min_samples_leaf=1, min_samples_split=2, n_jobs=-1) test_mse = mean_squared_error(y_test, rf.predict(X_test)) train_mse = mean_squared_error(y_train, rf.predict(X_train)) print("train MSE, %.4f, test MSE: %.4f" % (train_mse, test_mse)) plot(rf.predict(X)) plot(y) 有什么可能的策略来改善我的健康状况?我还有其他方法可以提取基础模型吗?对于我来说,令人难以置信的是,经过多次重复相同的模式后,模型对新数据的表现如此差劲。我完全没有希望尝试拟合此数据吗?

1
变量误差回归:从三个站点合并数据是否有效?
最近,我有一个客户来做我的引导程序分析,因为FDA审查员说他们的变量误差回归是无​​效的,因为当合并来自站点的数据时,分析包括来自三个站点的数据,其中两个站点包括一些样本。相同。 背景 客户想使用一种新的测定方法,他们希望证明该方法与现有的认可方法“等效”。他们的方法是比较两种方法应用于相同样品的结果。使用了三个站点进行测试。将变量误差(戴明回归)应用于每个站点的数据。想法是,如果回归显示斜率参数接近1,截距接近0,则表明这两种测定技术给出的结果几乎相同,因此应批准新方法。在站点1,他们有45个样本,给了他们45个配对的观测值。站点2有40个样本,站点3有43个样本。他们进行了三个单独的Deming回归(假设两种方法的测量误差之比为1)。因此,该算法将垂直距离的平方和最小化。 客户在提交的材料中指出,地点1和2所用的一些样品是相同的。在审查中,FDA审查员说Deming回归是无效的,因为使用了共同的样本会导致“干扰”,从而使模型的假设无效。他们要求对Deming结果进行自举调整,以考虑到这种干扰。 那时,由于客户不知道该如何进行引导程序。“干扰”一词很奇怪,我不确定审阅者的确切含义。我认为关键是因为合并数据具有公共样本,所以公共样本之间存在相关性,因此模型误差项不会全部独立。 客户分析 这三个单独的回归非常相似。每个斜率参数接近1,截距接近0。在每种情况下,斜率和截距的95%置信区间分别为1和0。主要区别是站点3上的残留方差略高。此外,他们将此与进行OLS的结果进行了比较,发现它们非常相似(仅在一种情况下,基于OLS的斜率的置信区间不包含1)。如果坡度的OLS CI不包含1,则区间的上限约为0.99。 由于这三个站点的结果如此相似,将站点数据合并起来似乎是合理的。客户进行了汇总的Deming回归,也得出了类似的结果。鉴于这些结果,我为客户撰写了一份报告,对声称回归无效的说法提出了异议。我的观点是,由于两个变量中都存在类似的度量误差,因此客户使用Deming回归作为显示同意/不同意见的方式是正确的。单个站点的回归没有相关误差的问题,因为在给定的站点内没有重复样本。合并数据以获得更紧密的置信区间。 可以通过简单地将数据与站点1中遗漏的常见样本合并来解决此难题。同样,三个单独的站点模型也没有问题并且有效。在我看来,即使没有共同努力,这也提供了有力的证据。此外,对于公共站点,分别在站点1和2进行测量。因此,我认为即使使用所有数据进行汇总分析也是有效的,因为站点1处样品的测量误差与站点2中相应样品的测量误差不相关。这实际上等于在设计中重复了一点空间应该没有问题。它不会创建关联/“干扰”。 在我的报告中,我写道引导分析是不必要的,因为没有相关的调整。这三个站点模型是有效的(站点内没有可能的“干扰”),可以进行合并分析以在合并时删除站点1上的常见样本。这样的汇总分析不会有干扰问题。无需进行自举调整,因为没有偏差可调整。 结论 客户同意我的分析,但害怕将其提交给FDA。他们还是要我进行引导程序调整。 我的问题 A)您是否同意(1)我对客户结果的分析,以及(2)我认为不需要引导程序的论点。 B)鉴于我必须自举Deming回归,是否有任何过程SAS或R可用于我对自举样本进行Deming回归? 编辑:考虑到比尔·胡伯(Bill Huber)的建议,我计划通过对x上的y和对y上的x进行回归来研究变量误差回归的界限。我们已经知道,对于一种版本的OLS,当两个误差方差均相等时,答案与变量误差基本相同。如果对于其他回归也是如此,那么我认为这将表明Deming回归给出了适当的解决方案。你同意吗? 为了满足客户的要求,我需要进行模糊定义的请求引导分析。从伦理上讲,我认为仅提供引导程序是错误的,因为它并不能真正解决客户的真正问题,即证明他们的检测测量程序合理。因此,我将对他们进行分析,并至少要求他们告诉FDA,除了进行引导程序外,我还进行了逆回归并限制了Deming回归,我认为这更合适。我还认为,分析将表明他们的方法与参考等效,因此Deming回归也足够。 我计划使用@whuber在其答案中建议的R程序,以使我能够引导Deming回归。我对R不太熟悉,但我认为我可以做到。我已经将R和R Studio一起安装了。这样对像我这样的新手来说足够容易吗? 我也有SAS,并且对SAS编程更满意。因此,如果有人知道在SAS中执行此操作的方法,我将不胜感激。

3
有关统计随机性的一些问题
从维基百科的统计数据来看: 全局随机性和局部随机性是不同的。大多数随机性的概念都是全局性的,因为它们是基于“从长远来看”序列看起来是真正随机的,即使某些子序列看起来不是随机的。例如,在一个足够长的“真正”随机数字序列中,很可能会有很长的零序列,但总的来说,该序列可能是随机的。局部随机性是指这样的想法,即可能存在最小序列长度,其中随机分布是近似的。相同数字的长距离延伸,即使是由“真正的”随机过程生成的数字,也将减少样本的“局部随机性”(对于10,000位数的序列,它可能仅是局部随机的;小于1,000的序列可能不会出现随机性例如)。 因此没有证明表现出模式的序列不是统计上随机的。根据Ramsey理论的原理,足够大的物体必须包含给定的子结构(“不可能完全混乱”)。 我不太明白这两个句子的含义。 第一句话是否意味着某事物使序列在较长的长度上局部随机,而不是在较短的长度上局部随机? 括号内的示例如何工作? 第二句话是否意味着不能证明具有某种模式的序列不是统计上随机的?为什么? 谢谢

5
研究生统计课程提供的用于统计的开源Java库
我正在应用统计专业的研究生课程中学习,该课程使用以下教科书(以使您了解所涵盖的材料的水平):统计概念和方法,由GK Bhattacharyya和RA Johnson撰写。 教授要求我们对家庭作业使用SAS。 我的问题是:是否有一个Java库可以代替SAS用于此类类中常见的问题。 我目前正在尝试使用Apache Math Commons,尽管该库给我留下了深刻的印象(它的易用性和易理解性),但它似乎甚至缺少一些简单的东西,例如绘制直方图的能力(将其与图表库结合的想法) )。 我看过柯尔特,但最初的兴趣很快就消失了。 我们将不胜感激-我已经在Stackoverflow上查看了类似的问题,但没有发现任何令人信服的内容。 注意:我知道R,SciPy和Octave以及对它们进行调用的Java库-我正在寻找Java本机库或一组库,它们可以一起提供我要寻找的功能。 注意:此类课程中涉及的主题通常包括:单样本和两样本检验以及均值和中位数的置信区间,描述性统计量,拟合优度检验,单向和双向方差分析,同时推断,检验方差,回归分析和分类数据分析。
15 r  sas  java 

11
非泊松过程的例子?
我正在寻找一些不适合使用Poisson分布进行建模的情况的好例子,以帮助我向学生解释Poisson分布。 通常可以使用一个时间间隔内到达商店的顾客数量作为示例,该示例可以通过泊松分布进行建模。我正在寻找类似的反例,即这种情况可以视为连续时间内的正计数过程,而这显然不是泊松。 理想情况下,情况应尽可能简单明了,以使学生易于掌握和记住。

2
交叉验证中的均值(分数)vs分数(串联)
TLDR: 我的数据集很小(120个)样本。在进行10倍交叉验证时,我应该: 收集每个测试折叠的输出,将它们连接成一个向量,然后在这个完整的预测向量(120个样本)上计算误差? 或者我应该代替计算上的输出我得到的错误的一个折(每个折痕12个样本),然后让我最终误差估计为平均10点的误差估计? 是否有任何科学论文争论这些技术之间的差异? 背景:多标签分类中与宏观/微观得分的潜在关系: 我认为这个问题可能与micro和Macro之间的差异有关经常在多标签分类任务(例如说5个标签)中使用的平均值平均值。 在多标签设置时,微平均得分是通过使计算的聚集对120个样本的所有5个分类器预测真阳性,假阳性,真阴性,假阴性权变表,。然后,该列联表用于计算微观精度,微观召回率和微观f测度。因此,当我们有120个样本和5个分类器时,将根据600个预测(120个样本* 5个标签)计算出微观指标。 使用Macro变体时,每个标签独立计算度量(精度,召回率等),最后将这些度量平均。 微观估算与宏观估算之间的差异背后的思想可能会扩展到二进制分类问题中以K倍设置可以完成的工作。对于10倍,我们可以对10个值进行平均(宏观测量),也可以将10个实验连接起来并计算微观措施。 背景-扩展示例: 以下示例说明了该问题。假设我们有12个测试样本,并且有10折: 折1:TP = 4,FP = 0,TN = 8 精度 = 1.0 折2:TP = 4,FP = 0,TN = 8 精度 = 1.0 折3:TP = 4,FP = 0,TN = 8 精度 = 1.0 折4:TP = 0,FP = 12, 精度 = …

2
冷漠原则是否适用于Borel-Kolmogorov悖论?
考虑杰恩斯解决贝特朗悖论用冷漠的原则。为什么类似的论点不适用于Borel-Kolmogorov悖论? 争论是否存在问题,因为问题未指定球的方向,所以旋转球不应该影响所选限制过程得出的最终分布吗?
15 theory  paradox 

3
当Schoenfeld残差不佳时,比例风险回归模型有哪些选择?
我正在使用进行R的Cox比例风险回归coxph,其中包括许多变量。Martingale残差看起来很棒,而Schoenfeld残差对于ALMOST所有变量来说都很棒。存在三个变量的Schoenfeld残差不平坦,并且变量的性质使得它们可以随时间变化是有意义的。 这些是我不太感兴趣的变量,因此将它们分层即可。但是,它们都是连续变量,而不是类别变量。因此,我认为阶层不是可行的路线*。我试图建立的变量和时间之间的相互作用,如所描述这里,但我们得到的错误: In fitter(X, Y, strats, offset, init, control, weights = weights, : Ran out of iterations and did not converge 我正在处理将近1000个数据点,并且正在处理具有多个因素的六个变量,因此感觉就像我们正在限制如何对这些数据进行切片和切块的极限。不幸的是,我尝试过使用更少的包含变量的所有较简单的模型显然都较差(例如,Schoenfeld残差对于更多变量来说更加脆弱)。 我有什么选择?由于我不在乎这些行为不佳的特定变量,因此我只想忽略它们的输出,但是我怀疑这不是有效的解释! *一个是连续的,一个是大于100的整数,一个是6的整数。


3
二次项或交互项在单独意义上都是重要的,但两者都不在一起
作为作业的一部分,我必须对具有两个预测变量的模型进行拟合。然后,我不得不针对所包含的预测变量之一绘制模型残差的图,并根据该残差进行更改。该图显示了曲线趋势,因此我为该预测变量包括了一个二次项。新模型显示二次项很重要。到目前为止一切都很好。 但是,数据表明交互也很有意义。在原始模型中添加一个交互项也可以“固定”曲线趋势,并且在添加到模型中时也非常重要(没有二次项)。问题是,当将二次项和交互项都添加到模型中时,其中一项不重要。 我应该在模型中包括哪个术语(二次方或相互作用),为什么?

3
选择具有最强相关性的数据点子集的自动化程序?
是否有一些标准程序(以便可以引用它作为参考)从具有最大相关性(仅二维)的较大池中选择数据点的子集? 例如,假设您有100个数据点。您需要一个40个点的子集,这些子集在X和Y维度上可能具有最强的相关性。 我意识到编写代码来做到这一点相对简单,但是我想知道是否有任何资料可以引用?

3
“交叉熵”的定义和起源
在没有引用来源的情况下,维基百科将离散分布PPP和的交叉熵定义问问Q为 H×(P; 问)= - ΣXp (x )日志q(x )。H×(P;问)=-∑Xp(X)日志⁡q(X)。\begin{align} \mathrm{H}^{\times}(P; Q) &= -\sum_x p(x)\, \log q(x). \end{align} 谁是第一个开始使用此数量的人?谁发明了这个名词?我看了看: JE Shore和RW Johnson,“最大熵原理和最小交叉熵原理的公理推导”,信息理论,IEEE Transactions 26号 1,第26-37页,1980年1月。 我跟随他们的介绍 A. Wehrl,“熵的一般性质”,《现代物理学》评论,第1卷。50,不。》,第2卷,第221-260页,1978年4月。 谁从不使用该术语。 也没有 S. Kullback和R. Leibler,“关于信息和充分性”,《数学统计年鉴》,第1卷。22号 1卷,第79-86页,1951年。 我看着 TM Cover和JA Thomas,信息论要素(电信和信号处理中的Wiley系列)。Wiley-Interscience,2006年。 和 I. Good,“假设公式,尤其是多维列联表的最大熵”,《数学统计年鉴》,第1卷。34号 3,第911-934页,1963年。 但是这两篇论文都将交叉熵定义为KL散度的同义词。 原始纸 CE Shannon,“通信的数学理论”,贝尔系统技术杂志,第1卷。1948年2月27日。 没有提到交叉熵(并且对“相对熵”有一个奇怪的定义:“一个源的熵与其在限制于相同符号的情况下可能具有的最大值之比”)。 最后,我看了Tribus的一些旧书和论文。 有谁知道上面的等式叫什么,谁发明了它或对其进行了很好的介绍?

3
关于何时使用
我指的是这个视频讲座,用于计算置信区间。但是,我有些困惑。这个家伙正在使用 -statistics进行计算。但是,我认为应该是统计量。我们没有给出总体的真实标准差。我们正在使用样本标准差来估计真实值。zzzttt 那么,为什么他对置信区间而不是对采用正态分布呢?ttt

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.