统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
使用GPS路线管理错误(理论框架?)
我正在寻找合适的理论框架或专业知识,以帮助我理解如何处理GPS系统存在的错误-特别是在处理路线时。 从根本上讲,我正在寻找对数据的要求以及可以用来确定路径长度的任何算法。答案必须是值得信赖的。 我的一个朋友曾经是一场比赛的赛事总监,当时比赛被定为160公里,但Garmin看着每个人都将其变成了190公里以上。在终点线引起了相当多的悲伤,让我告诉你! 因此,我的朋友使用各种GPS设备返回该课程,以便对其进行重新映射,结果很有趣。 使用手持式Garmin Oregon 300,她的一条腿达到了33.7公里。对于Garmin Forerunner 310xt手表上的同一条腿,跑出38.3公里。 当我从俄勒冈州获得数据时,很明显它仅每90秒左右记录一次数据。先行者每隔几秒钟就会执行一次。 当我绘制来自俄勒冈州的数据时,我可以看到它被一些折弯弄糊涂了,并在它们之间划了一条直线,使曲线变少了一点。 但是,我认为记录频率的差异是造成这种情况的主要原因。即通过每隔几秒钟记录一次,先行者就更接近真实路线。但是,由于GPS的工作方式,会出现一些错误。如果记录的点随机散布在真实路线上(由于错误),则总距离将大于真实路线。(沿着直线的任意一侧的摆动线比直线长)。 因此,我的问题是:1.我可以在单个数据集上使用任何技术来有效地减少错误吗?2.关于录音频率差异的理论是否成立?3.如果我有多条相同路线的录音,是否有任何有效的技术将它们组合起来以更接近真实路线? 就像我说的,我真的不知道该寻找什么,以找到关于此的任何有用的科学。我正在寻找一种方法来确定一条给定路径的长度,这对人们来说非常重要。在比赛中多出30公里,比我们预期的多了5个小时以上。 根据要求,这里是一些示例数据: 详细的高频样本数据 低频样本数据 感谢您提供的任何建议。
14 error  sampling 

3
如何检测回归模型何时过拟合?
当您正在做某事时,意识到自己在做什么,就会对何时过度拟合模型产生一种感觉。一方面,您可以在模型的“调整后的R平方”中跟踪趋势或劣化。您还可以在主要变量的回归系数的p值中跟踪类似的恶化。 但是,当您阅读其他人的研究并且对他们自己的内部模型开发过程一无所知时,如何清楚地确定模型是否过拟合。

3
可以使CART模型健壮吗?
我办公室的一位同事今天对我说:“树模型不好,因为它们被极端的观察所捕获”。 此处的搜索导致该线程基本上支持该声明。 这就引出了我的问题-在什么情况下CART模型可以保持稳健,如何显示?


2
当选择的特征数量减少时,为什么随机森林OOB误差估计会提高?
我在微阵列数据集上应用随机森林算法作为分类器,将其分为两个已知的具有1000多个特征的组。初次运行后,我查看了这些功能的重要性,并使用5个,10个和20个最重要的功能再次运行树算法。 我发现,对于所有功能,前10位和前20位的OOB错误率估计为1.19%,而前5位功能的错误率为0%。 这对我来说似乎是违反直觉的,因此我想知道您是否可以解释我是否缺少某些内容或使用了错误的指标。 我在ntree = 1000,nodesize = 1和mtry = sqrt(n)中使用R中的randomForest包

3
帮助您选择适当的分析技术和测试的流程图
作为需要统计知识但不是经过正式培训的统计学家的人,我发现有一个流程图(或某种决策树)来帮助我选择解决特定问题的正确方法(例如,“需要这个并且知道那个并且认为数据是正态分布的吗?使用技术X。如果数据不是正态,则使用Y或Z“。 经过一番谷歌搜索后,我看到了几次尝试,尝试了各种覆盖范围和质量(目前尚不可用)。在图书馆查阅的统计教科书中,我也看到了类似的流程图。 奖励是一个交互式站点,除了仅提供图表之外,它还将提供额外的信息(例如假设),并指出如何在流行的统计数据包中执行这些技术。“需要在R中进行ANOVA吗?您需要软件包X,这是一个教程”。 我作为社区Wiki问题问,希望有更好的资源我找不到。由于统计是一个很大的主题,我认为这样的流程图将适合具有初学者或中级水平知识的人可以采用的技术。任何更复杂的事情都需要经过正规培训的人员。

3
R包用于固定效果逻辑回归
我正在寻找一个R使用Chamberlain的1980年估计量来估计具有单独固定效应(个体截距)的logit模型系数的软件包。它通常被称为张伯伦的固定效应logit估计器。 在处理二进制结果面板数据(至少在计量经济学中)时,这是一个经典的估算器,但我只是在CRAN中找不到与之相关的任何信息。 有什么线索吗?

2
来自混合效应模型的预测值周围的置信区间是什么意思?
我在看这个页面并注意到R中lme和lmer的置信区间方法。对于不了解R的人,这些是生成混合效果或多级模型的函数。如果我在重复测量设计等方面具有固定效果,那么围绕预测值(类似于均值)的置信区间意味着什么?我可以理解,对于一个效果,您可以有一个合理的置信区间,但是在我看来,在这样的设计中,围绕预期均值的置信区间似乎是不可能的。承认随机变量会导致估计中的不确定性这一事实可能很大,但在那种情况下,从推断的意义上比较各个值根本毫无用处。要么, 我是否在这里遗漏了一些东西,或者我对情况的分析是正确的?... [并且可能是为什么没有在lmer中实现(但很容易在SAS中实现)的理由。:)]

4
后续行动:在ANOVA图表之间的混合内,估计的SE或实际的SE?
我目前正在整理一篇论文,从昨天开始偶然发现了这个问题,这使我向自己提出了同样的问题。更好地为我的图表提供来自数据的实际标准误差还是由ANOVA估算的误差? 由于昨天的问题相当具体,我的问题相当具体,我认为提出这个后续问题是适当的。 详细信息: 我已经在某个认知心理学领域(条件推理)中进行了一项实验,将两组(归纳和演绎指令,即受试者之间的操作)与两个受试者内部的操作(问题的类型和问题的内容)进行了比较。两个因素水平)。 结果看起来像这样(左侧面板显示的是ANOVA输出的SE值,右侧面板显示的是根据数据估算的SEs): 请注意,不同的行代表两个不同的组(即,对象间操作),而内部在x轴(即2x2因子水平)上绘制受试者操作。 在本文中,我提供了方差分析的相应结果,甚至提供了中间关键交叉交互的计划比较。SE在那里为读者提供了有关数据可变性的一些提示。我更倾向于使用SE,而不是标准偏差和置信区间,因为绘制SD并不常见,并且在比较对象之间和对象之间的CI时存在严重问题(因为肯定适用于SE,错误地推断出显着差异的情况并不常见从他们)。 重复我的问题:绘制从ANOVA估计的SE是更好还是我应该绘制从原始数据估计的SE? 更新: 我认为我应该对SE的估算值更加清楚。SPSS中的ANOVA输出为我estimated marginal means提供了相应的SE和CI。这是在左图中绘制的内容。据我了解,它们应该是残差的标准差。但是,当保存残差时,它们的SD不会以某种方式接近估计的SE。因此,一个次要的(可能是特定于SPSS的问题)将是:这些SE是 什么? 更新2:我终于设法编写了一个R函数,该函数应该能够像我最终喜欢的那样自行绘制(请参见我接受的答案)。如果有人有时间,如果您可以看一下,我将不胜感激。这里是。

12
统计会议?
什么是最重要的年度统计会议? 规则: 每个答案一个会议 包括会议链接

4
关于KL分歧有疑问吗?
我正在用KL散度比较两个分布,这给我返回了一个非标准化数字,根据我对这一度量的了解,该数字是将一种假设转换为另一种假设所需的信息量。我有两个问题: a)有没有一种方法可以量化KL散度,使其具有更有意义的解释,例如像效应大小或R ^ 2?任何形式的标准化? b)在R中,使用KLdiv(flexmix软件包)时,可以设置“ esp”值(标准esp = 1e-4),该值将所有小于esp的点设置为某个标准,以提供数值稳定性。我一直在使用不同的esp值,并且对于我的数据集,我选择的数字越小,KL散度就越来越大。到底是怎么回事?我希望esp越小,结果应该越可靠,因为它们会让更多的“真实值”成为统计数据的一部分。没有?我必须更改esp,因为否则它不会计算统计信息,而只会在结果表中显示为NA ...

9
用于集群的可视化软件
已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 我想聚集〜22000点。许多聚类算法可以在较高质量的初始猜测下更好地工作。有哪些工具可以使我对数据的大致形状有所了解? 我确实希望能够选择自己的距离度量标准,因此我可以输入成对距离列表的程序就可以了。我希望能够做一些事情,例如在显示器上突出显示一个区域或群集,并获得该区域中哪些数据点的列表。 首选自由软件,但我已经拥有SAS和MATLAB。



3
费舍尔这句话是什么意思?
我到处都看到这个名言,但每次都无法理解重点。 一个人暂时拒绝假设的情况,作为惯常做法,当重要性达到1%或更高水平时,肯定会被误以为不超过1%的此类决定。因为当假设正确时,他只会在这些情况的1%中被误解,而当假设错误时,他在误解中永远不会被误解。[...]但是,这种计算是荒谬的学术研究,因为实际上没有科学工作者每年都有固定的意义水平,在任何情况下,他都拒绝假设。他宁愿根据自己的证据和想法对每一个具体案件都下定决心。不应忘记,为进行测试而选择的案例显然是一个高度选择的案例,并且即使对于一个工人也无法指定选择条件;同样,在所使用的论点中选择一个特定的审判所表明的实际重要性水平显然是不合法的,就好像使用这一水平是他一生的习惯。 (统计方法和科学推断,1956年,第42-45页) 更具体地说,我不明白 为什么选择用于“高度选择”测试的案例?假设您想知道一个区域内人员的平均身高是否小于165厘米,然后决定进行测试。据我所知,标准程序是从该区域抽取随机样本并测量其高度。如何高度选择? 假设案例是经过高度选择的,但是这与重要性级别的选择有什么关系?再次考虑上面的例子,如果您的抽样方法(我认为是费舍尔所说的选择条件)是歪斜的,并且以某种方式偏爱高个子,那么整个研究就会毁了,而对显着性水平的主观确定无法挽救它。 实际上,我什至不知道什么是“特定试验所表明的实际重要性水平”。它是该实验的值,还是一些著名的预设值(如著名的0.05),还是其他?ppp

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.