统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
为什么从混合效应模型中自举残差会产生反保守的置信区间?
我通常处理的数据是,在2个或更多条件下,分别测量了多个个体。我最近一直在使用混合效果建模来评估条件之间差异的证据,individual并将其建模为随机效果。为了可视化此类建模预测的不确定性,我一直在使用自举法,其中在引导程序的每次迭代中,对个体和条件内观察进行替换抽样,并从中计算新的混合效应模型获得。这对于假定高斯误差的数据效果很好,但是当数据为二项式时,自举可能会花费很长时间,因为每次迭代都必须计算一个计算量相对较高的二项式混合效应模型。 我当时的想法是,我可以使用原始模型中的残差然后使用这些残差代替引导程序中的原始数据,这将使我能够在引导程序的每次迭代中计算一个高斯混合效果模型。将原始数据的二项式模型的原始预测与残差的自举预测相加,得出原始预测的CI为95%。 不过,我最近编码这种做法的一个简单的评价,造型两种情况之间没有区别的,计算的时间比例为95%置信区间未能包括零,而且我发现,上述基于残差,引导过程的产量相当强烈反保守的时间间隔(超过5%的时间排除零)。此外,我然后编码(与以前的链接相同)对该方法的类似评估,该评估应用于原始高斯数据,并且获得了相似的(尽管不是极端的)反保守CI。知道为什么会这样吗?

1
统计人员会询问有关大肠杆菌爆发分析的哪些问题?
您可能听说过德国最近发生的肠出血性大肠杆菌 (EHEC) 。 统计员会问有关EHEC分析的哪些问题? 我想到的是记者/公职人员与非专家之间的问答环节,具有文凭/硕士学位但充其量只是统计数据的老师和工程师说。 (是图片,显示EHEC各种菌株的EHEC土地图以及各种测试的覆盖范围,可能吗?) 6月20日,星期一:我认为EHEC疫情将是全世界范围内真正重要的统计数据:各种原因的证据是什么,如何将这些信息传达给公众?因此,开始赏金。

5
针对名义/圆形变量的SOM聚类
只是想知道是否有人熟悉标称输入的聚类。我一直在将SOM作为解决方案,但显然它仅适用于数字功能。分类功能是否有扩展?我特别想知道“星期几”是否可能是功能。当然可以将其转换为数值特征(例如,周一至周日对应于1-7号),但是,周日与周一之间的欧几里得距离(1&7)将与周一至周二(1&2)之间的欧氏距离不同)。任何建议或想法将不胜感激。


2
将分类树(部分)组织成一组规则?
一旦使用rpart(在R中)构造了复杂的分类树,是否有办法组织为每个类生成的决策规则?因此,对于每一个类,我们都有一套规则,而不是得到一棵大树? (如果是,如何?) 这是一个简单的代码示例,显示以下示例: fit <- rpart(Kyphosis ~ Age + Number + Start, data=kyphosis) 谢谢。
11 r  classification  cart  rpart 

2
以2D可视化多维数据(LSI)
我正在使用潜在语义索引来查找文档之间的相似性(谢谢,JMS!) 降维后,我尝试了k均值聚类将文档分组为聚类,效果很好。但是我想进一步介绍一下,并将文档可视化为一组节点,其中任意两个节点之间的距离与它们的相似度成反比(高度相似的节点靠在一起)。 令我惊讶的是,由于我的数据> 2维,因此我无法将相似度矩阵准确地简化为2维图。所以我的第一个问题是:是否有标准方法可以做到这一点? 我可以将数据缩小为二维,然后将它们绘制为X轴和Y轴,这对于一组约100-200个文档就足够了吗?如果这是解决方案,那么从一开始就将我的数据缩减为2维更好,还是有什么方法可以从我的多维数据中选择两个“最佳”维? 我正在使用Python和gensim库,如果有区别的话。

3
是否有适用于使用稀疏预测器和响应的类似于CART的方法的库?
我正在使用R中的gbm包处理一些大型数据集。我的预测变量矩阵和响应向量都很稀疏(即,大多数条目为零)。我希望使用一种可以利用这种稀疏性的算法来构建决策树,就像在这里所做的那样。在该论文中,就像我所遇到的情况一样,大多数项目只有许多可能的功能中的少数,因此,除非数据中另有明确说明,否则它们可以通过假设其项目缺少给定功能来避免大量的计算浪费。我的希望是,通过使用这种算法(然后将增强算法包装在其周围以提高预测精度),我可以获得类似的加速效果。 由于他们似乎没有发布代码,所以我想知道是否有针对这种情况优化的开源软件包或库(任何语言)。理想情况下,我想要一种可以直接从R的Matrix包装中获取稀疏矩阵的东西,但我将尽我所能。 我环顾四周,看来应该是这样的事情: 化学家似乎经常遇到这个问题(我上面链接的文章是关于学习寻找新的药物化合物的),但是我可以找到的实现是化学分析的专有或高度专业化的实现。不过,其中之一可能会被重新利用。 文档分类似乎也是从稀疏特征空间学习的一个有用的领域(大多数文档包含的单词不多)。例如,有一个倾斜的参考稀疏实施C4.5的(一个手推车类算法)在本文中,但不包含代码。 根据邮件列表,WEKA可以接受稀疏数据,但是与我上面链接的论文中的方法不同,WEKA在避免浪费CPU周期方面并未进行优化以实际利用它。 提前致谢!

7
数据缩减技术来识别国家类型
我教经济地理入门课程。为了帮助我的学生更好地了解当代世界经济中的国家类型以及对数据缩减技术的理解,我想构建一项作业,以创建不同国家类型的研究(例如,高收入高收入国家预期寿命长;高收入自然资源出口国的预期寿命中等;德国是第一类,而也门是第二类。这将使用可公开获得的开发计划署数据(如果我记得正确的话,其中包含有关不到200个国家的社会经济数据;抱歉,没有可用的区域数据)。 在进行此分配之前,将有另一个要求他们(使用相同的-主要是区间或比率水平-数据)检查这些相同变量之间的相关性。 我的希望是,他们将首先对不同变量之间的关系类型产生一种直觉(例如,预期寿命与[财富的各种指标]之间的正相关;财富与出口多样性之间的正相关)。然后,当使用数据缩减技术时,构成要素或因素将具有一定的直观意义(例如,构成要素/要素1体现了财富的重要性;构成要素/要素2体现了教育的重要性)。 鉴于这些是第二至四年级的学生,通常他们对分析性思维的了解通常比较有限,那么您建议哪种单一的数据缩减技术最适合第二次作业?这些是人口数据,因此推论统计(p-vlaues等)并不是真正必要的。

1
使用中位数和图形表示来报告错误吗?
我已经对论文数据进行了广泛的测试,从参数方差分析和t检验到非参数Kruskal-Wallis检验和Mann-Whitneys检验,以及经过秩转换的2向方差分析和带有二进制的GzLM,泊松和比例数据。现在,当我在结果中写下所有内容时,我需要报告所有内容。 我已经在这里问过如何报告比例数据的不对称置信区间。我知道标准偏差,标准误差或置信区间适用于均值,如果我的所有测试都很好地参数化,这就是我要报告的结果。但是,对于我的非参数测试,我应该报告中位数而不是平均值吗?如果是这样,我将报告什么错误? 与此相关的是如何最好地以图形方式显示非参数测试结果。由于我在类别中主要包含连续或间隔数据,因此通常使用条形图,条形图的顶部是平均值,误差条形图显示95%CI。对于NP测试,我是否仍可以使用条形图,但是条形的顶部代表中位数吗? 感谢您的建议!

2
回归F检验的功效是什么?
多线性回归中变量子集的经典F检验的形式为 其中是“减少”模型下的平方误差总和,嵌套在“大”模型,而是模型的自由度。两种模式。在“大”模型中的额外变量没有线性解释能力的零假设下,统计量以为和的F分布。SSE(R)BdfdfR-dfBdfBF= (SSE(R )− SSE(B ))/(dF[R- dF乙)上证所(B) / dF乙,F=(SSE(R)−SSE(B))/(dfR−dfB)SSE(B)/dfB, F = \frac{(\mbox{SSE}(R) - \mbox{SSE}(B))/(df_R - df_B)}{\mbox{SSE}(B)/df_B}, 上证所(R)SSE(R)\mbox{SSE}(R)乙BBdFdfdfdF[R- dF乙dfR−dfBdf_R - df_BdF乙dfBdf_B 但是,替代方案下的分布是什么?我假设它是一个非中心F(我希望不是双重非中心),但是我找不到关于非中心性参数确切含义的任何参考。我想这取决于真实的回归系数,并且可能取决于设计矩阵,但是除此之外,我不确定。Xββ\betaXXX

2
隐马尔可夫模型中初始过渡概率的意义
在隐马尔可夫模型中为过渡概率指定某些初始值有什么好处?最终,系统将学习它们,那么赋予随机值以外的其他值又有什么意义呢?底层算法是否会像Baum-Welch这样有所作为? 如果我从一开始就非常准确地知道了转移概率,并且我的主要目的是预测从隐藏状态到观测值的输出概率,那么您对我有什么建议?

1
在R中修改线性弹道累加器(LBA)仿真
“线性弹道累加器”模型(LBA)是在快速简单决策任务中用于人类行为的相当成功的模型。唐金等人(2009,PDF)提供代码,允许估计给人类行为数据模型的参数,我已经复制代码(有一些小的格式更改)的要点在这里。但是,我想对模型进行微小的修改,但是我不确定如何在代码中实现此修改。 首先从规范模型开始,LBA将每个响应替代方案表示为一个相当奇怪的比赛中的竞争者,从而使竞争者可以具有以下不同特征: 起始位置:根据U(0,X1)界定的均匀分布,种族之间的差异很大。 速度:在给定的比赛中保持恒定(无加速度),但根据N(X2,X3)定义的高斯分布,不同的比赛之间会有所不同 终点线位置(X4) 因此,每个竞争对手对于X1,X2,X3和X4都有自己的一组值。 比赛重复了很多次,冠军和他们的时间记录在每场比赛之后。X5常数将添加到每个获胜时间。 现在,我要进行的修改是将起点的可变性交换到终点。也就是说,我希望所有竞争者和所有种族的起点都为零,从而消除X1,但是我想添加一个参数X6,该参数指定以X4为中心的均匀分布范围的大小,每个竞争对手从每场比赛都采集终点线。这样,在此模型中,每个竞争对手的价值将分别为X2,X3,X4和X6,而我们的竞争对手价值仍为X5。 如果有人愿意为此提供帮助,我将非常感谢。 哦,并提供从上述“ X”命名参数到我链接的LBA代码使用的变量名的映射:X1 = x0max; X2 =漂移率;X3 =标准差 X4 =气; X5 = Ter。


2
是否值得在引用的Wiki StatProb.com上发布?[关闭]
已关闭。这个问题是基于观点的。它当前不接受答案。 想改善这个问题吗?更新问题,以便通过编辑此帖子以事实和引用的形式回答。 7个月前关闭。 背景 我从对Andrew Gelman的Blog的评论中了解到StatProb.com。 根据该网站,StatProb为: StatProb:由统计与概率协会赞助的百科全书结合了传统Wiki(快速和最新发布,用户生成的开发,超链接和保存的历史记录)与传统发布(质量保证,审阅,作者信誉)的优势,以及结构化的信息显示)。所有贡献均已由领先的统计协会确定的编辑委员会批准;编辑委员会成员列在“关于”页面上。 我不是统计学家,但是我使用统计学,因此该站点似乎为我提供了机会,尽管我可能将其发布为附录或将其发布在网站上,但这些材料虽然可能对其他人有用,但可能不会发布。该选项之所以具有吸引力,是因为审查过程将增强我对我使用的方法的信心,并使其在公共领域具有一定的信誉。 尽管得到了主要统计和概率协会的支持,该站点仍未起飞。确实,一位博主问“ RIP StatProb?” 而且捐款的频率一直在下降。 题: 通过StatProb.com进行发布值得付出努力吗? 更新: 截至今天(2012-02-01),最近的贡献是2011-05-04 ; 最近编辑2011-06。因此,今天的问题看上去比最初提出问题时的吸引力要小。


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.