统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


4
比较具有相同自由度数的混合效果模型
我有一个实验,将在这里尝试进行抽象。想象一下,我在您面前扔了三块白色的石头,请您对它们的位置做出判断。我记录了宝石的各种特性以及您的反应。我在许多主题上都这样做。我生成两个模型。一个是离您最近的石头可以预测您的反应,另一个是石头的几何中心可以预测您的反应。因此,在RI中使用lmer可以编写。 mNear <- lmer(resp ~ nearest + (1|subject), REML = FALSE) mCenter <- lmer(resp ~ center + (1|subject), REML = FALSE) 更新和更改-更直接的版本,其中包含一些有用的注释 我可以尝试 anova(mNear, mCenter) 当然,这是不正确的,因为它们不是嵌套的,而且我不能真的那样比较它们。我期望anova.mer引发错误,但没有。但是我可以在这里尝试的嵌套并不是自然的,而且仍然使我缺乏分析性的陈述。当模型自然嵌套(例如线性二次)时,测试只是一种方法。但是在这种情况下,发现不对称意味着什么? 例如,我可以建立一个模型三: mBoth <- lmer(resp ~ center + nearest + (1|subject), REML = FALSE) 然后,我可以进行方差分析。 anova(mCenter, mBoth) anova(mNearest, mBoth) 这样做很公平,现在我发现该中心增加了最近的效果(第二个命令),但当将最近的一个中心添加到中心时,BIC实际上上升了(简化了简约性)。这证实了所怀疑的。 但是找到足够了吗?当中心和最近位置高度相关时,这公平吗? 当不是要添加和减去解释变量(自由度)时,是否有更好的方法来分析比较模型?

3
你们中的某些人是否使用Google Docs电子表格来进行和与他人共享统计工作?
我知道你们大多数人可能会觉得Google文档仍然是一种原始工具。它不是Matlab或R,甚至不是Excel。但是,我对这种基于Web的软件的强大功能感到困惑,该软件仅使用浏览器的操作功能(并且与许多工作方式非常不同的浏览器兼容)。 活跃在该论坛中的Mike Lawrence已使用Google Docs与我们共享了一个电子表格,并在其中做了一些漂亮的工作。我个人已经复制了一个非常全面的假设测试框架(包括众多参数和非参数测试),最初是在Google文档的Excel中完成的。 我很想知道您是否尝试过Google文档,并在有趣的应用程序中将其推到了极限。我也很想听听您在使用Google文档时遇到的错误或缺陷 我将这个问题指定为“用于社区Wiki”,表示对此没有最佳答案。它比任何东西都更重要。

5
一种以图形方式显示大量数据的好方法
我正在从事一个涉及14个变量和345,000个房屋数据观测值的项目(例如建造年份,平方英尺,已售价格,居住县等)。我担心要尝试找到好的图形技术和包含好的绘图技术的R库。 我已经看到ggplot和lattice中的内容会很好地工作,并且我正在考虑为一些数字变量绘制小提琴图。 人们会建议使用哪些其他软件包来以清晰,简洁,最重要的是简洁的方式显示大量的数字或因子类型的变量?

10
数据挖掘软件工具概述
尽管我曾经接受过工程师培训,但是发现我对数据挖掘越来越感兴趣。现在,我正在尝试进一步调查该领域。特别是,我想了解现有的软件工具的不同类别,以及每个类别中值得注意的工具以及原因。(请注意,我并不是说“最佳”工具,只是那些著名的工具,以免我们发动火焰大战。)尤其要注意开放源代码和免费提供的工具,尽管这并不意味着我只对开源和免费感兴趣。

4
寻找良好的荟萃分析治疗方法
一位(非统计师)同事在他为医学期刊撰写的论文中遇到了荟萃分析,并且正在寻找良好的入门级治疗方法,以便他可以自学。有什么建议吗?最喜欢的?书籍,专着,非技术性调查文章都可以。 (是的,他熟悉Wikipedia条目以及Google搜索可轻松访问的其他内容,例如Jerry Dallal的精彩小文章。)

5
James-Stein在野外收缩?
我被詹姆斯·斯坦因收缩的思想所吸引(即,对可能独立的法线向量的一次观测的非线性函数可能是对随机变量均值的更好估计,其中“更好”是通过平方误差来衡量的) )。但是,我从未在应用程序工作中看到它。显然,我没有足够的阅读能力。是否有经典的例子说明James-Stein在实际应用中改进了估计?如果不是,这种缩水仅仅是出于好奇吗?

5
机器学习技术在小样本临床研究中的应用
当目标是在分类环境中隔离有趣的预测变量时,您如何在小样本临床研究中应用随机学习或惩罚回归(具有L1或L2罚分,或其组合)等机器学习技术呢?这不是关于模型选择的问题,也不是关于如何找到变量效果/重要性的最佳估计的问题。我不打算进行强力推断,而只是使用多变量建模,因此避免一次针对感兴趣的结果测试每个预测变量,并避免考虑它们之间的相互关系。 我只是想知道这种方法是否已经在这种特殊的极端情况下应用,比如说20-30个对象中有10-15个分类变量或连续变量的数据。这是不完全情况下,我觉得这里的问题是关系到我们班试图解释(这往往是没有得到很好的平衡)的数量,和(很)小样本。我知道在生物信息学的背景下有关该主题的大量文献,但是我没有找到任何与通过心理计量表型进行生物医学研究有关的参考文献(例如,整个神经心理学问卷调查)。n≪pn≪pn\ll p 对相关论文有任何提示或指示吗? 更新资料 我愿意接受任何其他用于分析此类数据的解决方案,例如C4.5算法或其派生类,关联规则方法以及任何用于监督或半监督分类的数据挖掘技术。

9
哪些书概述了适用于计算机科学的计算统计信息?
作为软件工程师,我对诸如统计算法,数据挖掘,机器学习,贝叶斯网络,分类算法,神经网络,马尔可夫链,蒙特卡洛方法和随机数生成等主题感兴趣。 我个人不喜欢使用这些技术中的任何一种,但是我不得不使用在幕后使用了这些技术并且希望从更高层次上了解它们的软件。我正在寻找涵盖广度的书-目前不需要深度。我认为,如果我能理解所采用的算法和技术背后的数学基础,就可以学到很多有关软件开发的知识。 统计分析社区可以推荐我可以用来学习更多有关在软件中实现各种统计元素的书籍吗?




3
在对大量人口进行投票时,您如何确定样本量?
澳大利亚目前正在进行选举,可以理解,媒体每天都会报道新的政治民意调查结果。在一个2200万的国家中,需要多少百分比的人口才能获得统计上有效的结果? 使用太大的样本是否可能会影响结果,或者统计有效性是否随样本大小单调增加?


5
为什么美国和英国学校采用不同的标准差计算方法?
据我了解,英国学校教导说使用以下方法可以找到标准偏差: 而美国学校则教: (无论如何都是基本水平)。 过去,这曾导致我的许多学生在Internet上进行搜索时遇到问题,但发现了错误的解释。 为什么会有所不同? 如果使用简单的数据集(例如10个值),那么如果采用错误的方法(例如,在检查中),将会出现什么程度的错误?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.