统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
改善数据集中的变量名
好的变量名是: a)简短/易于输入, b)容易记住, c)可以理解/交流。 我忘记了什么吗?一致性是要寻找的东西。我要说的是,一致的命名约定有助于上述质量。一致性有助于(b)容易回忆和(c)易懂性,尽管其他因素通常更重要。在(a)名称长度/键入的难易程度(例如,所有小写字母)和(c)易懂性之间存在明显的权衡。 我在这些问题上投入了相当多的思想,因为成千上万的人正在使用数据,并且希望许多人将使用我的代码来准备数据并促进某些类型的分析。来自青少年健康纵向研究的数据分为多个数据集。我的第一步是将最常用的数据集中的227个变量重新编码,为它们指定更有意义的名称。原始变量名称是诸如“ aid”,“ s1”,“ s2”之类的名称,我将其重命名为“ aid2”,“ age”和“ male.is”。在其他数据集中还有成千上万的其他变量可以根据研究者的目标进行合并。 只要我重命名变量,我就想让它们尽可能有用。这是我考虑过的一些问题。到目前为止,我仅使用小写字母,避免使用任何破折号或下划线,并且仅将句号用于一种非常特定的目的。这具有简单性和一致性的优点,并且对于大多数变量没有任何问题。但是随着事情变得越来越复杂,我很想破坏我的一致性。以我的变量“ talkprobmsum”为例,将其更容易阅读为“ talkProbMSum”或更好的为“ talk.prob.m.sum”,但是如果我要使用大写字母或句点来分隔单词,则我不应该对所有变量都这样做吗? 有些变量会被多次记录,例如种族变量,因此我在其后附加了.is或.ih,以表明它们是来自学校还是家庭问卷。但是肯定有一些我还不知道的重复,将对数据集的引用附加到每个变量的名称上会更好吗? 我需要对许多变量进行分组居中并进行标准化,我这样做的方法是通过附加.zms来表示男性和学校的z分数。 任何一般或特定的想法或资源,将不胜感激。看到我的一些代码以及具有变量名列表的描述性统计信息,见此存储库。我简要描述的原因分享这段代码在这里,它被宣传了一下这里,但最后这两个环节不变量命名惯例的问题确实有关。 补充:我对此内容进行了少量编辑,主要是为了移动段落,以免避免注释中明显的混淆。感谢您的想法! 新增2016-09-05:值得注意的是Hadley Wickham的R风格指南和Google的R风格指南 ... Hadley说: 变量和函数名称应小写。使用下划线(_)分隔名称中的单词。 Google说: 请勿在标识符中使用下划线(_)或连字符(-)。标识符应根据以下约定命名。变量名的首选形式是所有小写字母和单词,并用点号(variable.name)分隔,但variableName也被接受;函数名称带有大写字母且没有点(FunctionName);常量的名称类似于函数,但以k开头。


1
在R中安装Poisson GLM-费率与计数有关的问题
我目前正在从事一个涉及GLM(最终是GAM)的项目,这些项目随着时间的推移会越来越多。通常,我会在SAS中执行此操作,但是我试图移至R,并遇到了一些问题。 当我适合使用以下方法对GLM进行计数时: cdi_model <- glm(counts ~ exposure + covariate + month, data=test, family = poisson) 我得到: Deviance Residuals: Min 1Q Median 3Q Max -1.9825 -0.7903 -0.1187 0.5717 1.7649 Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 1.97563 0.20117 9.821 < 2e-16 *** exposure 0.94528 0.30808 3.068 0.00215 ** covariate -0.01317 …

2
什么是“单位信息优先权”?
我一直在阅读Wagenmakers(2007)一种解决普遍存在的p值问题的实用方法。我对将BIC值转换为贝叶斯因子和概率很感兴趣。但是,到目前为止,我对单元信息先验到底是什么还不太了解。我将不胜感激,对图片或此图片的R代码进行解释。

2
如何从Cox PH模型计算预测的危险率?
我有以下Cox PH模型: (时间,事件)〜X + Y + Z 我想获得预测的危险率(我说的是风险率不危险比)给出的具体值X,Y,Z。我知道muhaz R软件包可以计算观察到的危险率,但是我对预测模型感兴趣。 有没有办法在R中做到这一点?
11 r  survival  hazard  cox-model 

4
彩票中哪些人最不可能选择哪个号码?
如今,超级百万富翁的资产超过5亿美元。我记得读过一篇JSTOR文章,内容涉及一些最不可能选择的数字。例如,很多人选择7是因为这是他们的幸运数字,我想要相反的数字。但是我的JSTOR成员资格用完了。在1到80之间的数字彩票中,人们最不可能选择哪个数字作为彩票选择? 注意:每个数字都有相等的机会被选中;我想选择数字,没有人可以选择,因此如果我赢了,我不必与任何人分享奖金。


1
比较模型与已转换和未转换响应的拟合度
我想比较三个不同组之间的比例数据,例如: ID Group Prop.Nitrogen 1 A 0.89 2 A 0.85 3 B 0.92 4 B 0.97 跟随沃顿商学院(Wharton and Hui)(doi:10.1890 / 10-0340.1 1),虽然我会看看使用转换后的logit是否可以更好地处理这些数据。 当我查看已转换和未转换数据上线性模型的诊断图时,它们看起来非常相似,没有明显的问题,并且估计参数只有很小的差异。但是,我仍然想对模型适合数据转换和未转换版本的方式说些什么-我知道我无法直接比较AIC值。有没有更正,我可以检查一下?还是应该采用其他方法?

3
实用的PCA数据教程
在Internet上搜索PCA教程可获得数千个结果(甚至是视频)。许多教程非常好。但是我找不到任何实际的示例,其中使用一些可用于演示的数据集来解释PCA。我需要一个教程,该教程提供一些易于绘制的小型数据集(而不是10000s的数据线和100s的尺寸),在PCA分析之前和之后,其差异/结果可以清楚地说明。(我认为一个逐步的实际示例非常有用,该示例中的数据大约有100条线和3维。 你有什么建议吗?

2
什么是AI的果蝇?
在1960年代中期,研究人员曾将国际象棋称为“ 人工智能果蝇 ”:象果蝇一样,国际象棋的游戏是可访问的,是相对较简单的实验问题,但仍产生了更复杂的重要知识。 现在,人们似乎在说“象棋只是一个搜索问题”,“象棋方法将不会给AI社区带来更多的兴趣”。 那么,什么是AI 的果蝇呢?

1
自动选择特征以进行异常检测
自动选择特征以进行异常检测的最佳方法是什么? 我通常将异常检测视为一种算法,由专家选择特征:重要的是输出范围(如“异常输入-异常输出”),因此即使具有许多功能,您也可以通过组合来得出更小的子集特点。 但是,假定在一般情况下功能列表可能很大,则有时自动学习有时会更可取。据我所知,有一些尝试: 概括支持向量数据描述的“异常检测的自动特征选择”(pdf) 我想使用粗糙集理论的“使用粗糙集理论的基于主机的快速入侵检测系统”(没有可用的pdf?) 使用统计方法的“异常检测敌对网络流量的学习规则”(pdf,视频) 因此,现在我想知道是否有人可以告诉您-假设检测到异常并具有非常大的功能(数百个): 这些庞大的功能集是否有意义?我们不应该将功能集减少到几十个吗? 如果庞大的功能集确实有意义,那么上述哪种方法会给出更好的预测,为什么?有没有列出更好的东西? 与降维或通过聚类/排序/等进行特征构建相比,为什么它们应该提供更好的结果?

1
贝叶斯网络中的马尔可夫毯与正常依存关系
当我阅读贝叶斯网络时,我遇到了“ 马尔可夫毯 ”一词,并对其在贝叶斯网络图中的独立性感到困惑。 马尔可夫毯子简短地说,每个节点仅依赖于其父代,子代和子代父代(图中节点A的灰色区域)。 这个BN,的联合概率是多少?P(M,S,G,I,B,R)P(M,S,G,I,B,R)P(M,S,G,I,B,R) (来源:aiqus.com) 如果我遵循步骤“仅父项”独立规则,则为: P(M|S)P(S|G,I)P(I|B)P(R|B)P(G)P(B)P(M|S)P(S|G,I)P(I|B)P(R|B)P(G)P(B) P(M | S)P(S | G,I)P(I | B)P(R | B)P(G)P(B) 但是,如果遵循马尔可夫毯子独立性,则会得出此结果(注意是不同的):P(I|G,B)P(I|G,B)P(I|\mathbf{G},B) P(M|S)P(S|G,I)P(I|G,B)P(R|B)P(G)P(B)P(M|S)P(S|G,I)P(I|G,B)P(R|B)P(G)P(B)P(M | S)P(S | G,I)P(I | \mathbf{G},B)P(R | B)P(G)P(B) 那么,这个国阵的正确联合概率是多少? 更新:AIQUS中此问题的交叉链接 和 以下各章和图表: 替代文字http://img828.imageshack.us/img828/9783/img0103s.png 替代文字http://img406.imageshack.us/img406/3788/img0104l.png


4
可以通过删除一些连接来获得更好的ANN?
我想知道在某些情况下,如果您修剪掉一些与它们之间的联系,ANN是否有可能表现得更好? 通过并行获取两个多层ANN A和B(相同的输入和输出节点)来构造一个ANN,在A和B的隐藏层之间添加一些“通信”连接? 能否获得更好的泛化结果? 这是在实践中以某种方式使用的,还是总是只使用多层的全连接网络?

4
如何在回归模型中概念化误差?
我正在参加数据分析课程,而我一些根深蒂固的想法正在动摇。即,误差(ε)以及任何其他类型的方差的想法仅(据我认为)适用于一组(样本或整个人群)。现在,我们被告知回归假设之一是方差“对于所有个体都是相同的”。这在某种程度上令我震惊。我一直认为,假设所有X值中Y的方差都是恒定的。 我与教授聊天,他告诉我,当我们进行回归分析时,我们认为我们的模型是正确的。我认为那是棘手的部分。对我而言,误差项(epsilon)始终表示“诸如我们不知道的任何元素,它们可能会影响我们的结果变量,以及一些测量误差”。在课堂教学中,没有“其他东西”之类的东西。我们的模型假设是真实完整的。这意味着必须将所有残差视为测量误差的乘积(因此,一次测量20个人将产生与一次测量20个人相同的方差)。 我觉得某处有问题,对此我希望有一些专家意见...从概念上来讲,关于错误术语是什么还可以解释吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.