统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
有没有办法禁用CARET中的参数调整(网格)功能?
在选择最终模型之前,CARET将自动使用预先指定的调整网格来构建各种模型,然后在完整的训练数据上训练最终模型。我可以只用一种参数组合来提供自己的调整网格。但是,即使在这种情况下,CARET也会在调整参数中“选择”最佳模型(即使在这种情况下只有一个),然后将最终模型拟合到所有训练数据。这是我要避免的额外步骤。 如何简单地跳过调整网格中各种变化的模型搜索步骤,并强制CARET建立在所有训练数据上(而不是直接调用基础模型库)?
15 r  caret 

3
如何评估标准偏差?
我已经收集了来自85个人对他们执行某些任务的能力的反馈。 回答采用李克特五分制: 5 =很好,4 =良好,3 =平均,2 =差,1 =差, 平均得分是2.8,标准偏差是0.54。 我理解平均值和标准偏差代表什么。 我的问题是:这个标准偏差有多好(或坏)? 换句话说,是否有任何准则可以帮助评估标准偏差。

1
SAS和R中ANOVA中III型平方和的冲突结果
我从不平衡因子实验都与分析数据SAS和R。双方SAS并R提供平方类似的I型和广场,但他们的III型总和彼此不同。以下是SAS和R代码以及输出。 DATA ASD; INPUT Y T B; DATALINES; 20 1 1 25 1 2 26 1 2 22 1 3 25 1 3 25 1 3 26 2 1 27 2 1 22 2 2 31 2 3 ; PROC GLM DATA=ASD; CLASS T B; MODEL Y=T|B; RUN; SAS的I型SS Source …
15 r  anova  sas  sums-of-squares 

3
什么是实际上良好的数据分析过程?
我想了解或参考大多数统计数据分析师在每个数据分析项目中都要经过的分析过程。 如果要列出清单,要完成数据分析项目,分析师必须: 首先收集项目需求, 之前根据这些要求计划/设计数据分析 实际上是预处理数据, 执行数据分析并 根据他的分析结果撰写报告。 对于这个问题,我对第2步的更多细节感兴趣。但是我理解这实际上并不明确,因为分析师可能必须根据数据分析输出更改其计划或设计。关于这个主题有参考吗?

4
专家有害吗?
我正在阅读“国际象棋在人工智能研究中的作用”(pdf),有趣的是,它说: 经验表明,国际象棋专家的意见虽然普遍有用,但不能完全信任。 深入思考的评估功能就是一个很好的例子。有能力的国际象棋专家进行的几次更改均未带来明显的改进,有时甚至会对机器的性能造成负面影响。 在这里,人类专家及其专业知识向该计划介绍了自己的偏见。解决此问题的一种方法是限制程序中允许的专家输入的类型和数量。在另一台几乎没有“知识”的机器上。 在现代研究和实践中这有多真实? 这是一个大问题,还是仅仅是国际象棋游戏的一个特定问题?

2
基因编程使用什么语言
作为作业的一部分,我将必须编写一种遗传编程算法来预测大气污染物的水平。由于我没有经验,因此任何人都可以向我指出编程语言的命题,在这些命题中将编写演化的程序。 澄清:我不是在问我将自己编写遗传算法的语言是什么(因为我将能够自己做出决定),而是在问应该使用哪种编程语言来创建进化的程序。 我的老师建议使用Lisp,但我不喜欢这个想法-首先,我必须研究某种抽象语法树,其次,可靠地对树结构进行交叉操作可能会很麻烦。 我宁愿使用一些专用于遗传编程像斜线/ A。SlashA不需要在AST上工作-字节码中的程序只是一个int数组,可以根据需要更改它,因为每个int数组都表示某个slash / A程序。 附加说明: 我想避免操纵AST! 这个问题很难解决(也许不如预测库存值那么困难)。这是由于以下事实(很可能),我们没有足够的输入信息(有一些隐藏参数)。创建具有更好性能的模型(返回模型意味着更好的性能)是一个挑战(平均模型的MAPE为35%),大多数模型的MAPE约为25%,最好为20%。 我想使用一种语言来管理具有许多功能的数据集,但前提是我不确定哪些功能很重要。(这里的斜杠/ A有一个缺点-在这种语言中,输入功能是按顺序读取的-因此某些功能将以较大的概率使用)。 我希望能够用Python进行编程,因此python库将很棒---但我可以为C / C ++进行绑定(没有Java,没有Matlab等)。 我意识到这是一个调查问题,因此,如果该问题为时过早,请关闭它,但我认为它足够具体。

2
LASSO / LARS与一般到特定(GETS)方法
我一直在想,为什么LASSO和LARS模型选择方法如此受欢迎,即使它们基本上只是逐步向前选择的变体(并因此受到路径依赖性)? 同样,为什么通用到特定(GETS)方法用于模型选择,尽管它们比LARS / LASSO更好,因为它们没有逐步回归问题,因此为什么大多数该模型被忽略?(关于GETS的基本参考资料:http ://www.federalreserve.gov/pubs/ifdp/2005/838/ifdp838.pdf-其中的最新算法从避免路径依赖的广泛模型和树搜索开始,并且已经证明可以通常比LASSO / LARS更好。 似乎很奇怪,LARS / LASSO似乎比General to Specific(GETS)获得了更多的曝光和引用,有人对此有何想法? 并非试图引发激烈的辩论,而是寻找合理的解释,以解释为什么文学似乎确实集中在LASSO / LARS而不是GETS上,很少有人指出LASSO / LARS的缺点。

4
高脂肪数据分类
我需要在笔记本电脑上训练带有数十万个数据点和约一万个功能的线性分类器。我有什么选择?这种问题的最新状态是什么? 似乎随机梯度下降是有前途的方向,我的感觉是这是最新技术: “ Pegasos:SVM的原始估计次GrAdient求解器”,Shai Shalev-Shwartz,Yoram Singer,Nathan Srebro,Andrew Cotter。“数学编程,系列B,127(1):3-30,年份:2007。”。 这是共识吗?我应该朝其他方向看吗?


2
如何使用Cox比例风险模型进行交叉验证?
假设我已经针对一个数据集(模型构建数据集)中特定疾病的发生构建了一个预测模型,现在想检查该模型在新数据集(验证数据集)中的运行情况。对于使用Logistic回归构建的模型,我将根据从模型构建数据集获得的模型系数计算验证数据集中每个人的预测概率,然后在将某些概率按临界值二等分后,可以构建一个2x2的表格这样我就可以计算出真实的阳性率(敏感性)和真实的阴性率(特异性)。此外,我可以通过更改截止值来构建整个ROC曲线,然后获得ROC图的AUC。 现在假设我实际上有生存数据。因此,我在模型构建数据集中使用了Cox比例风险模型,现在想检查模型在验证数据集中的运行情况。由于基准风险不是Cox模型中的参数函数,因此我看不到如何基于在模型构建数据集中获得的模型系数来获得验证数据集中每个人的预测生存概率。那么,我该如何检查模型在验证数据集中的表现呢?有确定的方法可以做到这一点吗?如果是,它们是否在任何软件中实现?在此先感谢您的任何建议!

2
在R中对树进行分区:party与rpart
自从我看着分区树已经有一段时间了。上次我做这种事情时,我喜欢R中的聚会(由Hothorn创建)。通过采样进行条件推断的想法对我来说很有意义。但是,rpart也具有吸引力。 在当前的应用程序中(我无法提供详细信息,但是它涉及尝试确定谁将在大量被捕者中入狱),我无法使用高级方法,例如随机森林,装袋,助推等。-我需要一个容易解释的方法规则。 我还希望对拆分的节点进行一些手动控制,如Zhang&Singer(2010)递归分区和应用中所建议。该书随附的免费软件允许这样做,但在其用户输入中相当原始。 有什么建议或建议吗?
15 r  cart  rpart  partitioning 

1
预测连续变量时应如何实施决策树拆分?
我实际上是在编写随机森林的实现,但我相信这个问题特定于决策树(独立于RF)。 因此,上下文是我正在决策树中创建一个节点,并且预测变量和目标变量都是连续的。该节点有一个分割阈值,可将数据划分为两个集合,我根据每个集合中的平均目标值为每个子集创建新的预测。这是正确的方法吗? 我问的原因是,在预测二进制变量时,我相信典型的方法(正确吗?)是将数据分为0和1个子集,而不需要对每个子集的数据行取平均值。随后的分割将被划分为更细粒度的子集,并在每个分割处取平均值,结果后续的分割(决策树下方)将根据现在的连续变量而不是二进制变量进行操作(因为我们对残差值而不是原始值进行运算)目标)。 附带的问题:两种方法(二进制方法与连续方法)之间的区别是否显着-还是对于完整的决策树它们实际上会给出相同的结果?

3
在计算机实验室中教授R的好方法是什么?
已经有几个很好的问题,并在集合的入门书籍的答案或方法,以学习[R如这里和这里。但是我有一个稍微不同的问题-在计算机实验室中运行一个小时的会话(或几个这样的会话)的最佳方法,这将使人们开始使用R,熟悉其基本方法等。 我目前的计划是有效地学习Verzani的SimpleR之类的入门章节,然后介绍一个熟悉的数据集,但是人们发现其他有用的方法吗?例如,直接引入真实数据还是以更抽象的方式解决问题是否很好?我应该详尽地学习如何使用方括号,还是要激发人们使用点阵图形的实例? 我的目标受众熟悉统计数据(尽管不是专家)和合格的SPSS用户;除了您在SPSS和类似功能中获得的那种宏和脚本之外,对编程语言不熟悉。 任何提示或对课程计划的引用,将不胜感激。但是,我不想复制许多介绍R的在线材料的好清单-严格参考面对面的教学问题。
15 r  teaching 


3
什么时候应该考虑使用GMM?
使计量经济学与众不同的一件事是使用广义矩法。 哪些类型的问题使GMM比其他估算技术更合适?从效率,减少偏差或更具体的参数估计的角度来看,使用GMM有什么好处? 相反,通过在MLE上使用GMM等会丢失什么?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.