单独数据分析师的R和版本控制
我尊重的许多数据分析师都使用版本控制。例如: http://github.com/hadley/ 请参阅http://permut.wordpress.com/2010/04/21/revision-control-statistics-bleg/ 但是,我正在评估采用git之类的版本控制系统是否值得。 简要概述: 我是一位社会科学家,他使用R来分析研究出版物的数据。我目前不生产R包。我的项目R代码通常包括几千行代码,用于数据输入,清理,操作,分析和输出生成。出版物通常使用LaTeX编写。 关于版本控制,我已经读过许多好处,但是它们似乎与单独数据分析师的关系不大。 备份:我已经有一个备份系统。 分叉和倒带:我从没有觉得有必要这样做,但是我可以看到它的用处(例如,您正在基于同一数据集准备多个期刊文章;您正在准备每月更新的报告等) ) 协作:大多数时候,我自己分析数据,因此,我无法获得版本控制的协作优势。 采用版本控制还涉及一些潜在成本: 是时候评估和学习版本控制系统了 与我当前的文件管理系统相比,可能会增加复杂性 但是,我仍然觉得自己缺少一些东西。关于版本控制的一般指南似乎更多地针对计算机科学家而不是数据分析师。 因此,特别是针对与上述情况类似的数据分析人员: 版本控制值得付出努力吗? 采用版本控制的主要利弊是什么? 使用R进行数据分析的版本控制的最佳策略是什么(例如,示例,工作流程构想,软件,指南链接)?