统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
学习使用(/创建)动态(/交互式)统计可视化资源
我想了解更多有关交互式数据可视化的知识(缩放,指向,笔刷,点映射等)。我欢迎任何人: 有关如何使用这种方法进行统计探索的教程/指南/书(?)/视频。 良好/有趣的交互式data-viz包(在R中和外部)的指针 刚开始滚动时,我知道R中有多种获得交互式可视化的方法,例如rggobi,新的googleViz R程序包,动画程序包等。但是,如果还有其他值得探索的软件包(提供R所没有的东西),我将很高兴了解它们(例如jmp,mathlab,spss,sas,excel等)。 ps:这是使用标签“交互式可视化”的第一个问题

3
在不采用信号检测理论衍生指标的情况下分析信号检测数据是否有效?
信号检测实验通常向观察者(或诊断系统)呈现信号或非信号,并且要求观察者报告他们是否认为所呈现的物品是信号还是非信号。此类实验产生的数据填充2x2矩阵: 信号检测理论表示这样的数据,即表示“信号/非信号”决策基于信号连续性的场景,在这种情况下,信号试验通常比非信号试验具有更高的价值,观察者只需选择一个标准值,高于该值他们将报告“信号”: 在上图中,绿色和红色分布分别代表“信号”分布和“非信号”分布,而灰线则代表给定观察者选择的标准。在灰线的右侧,绿色曲线下方的区域表示命中,红色曲线下方的区域表示误报警。在灰线的左侧,绿色曲线下方的区域表示未命中,红色曲线下方的区域表示正确的拒绝。 可以想象,根据此模型,落入上面2x2表的每个单元格中的响应比例由以下方式确定: 从绿色和红色分布中采样的试验的相对比例(基本比率) 观察者选择的标准 分布之间的分离 每个分布的方差 分布之间的方差相等有任何偏离(上面描述了方差相等) 每个分布的形状(以上均为高斯分布) 通常,只能通过让观察者在多个不同的标准级别上做出决策来评估#5和#6的影响,因此我们暂时将其忽略。另外,#3和#4仅相对于彼此有意义(例如,相对于分布的可变性而言,间隔有多大?),通过“可区分性”(也称为d')的度量来概括。因此,信号检测理论禁止根据信号检测数据评估两个属性:标准和可辨别性。 但是,我经常注意到,研究报告(尤其是医学领域的报告)未能应用信号检测框架,而是尝试分析诸如“正预测值”,“负预测值”,“灵敏度”和“特异性”之类的量。 ”,它们都代表与上面2x2表不同的边际值(有关详细信息,请参见此处)。 这些边际属性提供什么效用?我倾向于完全无视它们,因为它们混淆了标准和可辨别性的理论上独立的影响,但我可能只是缺乏想象力来考虑它们的好处。

2
Sane逐步回归?
假设我要构建一个二进制分类器。我有数千个功能,而样本只有几十个。从领域知识来看,我有充分的理由相信仅使用一些功能就可以准确预测类标签,但是我不知道哪个功能可以正确预测。我还希望最终决策规则易于解释/解释,从而进一步需要少量功能。我功能的某些子集高度相关,因此,独立选择最具预测性的几个子集将行不通。我还希望能够对我的功能进行有意义的假设检验。 在这些条件下,以下逐步回归程序是否合理: 给定模型中已经存在的特征(或仅在第一次迭代中截取),选择添加到模型中时产生最大对数似然比的特征。使用似然比卡方检验为在此选择中执行的每个假设检验计算名义P值。这里的无效之处在于,将额外的变量添加到模型中不会提供任何额外的预测能力。另一种选择是,它确实提高了预测能力 将每个迭代的步骤1中测试的假设作为一个族来对待,并使用Benjamini-Hochberg之类的东西为最小P值(针对所选特征)计算错误发现率。 除非满足某些停止条件,否则转到1。 报告对个人特征的错误发现率,但不能用于模型作为一个整体的P值(因为这将是大规模膨胀)。给定先前添加到模型中的所有特征,这些多个测试校正的P值中的每一个均代表该特征的统计显着性。 在这种情况下这样做是否能成功避免所有典型的逐步回归批评?以这种方式计算的错误发现率是否合理?

3
从三向方差分析表中删除因子
在最近的一篇论文中,我安装了一个三向固定效果模型。由于其中一个因素并不重要(p> 0.1),因此我将其删除,并使用两个固定的效果和一个相互作用对模型进行了重新拟合。 我刚刚让裁判发表评论,引用一下: 时间不是三方方差分析的重要因素,本身也不是汇集时间因素的充分标准:关于此问题的标准文本(Underwood 1997)认为,非显着影响的p值必须为大于0.25才能合并一个因子的治疗水平。作者应在此处给出相关的p值,并参考Underwood 1997证明其合并的合理性。 我的问题是: 我从未听说过0.25规则。还有其他人吗?我可以理解的是,如果p值接近临界值,则无法删除该因素,但是拥有“规则”似乎有点极端。 这位裁判指出,Underwood 1997是标准文本。真假的啊?我从来没听说过。标准文本是什么(是否存在这样的东西)?不幸的是,我无法访问1997年的Underwood。 对裁判的任何建议。 背景:本文已提交给非统计期刊。当拟合三向模型时,我检查了交互作用。

2
解释R中的drop1输出
在R中,drop1命令输出整洁的东西。 这两个命令应该为您提供一些输出: example(step)#-> swiss drop1(lm1, test="F") 我的看起来像这样: > drop1(lm1, test="F") Single term deletions Model: Fertility ~ Agriculture + Examination + Education + Catholic + Infant.Mortality Df Sum of Sq RSS AIC F value Pr(F) <none> 2105.0 190.69 Agriculture 1 307.72 2412.8 195.10 5.9934 0.018727 * Examination 1 53.03 2158.1 189.86 …


6
确定状况“ B”对治疗“ A”的益处时,有效性和功效之间有何区别?
这个问题的背景是在健康框架内,即在疾病治疗中寻找一种或多种疗法。看起来,即使是受人尊敬的研究人员也可以将术语功效和效力混淆使用,这两个术语可以互换使用。 如何以一种有助于消除困惑的方式来考虑功效与功效? 哪种类型的研究设计最适合确定两种类型的结果? 有什么权威的期刊出版物,书籍或网络词典对我有帮助吗?

4
是否存在三阶渐近线?
统计中的大多数渐近结果证明,当n→∞n→∞n \rightarrow \infty,基于似然函数的二阶泰勒展开,估计量(例如MLE)收敛到正态分布。我相信在贝叶斯文学中也有类似的结果,即“贝叶斯中心极限定理”,它表明后验渐近收敛为n → ∞的法线。n→∞n→∞n \rightarrow \infty 我的问题是-根据泰勒级数的第三项,分布是否收敛到正态“之前”?还是一般不可能做到这一点?

2
如果连接数不能为负,那么连接数如何为高斯呢?
我正在分析社交网络(不是虚拟网络),并且观察到人与人之间的联系。如果一个人会选择另一个人随机连接,则一组人中的连接数将以正态分布-至少根据我当前正在阅读的书。 我们怎么知道分布是高斯分布(正态分布)?有其它分布例如泊松,大米,瑞利等在理论高斯分布的问题是,该值从去−∞−∞-\infty到+∞+∞+\infty(虽然概率朝向零去)和连接的数量不能为负。 没有人知道在每个人独立(随机)地搭接另一个人的情况下可以预期的分布吗?


4
平滑时间序列数据
我正在构建一个Android应用程序,该应用程序在睡眠期间记录加速度计数据,以便分析睡眠趋势并有选择地在轻度睡眠期间将用户唤醒在所需时间附近。 我已经建立了收集和存储数据以及警报的组件。我仍然需要以一种非常有意义和清晰的方式来应对显示和保存睡眠数据的难题,最好也可以进行分析。 几张图片说了两千个字:(由于重复率低,我只能发布一个链接) 这是未过滤的数据,以30秒为间隔收集的移动总和 和相同的数据,通过我自己的移动平均平滑表现进行了平滑 编辑)这两个图表都反映了校准-有一个最小的``噪声''过滤器和一个最大截止过滤器以及一个警报触发电平(白线) 不幸的是,这些都不是最优的解决方案-第一个对于普通用户来说有点难以理解,第二个更容易理解,却隐藏了很多实际情况。特别是,平均消除了运动中尖峰的细节,我认为这些可能是有意义的。 那么,为什么这些图表如此重要?这些时间序列会在整个晚上作为对用户的反馈进行显示,并将在以后存储以供查看/分析。平滑处理将理想地降低内存成本(RAM和存储),并使这些资源匮乏的电话/设备上的渲染速度更快。 显然,有一种更好的方法来平滑数据-我有一些模糊的想法,例如使用线性回归来找出运动中的“尖锐”变化,并据此修改移动平均值的平滑度。在深入研究可以更优化地解决问题之前,我确实需要更多指导和意见。 谢谢!

2
机器学习时间序列的排序
在阅读了RJ Hyndman的关于交叉验证和时间序列的“研究技巧”之一之后,我回到了我的一个老问题,我将在这里尝试表述。这个想法是,在分类或回归问题中,数据的排序并不重要,因此可以使用k倍交叉验证。另一方面,在时间序列中,数据的排序显然非常重要。 但是,当使用机器学习模型预测时间序列时,一种常见的策略是将序列为一组“输入-输出向量”,该向量在时间具有形式。{y1,...,yT}{y1,...,yT}\{y_1, ..., y_T\}ttt(yt−n+1,...,yt−1,yt;yt+1)(yt−n+1,...,yt−1,yt;yt+1)(y_{t-n+1}, ..., y_{t-1}, y_{t}; y_{t+1}) 现在,一旦完成了重塑,我们是否可以认为不需要对所得的“输入-输出向量”进行排序?例如,如果我们使用具有n个输入的前馈神经网络来“学习”这些数据,则无论我们向模型显示矢量的顺序如何,我们都将获得相同的结果。因此,我们是否可以使用k-fold交叉验证的标准方法,而无需每次都重新拟合模型?

5
Matlab / octave或R是否更适合蒙特卡洛模拟?
我开始在R从事蒙特卡洛的业余爱好,但最终一位财务分析师建议迁移到Matlab。我是一位经验丰富的软件开发人员。但是是蒙特卡洛的初学者。我想用灵敏度分析来构造静态模型,然后再构造动态模型。需要指导我的好的库/算法。 在我看来,R具有出色的库,而且我怀疑mathlab被无经验的程序员所青睐,因为它具有类似于pascal的简单语言。R语言是基于方案的,这对初学者来说很难,但对我而言却不是。如果Matlab / Octave在数值/库方面没有优势,我会坚持使用R。
14 r  matlab  monte-carlo 

2
标准差的三角运算
正常随机变量的加法,减法,乘法和除法得到了很好的定义,但是三角运算又如何呢? 例如,让我们假设我正在尝试找到两个楔形的角度(建模为直角三角形),两个导管的尺寸分别为d1d1d_1和d2d2d_2,均被描述为正态分布。 直觉和模拟都告诉我,结果分布是正态的,平均。但是,有一种方法可以计算出角度的分布吗?我在哪里找到答案的参考?arctan(mean(d1)mean(d2))arctan⁡(mean(d1)mean(d2))\arctan\left(\frac{\text{mean}(d_1)}{\text{mean}(d_2)}\right) (在某种程度上,我正在研究机械零件的统计公差。我的第一个冲动是简单地模拟整个过程,检查最终结果是否合理正常,然后计算标准偏差。但是我想知道如果可以使用更整洁的分析方法。)

1
如何使年龄金字塔像R中的情节?
已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 年龄金字塔看起来像这样: 我想做类似的事情,即2个具有相同类别的条形图(不是直方图),它们像金字塔一样垂直旋转并向两侧延伸。 这是在R中执行此操作的简单方法吗? 控制每个条形的颜色也是很好的。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.