统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
费舍尔假人?
简短版: 有没有介绍罗纳德·费舍尔(Ronald Fisher )的统计学著作(论文和书籍),其对象是那些几乎没有统计学背景或没有统计学背景的人? 我想到的是针对非统计学家的“带注释的Fisher读者”之类的东西。 我在下面阐明了这个问题的动机,但是要警告说,它是一个漫长的过程(我不知道如何更简洁地解释它),而且几乎肯定是有争议的,可能是令人讨厌的,甚至是令人发指的。因此,请跳过本篇文章的其余部分,除非您真的认为问题(如上所述)过于简洁而无法进一步澄清。 我自学了很多人认为很困难的许多领域的基础知识(例如线性代数,抽象代数,实数和复数分析,一般拓扑,测度理论等),但是我在自学统计学上的所有努力都失败了。 这样做的原因不是我发现统计数据在技术上很困难(或者比我设法找到的其他领域要困难的多),而是我发现统计数据始终是异类的(如果不是很奇怪的话),远比其他任何东西都重要。我自学的其他领域 慢慢地,我开始怀疑这种怪异的根源大多是历史性的,而且,作为一个从书本而不是从业者社区学习该领域的人(如果我曾接受过统计学方面的正式培训,情况就是如此)。 ),直到我对统计历史有了更多了解之前,我永远不会摆脱这种疏离感。 因此,我读了几本有关统计历史的书,事实上,这在解释我认为是该领域的怪异方面大有作为。但是我仍然有一些方法可以朝这个方向发展。 我从统计历史上的阅读中学到的一件事是,我认为统计中的许多奇异事物的来源是一个人,罗纳德·费舍尔。 实际上,下面的引号1(我最近才发现)非常符合我的认识,即我只有深入研究历史才能开始理解这一领域,并开始关注费舍尔。参考点: 大多数统计概念和理论可以与其历史渊源分开描述。对于“基准概率”的情况,如果没有不必要的神秘化,这是不可行的。 确实,我认为我的直觉虽然是主观的(当然),但并非完全没有根据。费舍尔不仅贡献了统计学中一些最开创性的想法,而且因不理会先前的工作以及对直觉的依赖而臭名昭著(要么提供几乎其他任何人都无法理解的证据,要么完全忽略它们)。此外,他与20世纪上半叶的许多其他重要统计学家有着终生的争执,这些争执似乎在该领域造成了很多混乱和误解。 我从所有这一切得出的结论是,是的,费舍尔对现代统计的贡献确实意义深远,尽管并非所有人都是积极的。 我还得出结论,要真正了解我对统计的异化,我必须至少阅读一些Fisher的原始形式的作品。 但是我发现,费舍尔的作品不辜负其不可渗透的声誉。我试图找到这些文献的指南,但是,不幸的是,我发现的所有内容都是针对受过统计学训练的人员,因此,对于我来说,理解它所要阐明的内容同样困难。 因此,本文开头的问题。 1 Stone,Mervyn(1983),“基准概率”,《统计科学百科全书 》3 81-86。纽约威利。

4
包含测量不确定度的统计测试
假设我得到了两组质量测量值(以mg为单位),分别称为y1和y2。我想做一个测试,以确定两个样本是否均来自具有不同均值的总体。例如(在R中): y1 <- c(10.5,2.9,2.0,4.4,2.8,5.9,4.2,2.7,4.7,6.6) y2 <- c(3.8,4.3,2.8,5.0,9.3,6.0,7.6,3.8,6.8,7.9) t.test(y1,y2) 我得到的p值为0.3234,在显着性水平为0.05的情况下,不要拒绝零假设,即两组均来自具有相同均值的总体。现在,我得到了每次测量的不确定性: u1 <- c(2.3,1.7,1.7,1.7,2.0,2.2,2.1,1.7,2.3,2.2) u2 <- c(2.4,1.8,1.6,2.3,2.5,1.8,1.9,1.5,2.3,2.3) 其中u1 [1]是测量值y1 [1]的组合标准不确定度(以此类推)。如何将这些不确定性纳入统计检验?

3
关于信用评分的好书/论文
我正在寻找有关信用评分的书籍的推荐。我对该问题的各个方面都感兴趣,但主要涉及:1)良好的功能。如何建立它们?哪些被证明是好的?2)神经网络。它们在信用评分问题中的应用。3)我选择了神经网络,但是我对其他方法也很感兴趣。

1
结合两个协方差矩阵
我正在并行计算分布的协方差,需要将分布的结果合并为奇异的高斯分布。我如何结合两者? 如果它们的分布和大小相似,则在两个几乎可行的方法之间进行线性插值。 Wikipedia在底部提供了一个forumla用于组合,但这似乎并不正确。两个相同分布的分布应该具有相同的协方差,但是页面底部的公式会使协方差翻倍。 有没有办法合并两个矩阵?



2
Cox PH分析和协变量选择中的倾向得分加权
关于对事件生存时间进行Cox比例风险建模时的倾向得分加权(IPTW): 我有前瞻性的注册表数据,我们希望了解大多数情况下患者已经在基线时服用的药物的治疗效果。因此,我不确定如何最好地分析数据。潜在地,一些基线变量在很大程度上受到治疗的影响,而不是相反(例如某些生物标志物)。我对于应该在倾向评分模型中估计权重的哪些协变量以及应该在coxph模型中作为协变量的哪些协变量(如果有的话)不知所措。正确方向的任何提示都将有所帮助!到目前为止,我还没有找到任何有关CoxPh建模的文献。 我认为协变量代表Cox PH协变量应包括代表基线(可能)影响治疗结果的基线治疗,但我不确定。 如何确定应将哪些变量作为协变量包括在Cox模型中,而不是用于计算倾向得分权重? 后续问题: 我了解评估已经开始的某种干预措施的治疗效果的继承问题-即在开始观察之前在患者中普遍存在。关于引入与风险的时间变化相关的偏见(例如,不良副作用在治疗的第一年更加普遍)以及受治疗影响的协变量。如果我没记错的话,这是由于心血管终点和激素替代疗法引起的观察性和随机性差异的原因。另一方面,在我的数据集中,我们有兴趣查看治疗的可能不利影响。 如果我使用倾向评分调整来调查普遍使用者的治疗效果,即在观察开始之前已经使用过药物,则在队列数据中,我们会观察到药物治疗的不利影响(这就是我们所要寻找的)。我可以排除高估与治疗相关的风险的可能性吗?即是说,只要风险显着增加,它是“绝对”没有保护意义的吗? 我无法完全想象一个例子,在这种情况下,这种偏见会导致高估虚假风险关联的风险。

1
处理异常有限的响应变量的回归
我正在尝试对理论上限制在-225和+225之间的响应变量进行建模。变量是受试者在玩游戏时获得的总分。尽管从理论上讲,受试者有可能得分+225。尽管如此,这是因为得分不仅取决于对象的动作,而且还取决于其他动作的动作,任何人得分最多为125(这是两个互相玩的最高玩家都可以得分),这种情况的发生频率很高。最低分数是+35。 125的边界导致线性回归困难。我唯一想做的就是将响应重新缩放为0到1之间并使用beta回归。如果我这样做,虽然不确定,我真的可以说125是最高边界(或转换后的1),因为它有可能得分+225。此外,如果我这样做了,我的下界35是什么? 谢谢, 乔纳森

1
分类器评估:学习曲线与ROC曲线
我想比较2个不同的分类器,以解决使用大型训练数据集的多类文本分类问题。我怀疑我应该使用ROC曲线还是学习曲线来比较这两个分类器。 一方面,学习曲线对于确定训练数据集的大小很有用,因为您可以找到分类器停止学习(并可能降级)的数据集的大小。因此,在这种情况下,最好的分类器可能是精度最高,数据集大小最小的分类器。 另一方面,ROC曲线可让您在灵敏度/特异性之间找到适当权衡的点。在这种情况下,最好的分类器就是最接近左上角的分类器,它是所有FPR中最高的TPR。 我应该同时使用两种评估方法吗?学习曲线较好的方法的ROC曲线是否可能变差,反之亦然?

3
测量2D正方形中点分布的均匀性
我有一个2D正方形,里面有一组点,例如1000点。我需要一种方法来查看正方形内的点的分布是否散布(或或多或少均匀分布),或者它们倾向于在正方形内的某个点聚集在一起。 我需要一种数学/统计(非编程)方法来确定这一点。我在Google上搜索,发现了诸如拟合优度,Kolmogorov等之类的东西,只是想知道是否还有其他方法可以实现这一目标。需要这个用于课堂论文。 输入:2D正方形和1000点。输出:是/否(是=均匀分布,否=在某些地方聚集在一起)。

2
转换连续变量以进行逻辑回归
我有大量调查数据,一个二进制结果变量和许多解释性变量,包括二进制和连续变量。我正在建立模型集(使用GLM和混合GLM进行实验),并使用信息理论方法来选择顶级模型。我仔细检查了说明(连续的和分类的)之间的相关性,而我只使用在同一模型中Pearson或Phicorr系数小于0.3的那些。我想给我所有的连续变量一个竞争顶级模型的机会。以我的经验,基于偏斜转换那些需要它的人可以改善他们参与的模型(降低AIC)。 我的第一个问题是:由于变换提高了logit的线性度,所以此改进是否在进行?还是通过使数据更加对称,校正偏斜以某种方式改善了解释变量的平衡?我希望我能理解其背后的数学原因,但就目前而言,如果有人可以轻松地解释这一点,那就太好了。如果您有任何我可以使用的参考,我将不胜感激。 许多互联网网站都说,由于正常性不是二进制逻辑回归的假设,因此请勿变换变量。但是我觉得,通过不对变量进行转换,与其他变量相比,我处于不利地位,这可能会影响顶级模型,并改变推理(好吧,通常不会,但是在某些数据集中会)。我的一些变量在对数转换时性能更好,一些在平方时(偏斜的不同方向),另一些未转换时。 有人可以给我一个指导原则,在为逻辑回归转换解释变量时要注意些什么,如果不这样做,为什么不这样做呢?


1
对数随机数生成
我需要从具有密度的对数柯西分布中提取随机数: 谁能帮助我或将我指向一本可以告诉我如何的书/纸?F(x ; μ ,σ)= 1X πσ[ 1 + (升Ñ (X )- μσ)2]。F(X;μ,σ)=1个Xπσ[1个+(升ñ(X)-μσ)2]。f(x;\mu,\sigma)=\frac{1}{x\pi\sigma\left[1+\left(\frac{ln(x)-\mu}{\sigma}\right)^2\right]}.

2
如何“智能化”分类数据的集合?
我正在尝试智能地对已排序的集合进行分类。我有条数据的集合。但我知道,这个数据拟合到不平等的大小分档。我不知道如何智能地选择端点以正确适合数据。例如:nnnmmm 假设我的收藏夹中有12件商品,并且我知道数据可以放入3个容器中: Index: 1 2 3 4 5 6 7 8 9 10 11 12 Value: 1 1 1 3 3 3 3 3 3 5 5 6 如何智能地为的bin选择断点?i={1−3},{4−9},{10−12}i={1−3},{4−9},{10−12}i = \{1-3\}, \{4-9\}, \{10-12\} 我目前的实现方式是将数据分成大小均匀的容器,然后取端点的平均值,以找到容器末端的索引。所以它是这样的: Index: 1 2 3 4 5 6 7 8 9 10 11 12 Value: 1 1 …

4
残差对拟合值的对角直线作多元回归
我正在观察数据残差的奇怪模式: [编辑]这是两个变量的部分回归图: [EDIT2]添加了PP图 分布似乎运行良好(请参阅下文),但是我不知道这条直线可能来自何处。有任何想法吗? [UPDATE 31.07] 事实证明您是绝对正确的,我的案例中转发次数确实为0,而这〜15个案例导致了这些奇怪的残留模式。 现在,残差看起来好多了: 我还用黄土线包括了部分回归。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.