统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
您是否必须遵循似然性原则才能成为贝叶斯?
这个问题是由以下问题引起的:什么时候(如果有的话)频频论方法实质上比贝叶斯方法好? 正如我在我对该问题的解决方案中所发布的那样,我认为,如果您是常客,则不必相信/坚持似然性原则, 因为经常使用常客的方法会违反该原则。但是,这通常是在适当先验的假设下,贝叶斯方法从不违反似然原理。 那么,现在说您是贝叶斯主义者是否在可能性原则上确认了自己的信念或共识,还是说作为贝叶斯主义者的论点只是产生了不违反似然原则的好结果?

2
回归到“思考,快速和慢速”中的均值
丹尼尔·卡尼曼(Daniel Kahneman)在《快与慢的思考》中提出了以下假设问题: (第186页)朱莉目前在州立大学任教。她四岁时能流利阅读。她的平均成绩(GPA)是多少? 他的目的是说明在做出有关某些统计数据的预测时,我们通常如何无法解释均值的回归。在随后的讨论中,他建议: (第190页)回想一下,在当前案例中,阅读年龄和GPA两项测量之间的相关性等于决定因素中共享因素的比例。您对该比例的最佳猜测是什么?我最乐观的猜测是大约30%。假定此估计,我们将需要产生一个无偏预测。以下是通过四个简单步骤到达那里的说明: 首先估算平均GPA。 确定符合您对证据印象的GPA。 估计阅读早熟与GPA之间的相关性。 如果相关系数是0.30,则将平均值的30%距离移到匹配的GPA。 我对他的建议的解释如下: 使用“她四岁时能流利阅读”为朱莉的阅读早熟建立标准分数。 确定具有相应标准分数的GPA。(如果 GPA和阅读早熟之间的相关性是完美的,则可以预测的合理GPA将与此标准分数相对应。) 估计GPA差异的百分比可以通过阅读早熟的差异来解释。(在这种情况下,我假设他指的是“相关”的确定系数?) 由于朱莉的阅读早熟标准分数的只有30%可以由解释她的GPA标准分数的因素来解释,因此我们仅有理由预测朱莉的GPA标准分数将是该分数的30%在完全相关的情况下。 我对卡尼曼程序的解释正确吗?如果是这样,他的程序是否有更正式的数学证明,尤其是步骤4?通常,两个变量之间的相关性与其标准分数的变化/差异之间是什么关系?

3
出于直觉,现实生活中有一些不相关但相关的随机变量的例子是什么?
在解释为什么不相关并不意味着独立的过程中,有几个涉及一堆随机变量的示例,但它们似乎都非常抽象:1 2 3 4。 这个答案似乎是有道理的。我的解释:随机变量及其平方可能不相关(因为显然缺少相关性就像线性独立性一样),但是它们显然是相关的。 我猜一个例子是(标准化吗?)高度和高度2可能不相关,但相互依赖,但是我不明白为什么有人会比较高度和高度。22^222^2 为了使初学者具有基本概率论或类似目的的直觉,在现实生活中有哪些不相关但依存的随机变量示例?

3
为什么(0,1)上连续和变量的总和要超过1的数量均具有平均值
让我们总结随机变量,流X 我我我d 〜 ù(0 ,1 )Xi∼iidU(0,1)X_i \overset{iid}\sim \mathcal{U}(0,1) ; 令YYY为总数需要超过1的项的数量,即YYY是最小的项,使得 X 1 + X 2 + ⋯ + X Y > 1。X1+X2+⋯+XY>1.X_1 + X_2 + \dots + X_Y > 1. 为什么Y的均值YY等于欧拉常数eee? E(Y )= e = 10 !+11 !+12 !+13 !+…E(Y)=e=10!+11!+12!+13!+…\mathbb{E}(Y) = e = \frac{1}{0!} + \frac{1}{1!} + \frac{1}{2!} + \frac{1}{3!} …

3
证明使用高斯混合的合理依据
高斯混合模型(GMM)之所以吸引人,是因为它们在分析和实践中都易于使用,并且能够建模某些奇特的分布而不会过于复杂。我们应该保留一些分析属性,这些属性通常并不明确。尤其是: SnSnS_nnnnPPPnnnPPPlimn→∞infP^∈SnD(P||P^)=0?limn→∞infP^∈SnD(P||P^)=0?\lim_{n\rightarrow \infty}\inf_{\hat{P}\in S_n} D(P||\hat{P})=0? 假设我们有一个连续分布PPP,我们发现了一个NNN分量高斯混合P^P^\hat{P},它的总变化量接近PPP:δ(P,P^)&lt;εδ(P,P^)&lt;ε\delta(P,\hat{P})<\varepsilon。我们可以用\ epsilon约束D(P || \ hat {P})吗?D(P||P^)D(P||P^)D(P||\hat{P})ϵϵ\epsilon 如果我们想通过独立的加性噪声Y \ sim P_Y(真实的,连续的)观察X \ sim P_X,并且我们有GMM \ hat {X} \ sim Q_X,\ hat {Y} \ sim Q_N其中\ delta(P ,Q)&lt;\ epsilon,则此值较小:\ left | \ mathsf {mmse}(X | X + Y)-\ mathsf {mmse}(\ hat {X} | \ hat {X} + …

2
错误规范下的统计推断
统计推断的经典处理方法基于这样的假设,即使用了正确指定的统计数据。也就是说,生成观测数据的分布是统计模型: 但是,在大多数情况下,我们不能假设这是真的。我想知道,如果我们放弃正确指定的假设,统计推断程序会发生什么。P∗(Y)P∗(Y)\mathbb{P}^*(Y)yyyMM\mathcal{M}P∗(Y)∈M={Pθ(Y):θ∈Θ}P∗(Y)∈M={Pθ(Y):θ∈Θ}\mathbb{P}^*(Y) \in \mathcal{M}=\{\mathbb{P}_\theta(Y) :\theta \in \Theta\} 我发现怀特1982年在误配下对ML估计进行了一些研究。有人认为最大似然估计量是的一致估计量 可使统计模型内所有分布和真实分布\ mathbb {P} ^ *中的KL散度最小。Pθ1=argminPθ∈MKL(P∗,Pθ)Pθ1=arg⁡minPθ∈MKL(P∗,Pθ)\mathbb{P}_{\theta_1}=\arg \min_{\mathbb{P}_\theta \in \mathcal{M}} KL(\mathbb{P}^*,\mathbb{P}_\theta)P∗P∗\mathbb{P}^* 置信度估计量会怎样?让我们概述置信度估计量。令 δ:ΩY→2Θδ:ΩY→2Θ\delta:\Omega_Y \rightarrow 2^\Theta为集合估计量,其中ΩYΩY\Omega_Y是样本空间,2Θ2Θ2^\Theta是在参数空间\ Theta上设置的功效ΘΘ\Theta。我们想知道的是\ delta产生的集合δδ\delta包含真实分布P∗P∗\mathbb{P}^*,即P∗(P∗∈{Pθ:θ∈δ(Y)}):=A.P∗(P∗∈{Pθ:θ∈δ(Y)}):=A.\mathbb{P}^*(\mathbb{P}^* \in \{P_\theta : \theta \in \delta(Y)\}):=A. 但是,我们当然不知道真实的分布P∗P∗\mathbb{P}^*。正确指定的假设告诉我们P∗∈MP∗∈M\mathbb{P}^* \in \mathcal{M}。但是,我们仍然不知道模型是哪种分布。但是,infθ∈ΘPθ(θ∈δ(Y)):=Binfθ∈ΘPθ(θ∈δ(Y)):=B\inf_{\theta \in \Theta} \mathbb{P}_\theta(\theta \in \delta(Y)):=B是概率A的下限AAA。公式BBB是置信度集合估计器的置信度水平的经典定义。 如果我们放弃正确指定的假设,那么不一定是的下界,是我们实际上感兴趣的术语。确实,如果我们假设模型指定不正确(在大多数现实情况下都是如此),则为0,因为统计模型不包含真实分布。A A P * MBBBAAAAAAP∗P∗P^*MM\mathcal{M} 从另一个角度来看,当模型指定不正确时,人们可能会想到与什么相关。这是一个更具体的问题。如果模型指定不正确,是否仍然具有含义。如果没有,为什么我们还要打扰参数统计呢?乙BBBBBB 我猜怀特1982年在这些问题上有一些结果。不幸的是,由于缺乏数学背景,我无法理解那里写的很多东西。

1
平均和边缘治疗效果之间的差异
我一直在阅读一些论文,但对平均治疗效果(ATE)和边际治疗效果(MTE)的具体定义不清楚。他们是一样的吗? 根据奥斯丁 ... 条件效应是在受试者水平上将受试者从未治疗转移到已治疗的平均效应。来自多变量回归模型的治疗分配指标变量的回归系数是对条件或调整后效应的估计。相反,边际效应是在整个人口水平上将整个人口从未治疗转移到已治疗的平均效应[10]。线性处理效果(均值差异和比例差异)是可折叠的:条件和边际处理效果将重合。但是,当结果是二元的或本质上是事件发生的时间时,优势比和危险比就无法崩溃[11]。罗森鲍姆(Rosenbaum)指出,倾向得分方法允许人们估计边际效应,而不是条件效应[12]。缺乏对不同倾向评分方法来评估边缘治疗效果的研究。 但是在奥斯丁的另一篇论文中,他说 对于每个受试者,治疗的效果被定义为。平均处理效应(ATE)被定义为È [ ÿ 我(1 )- Ý 我(0 )]。(Imbens,2004)。ATE是将总体人口从未治疗转移到已治疗的平均效果。ÿ一世(1 )- ÿ一世(0 )ÿ一世(1个)-ÿ一世(0)Y_i(1)- Y_i(0)Ë[ Y一世(1 )- ÿ一世(0 )]Ë[ÿ一世(1个)-ÿ一世(0)]E[Y_i(1)- Y_i(0)] 所以我的问题是...平均治疗效果和边际治疗效果有什么区别? 同样,我应该如何分类估计?我有一个倾向得分加权(IPTW)Cox模型。我唯一的协变量是治疗指标。应将得出的危险比视为事后评估还是事后评估? 编辑:更令人困惑的是,郭在自己的倾向得分分析中声称边际治疗效果是 ...对冷漠边缘人群的治疗效果的特例(EOTM)。在某些政策和实践情况下,区分边际收益和平均收益很重要。例如,上大学的普通学生可能比不关心上学或不上学的边缘学生做得更好(即,成绩更高)。 我觉得这应该加一点盐,因为这是针对社会科学的(我认为边际具有不同的定义),但是我认为我将在这里包括它来显示我为什么感到困惑。



3
如何进行数据扩充和训练验证拆分?
我正在使用机器学习进行图像分类。 假设我有一些训练数据(图像),并将其分为训练和验证集。我还想通过随机旋转和噪声注入来增强数据(从原始图像生成新图像)。扩充是离线完成的。 进行数据扩充的正确方法是哪种? 首先将数据分为训练和验证集,然后对训练和验证集进行数据扩充。 首先将数据分为训练集和验证集,然后仅对训练集进行数据扩充。 首先对数据进行数据扩充,然后将数据分为训练和验证集。

4
无法创建理想实验时该怎么办的教科书/阅读材料?
我的统计培训扎根于数学统计,目前在我的MS上接受这些方法的课程有些震惊。由于我缺乏行业经验,因此目前我很难理解其中一些“应用”方法。 我们在方法类中一直谈论的主题之一是实验设计的思想。 举例来说,我想在一个声称提高K-12学生考试成绩的教育计划中进行有效性实验。 在方法课程中,他们教了以下方法来解决这一问题:确保您有一个好的研究问题,好的数据收集方法,随机实验,均质的治疗组(即,使用该程序治疗过的一组,也许不)理想地大小相等,然后运行检验(或某种非参数假设检验),一切都很好,对吗?ŤŤt 我几乎不相信这就是现实中的运作方式。 我了解到,当然,您可能需要进行一些方便的采样。除此之外,除了从教科书中学到的知识外,我不知道如何实现实验设计。 在实践中是否有教科书,阅读材料等探讨这些问题(理想情况下,不要掩饰数学-我不需要所有内容的详尽证明,但我不想被告知所有内容都是“明显”)?

1
通过无限维基函数视图了解高斯过程回归
人们常说,高斯过程回归(GPR)对应于(可能)无限数量基函数的贝叶斯线性回归。我目前正在尝试详细了解这一点,以直观了解我可以使用GPR表示哪种模型。 您是否认为这是理解GPR的好方法? 在书高斯过程机器学习拉斯穆森和Williams显示该组高斯过程的描述由参数化指数平方内核ķ (X ,X′; l )= σ2p经验值( -(x - x )22 升2)ķ(X,X′;升)=σp2经验值⁡(-(X-X)22升2)k(x,x';l)= \sigma_p^2\exp\left(-\frac{(x-x)^2}{2l^2}\right)可以等价描述为与现有信念贝叶斯回归瓦特〜Ñ(0 ,σ2p一世)w〜ñ(0,σp2一世)w \sim \mathcal{N}(0,\sigma_p^2 I)上的权重和的形式的基础函数的无限量ϕC(x ; l )= 经验值( - (x - c )22 升2)ϕC(X;升)=经验值⁡(-(X-C)22升2)\phi_c(x;l)=\exp\left(-\frac{(x-c)^2}{2l^2}\right) 因此,内核的参数化可以完全转换为基本函数的参数化。 是否可以将可微内核的参数化始终转换为先验函数和基本函数的参数化,或者是否存在可微内核,例如,基本函数的数量取决于组态? 我的理解至今是,对于一个固定的内核函数K(X,X')Mercer的定理告诉我们,可以表示为ķ (X ,X ')= ∞ &Sigma;我= 1 λ 我φ 我(X )φ 我(X ') 其中,φ 我是一个函数要么到实数或复数。因此,对于给定的内核,相应的贝叶斯回归模型具有先验〜ķ (X ,X′)ķ(X,X′)k(x,x')ķ (X ,X′)= ∑我= …

5
没有分析背景的数学统计之路:自学的理想教科书
我数学上很偏向于我-在本科生中有6个学期的数学-尽管我有点不习惯,并且对偏微分方程和路径积分说的很慢,但我的概念却又经过一些实践。我还没有关于数学证明(数学思维)的课程或关于分析的课程。 我也了解毕业生水平的机率-对其进行了正式研究,最近又刷新了我的知识。 我还开设了一些统计学和统计学学习的研究生课程。 我出于个人兴趣,希望在接下来的18-24个月内学习数学统计。我想平均每周进行5个小时的自学。 我对如何做有点茫然。我曾尝试从Casella和Berger的书中学习,但确实没有任何进展。我发现这本书有点无聊,而且方法很难处理。 我发现Casella和Berger遇到的困难: 不好意思这样说,但是类型设置的开始-它被打包以减少空白的方式让我失望 那里有很多证据,但是我感到缺乏直觉,这说明我们为什么要努力取得结果以及即将实现的更大目标是什么。 引用前几章中的证明在某种程度上使我对材料感到难以理解-我回头了很多,直到我最终放弃。 这个例子似乎是可行的,但是我无法解决这些问题-这些问题似乎在一个班上。 我只是无法深入研究材料-我想知道我的思维方式是否需要更严格的处理- 我应该考虑对数学统计采用量度理论方法吗? 因此,问题是:是否有一本教科书,我穿鞋的人可以学习并自学该主题。 我想要的是文字: 从很多方面来说,我想要的东西都是我在卡塞拉和伯格中不喜欢的东西的反面。 这本书的类型设置会有所帮助。下面的一些要点将阐述这一点。 我认为最好有一本书以一种我们对我们想做的事情的直觉作为开端,也许是从非数学意义上讲-有点像Freeman 等人的《Statistics》一书。 一本以同时的数学推导和注释格式展示定理的书–在CB中,我只是放弃了尝试阅读证明的尝试 本书的每一节都有很多已解决的问题。 本书还包含计算练习,使读者可以通过使用R探索概念来更好地理解 一本书涵盖了数学统计学的第一门或第二门研究生课程所需的材料。 补充说明: 我知道这个问题,《数学家统计学概论》 —在发布这个问题之前,我已经研究过一些重叠和一些答案—但是,我觉得这两个问题有不同的要求。

3
存在哪些快速算法来计算截断的SVD?
可能不在这里,但存在几种(一种,二)相关的问题。 在文献中闲逛(或在Google中搜索“截断的SVD算法”)会发现很多使用以各种方式截短的,并声称(令人沮丧的是,通常没有引证)有快速的算法可以对其进行计算,但是没有人似乎在指出这些算法是什么。 我唯一能找到的是一个随机算法在redSVD库中使用。 我想看到的是一组精确且不精确的算法,适合理解系统的工作原理(但不一定要实际实现它们!)。 有人对这种事情有很好的参考吗?

2
从von Mises-Fisher发行版的Python中采样吗?
我正在寻找一种简单的方法来从Python中的多元von Mises-Fisher分布中采样。我在scipy和numpy模块中查看了stats模块,但只发现了单变量von Mises分布。有没有可用的代码?我还没找到。 显然,Wood(1994)根据该链接设计了一种从vMF分布进行采样的算法,但我找不到该论文。 -对于精度,我对在文献中很难找到的算法很感兴趣(大多数论文都集中在)。据我所知,开创性的文章(Wood,1994年)无法免费找到。小号2小号2S^2

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.