统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答




2
因果阶梯中的梯级2和3之间的差异
在朱迪亚·珀尔(Judea Pearl)的《为什么书》中,他谈到了他所谓的因果阶梯,这实质上是一个由不同层次的因果推理组成的等级体系。最低的是与观察到的数据中的关联模式有关(例如,相关性,条件概率等),第二个与干预有关(如果我们以某种预定的方式故意改变数据生成过程会发生什么?),第三个是反事实(如果某件事发生或未发生,在另一个可能的世界中会发生什么)? 我不明白的是,梯级2和3有何不同。如果我们提出反事实的问题,我们不是简单地提出有关干预的问题,以否定 观察到的世界的某些方面吗?
12 causality 

1
优势比的荟萃分析是否基本没有希望?
在最近的一篇论文中,诺顿等人。(2018)指出[1][1]^{[1]} 当导致赔率估算的统计模型具有不同的解释变量时,无法比较来自同一研究的不同赔率,因为每个模型具有不同的任意比例因子。也不能将一项研究的优势比的幅度与另一项研究的优势比的幅度进行比较,因为不同的样本和不同的模型规格将具有不同的任意缩放因子。进一步的暗示是,在多项研究中,给定关联的比值比的大小无法在荟萃分析中进行综合。 一个小的模拟说明了这一点(R代码在问题的底部)。假设真实模型为: 进一步想象一下,由四个不同的研究人员使用逻辑回归分析了上述模型生成的相同数据。研究人员1仅包含作为协变量,研究人员2同时包含和,依此类推。四位研究人员的优势比的平均模拟估计值为:logit(yi)=1+log(2)x1i+log(2.5)x2i+log(3)x3i+0x4ilogit(yi)=1+log⁡(2)x1i+log⁡(2.5)x2i+log⁡(3)x3i+0x4i \mathrm{logit}(y_{i})=1 + \log(2)x_{1i} + \log(2.5)x_{2i} + \log(3)x_{3i} + 0x_{4i} x1x1x_{1}x1x1x_{1}x2x2x_{2}x1x1x_{1} res_1 res_2 res_3 res_4 1.679768 1.776200 2.002157 2.004077 显然,只有研究人员3和4获得了大约的正确比值比,而研究人员1和2没有。这在线性回归中不会发生,可以通过类似的模拟轻松显示(此处未显示)。我必须承认,尽管这个问题似乎是众所周知的,但这个结果对我来说却是令人惊讶的。Hernán等。(2011)将此称为“数学上的奇异性”,而不是偏见。222[2][2]^{[2]}[3][3]^{[3]} 我的问题: 如果各研究和模型之间的优势比基本上不可比,那么我们如何结合不同研究的结果以得出二元结果呢? 有什么可以对无数的元分析的结果可以说并从不同的研究结合起来,优势比,每个研究可能调整不同协变量集?他们本质上是无用的吗? 参考文献 [1]:Norton EC,Dowd BE,Maciejewski ML(2018年):赔率-当前最佳实践和使用。JAMA 320(1):84-85。 [2]:Norton EC,Dowd BE(2017年):对数赔率和Logit模型的解释。卫生服务水库。53(2):859-878。 [3]:HernánMA,Clayton D,Keiding N(2011):揭开了辛普森悖论的面纱。Int J Epidemiol 40:780-785。 揭露 问题(包括R代码)是用户timdisher在数据方法上提出的问题的修改版本。 R代码 set.seed(142857) n_sims <- 1000 # number …

1
如何从超椭圆体(恒定的马氏距离)的表面均匀采样?
在实值多元情况下,是否有一种方法可以从表面上的点开始均匀采样,这些点的马氏距离与均值的距离是恒定的? 编辑:这只是归纳为满足方程的超椭圆体表面的均匀采样点, (x−μ)TΣ−1(x−μ)=d2.(x−μ)TΣ−1(x−μ)=d2.(x-\mu)^T \Sigma^{-1}(x-\mu) = d^2. 更准确地说,“均匀”是指样本,以使超曲面的每个面积元素dAdAdA包含相同的概率质量。

1
对于模型平均GLM,我们是否将链接或响应规模上的预测平均?
要计算GLM响应规模上模型平均的预测,这是“正确的”,为什么? 在链接规模上计算模型平均预测,然后反变换为响应规模,或者 将预测反向转换为响应尺度,然后计算模型平均值 如果模型是GLM,则预测接近但不相等。不同的R包为这两者提供了选项(具有不同的默认值)。几位同事大声疾呼:#1错误是因为“每个人都#2”。我的直觉说#1是“正确的”,因为它使所有线性数学保持线性(#2对不在线性范围内的事物进行平均)。一个简单的仿真发现,#2的MSE比(#1)小(非常!)。如果#2是正确的,那是什么原因?而且,如果#2是正确的,为什么我的原因(保持线性数学线性)的推理能力很差? 编辑1:在GLM中计算超出另一个因素水平的边际均值与我在上面提出的问题类似。Russell Lenth使用#1(在emmeans软件包中)的“时间”(他的话)来计算GLM模型的边际均值,他的论点与我的直觉相似。 编辑2:我使用模型平均来指代模型选择的替代方法,其中将预测(或系数)估计为“最佳”嵌套模型的全部或子集的加权平均值(请参见下面的参考资料和R包) 。 鉴于嵌套模型,其中为个别的线性预测(在链路空间)为模型,和为模型的重量,使用#1的上方(平均链路上的模型的平均预测规模,然后反向转换为响应规模)是:MMMηmiηim\eta_i^miiimmmwmwmw_mmmm Y^i=g−1(∑m=1Mwmηmi)Y^i=g−1(∑m=1Mwmηim)\hat{Y}_i = g^{-1}\Big(\sum_{m=1}^M{w_m \eta_i^m}\Big) 并且使用上述#2进行模型平均的预测(对所有预测进行反变换,然后在响应尺度上取平均值)是:MMM Y^i=∑m=1Mwmg−1(ηmi)Y^i=∑m=1Mwmg−1(ηim)\hat{Y}_i = \sum_{m=1}^M{w_m g^{-1}(\eta_i^m}) 模型平均的一些贝叶斯和惯常方法是: Hoeting,JA,Madigan,D.,Raftery,AE和Volinsky,CT,1999。贝叶斯模型平均:教程。统计科学,第382-401页。 Burnham,KP和Anderson,DR,2003年。模型选择和多模型推断:一种实用的信息理论方法。施普林格科学与商业媒体。 汉森,比利时,2007年。最小二乘模型平均。计量经济学,75(4),1175-1189页。 Claeskens,G。和Hjort,NL,2008年。模型选择和模型平均。剑桥图书。 R软件包包括BMA,MuMIn,BAS和AICcmodavg。(注意:这不是更普遍的模型平均智慧的问题。)

1
t-SNE中的轴是什么意思?
我目前正在尝试围绕t-SNE数学学习。不幸的是,还有一个我不能令人满意地回答的问题:t-SNE图中轴的实际含义是什么?如果要在此主题上进行演示或将其包含在任何出版物中:我如何适当地标记轴? PS:我读了 Reddit问题,但是那里给出的答案(例如“取决于解释和领域知识”)并不能真正帮助我理解这一点。


3
为什么几个(如果不是全部)参数假设检验假设为随机抽样?
像Z,t和其他几种测试都假定数据基于随机采样。为什么? 假设我正在做实验研究,我在乎内部有效性而不是外部有效性。因此,如果我的样本可能有点偏见,那很好,因为我已经接受了不推断整个人群的假设的结论。并且分组仍将是随机的,即,为了方便起见,我将选择样本参与者,但我将它们随机分配给不同的组。 为什么我不能忽略这个假设?

5
在开始实验或无限期进行实验之前确定样本量?
几年前,我研究了统计学,却忘记了这一切,因此这些似乎比一般的问题更像是一般的概念性问题,但这是我的问题。 我在电子商务网站上以UX设计师的身份工作。我们有一个几年前建立的A / B测试框架,我对此表示怀疑。 我们做出所有决策所依据的指标称为转化,它基于访问该网站并最终购买商品的用户百分比。 因此,我们要测试将“购买”按钮的颜色从绿色更改为蓝色。 该控件就是我们已经拥有的控件,绿色按钮是我们知道平均转化率是多少。实验是将绿色按钮替换为蓝色按钮。 我们同意95%的显着性是我们满意的置信度,我们开启了实验,使其继续运行。 当用户访问网站时,在后台,他们有50/50的机会会被发送到对照版本(绿色按钮)与实验版本(蓝色按钮)。 经过7天的实验后,我发现转化率提高了10.2%,而样本量为3000(对照组为1500,实验为1500),统计学意义为99.2%。我认为很好。 实验继续进行,样本量增加,然后我发现转化率增加了9%,显着性为98.1%。好的,让实验运行更长的时间,现在实验仅显示出5%的提升,统计显着性仅为92%,框架告诉我在达到95%的显着性之前我还需要4600个样本? 那么实验在什么时候得出结论? 如果我想说一个临床试验过程,您需要事先就样本量达成共识,并完成实验,则无论何种度量标准都能将其提高10%,达到99%的显着性,然后就决定将该药物投放市场。但是,如果他们对4000人进行了实验,并且发现无论将哪种指标提高5%,只有92%的显着性,那么该药就不会被允许投放市场。 我们是否应该事先就样本量达成一致并在达到该样本量后立即停止并对结果满意(如果在关闭实验时的显着性为99%)?

3
是否在线性组合下保留平稳性?
想象一下,我们有两个固定的时间序列过程,产生:。xt,ytxt,ytx_t,y_t 是,也是静止的?∀ α ,β ∈ [Rzt=αxt+βytzt=αxt+βytz_t=\alpha x_t +\beta y_t∀α,β∈R∀α,β∈R\forall \alpha, \beta \in \mathbb{R} 任何帮助,将不胜感激。 我会说是的,因为它具有MA表示形式。

2
如何严格证明选择的假阳性/假阴性错误率和潜在成本比率?
语境 一组社会科学家和统计学家(Benjamin等人,2017年)最近建议,用作确定“统计意义”的阈值的典型假阳性率( = .05)需要调整为更保守的阈值( = .005)。一群竞争激烈的社会科学家和统计学家(Lakens等,2018)做出了回应,反对使用这个-或任何其他-任意选择的阈值。以下是Lakens等人的报价。(第16页)有助于举例说明我的问题的主题:ααα\alphaαα\alpha 理想情况下,通过使用决策理论将成本和收益与效用函数进行比较来确定Alpha级别。与从难以获得的样本中收集数据相比,这种成本效益分析(因此也就是alpha水平)在分析现有的大型数据集时有所不同。科学是多种多样的,这取决于科学家来证明他们决定使用的Alpha水平。...研究应遵循严格的科学原理,而不是启发法和任意的门槛。 题 我想知道如何才能像Lakens等人那样以“受严格科学原理指导”的方式证明所选alpha的合理性。建议,在大多数社会科学背景下(即在某些情况下,人们需要更具体的素质(例如利润)来优化)? 随着Lakens等人的传播,我开始看到在线计算器在流通,以帮助研究人员做出这一决定。研究人员在使用它们时,需要指定假阳性和假阴性错误的“成本比”。然而,由于这个计算器在这里建议,确定这样的成本比可能涉及大量的定量猜测工作: 尽管有些错误成本很容易用货币来量化(直接成本),而其他错误成本却很难将零头的金额(间接成本)量化。...尽管难以量化,但您仍应努力给他们加一个数字。 例如,尽管Lakens等。建议研究难以达到的样本,作为在证明α时可能要考虑的一个因素,似乎人们仍在猜测该样本难以达到的程度,从而如何相应地调整alpha的选择。再举一个例子,对我而言,要量化发表假阳性的成本似乎是困难的,要看别人随后会投入多少时间/金钱来进行基于错误推论的研究。 如果确定此成本比率在很大程度上是主观猜测的问题,那么我想知道这些决定是否能够(再次,除了优化诸如利润之类的)“合理化”。就是说,以某种方式存在于关于采样,权衡,影响等的假设之外?以这种方式,在我看来,确定假阳性/假阴性错误的成本比似乎类似于选择贝叶斯推断中的先验-这个决定可能是主观的,会影响结果,因此引起争议- -尽管我不确定这是否是合理的比较。 摘要 为了使我的询问具体: 在大多数社会科学背景下,假阳性率/假阴性率及其成本比率是否能被“严格”证明是正确的? 如果是这样,可以遵循哪些通用原则来证明这些分析选择是合理的(可能是其中一个或两个示例在起作用) 如果不是,我在选择成本比时的潜在主观性(类似于贝叶斯优先选择)是否合理? 参考文献 本杰明(DJ),伯杰(J. 重新定义统计意义。取自psyarxiv.com/mky9j Lakens,D.,Adolfi,FG,Albers,CJ,Anvari,F.,Apps,MA,... Zwaan,RA(2018年1月15日)。证明你的阿尔法。取自psyarxiv.com/9s3y6

1
反向传播的矩阵形式与批量归一化
批归一化已被认为可在深度神经网络中显着提高性能。互联网上的大量资料显示了如何在逐个激活的基础上实施它。我已经使用矩阵代数实现了backprop,并且考虑到我正在使用高级语言(同时依赖Rcpp(最终是GPU的)密集矩阵乘法),将所有内容剔除并采用for-loops可能会使我的代码变慢除了遭受巨大的痛苦之外 批处理归一化函数为 其中b(xp)=γ(xp−μxp)σ−1xp+βb(xp)=γ(xp−μxp)σxp−1+β b(x_p) = \gamma \left(x_p - \mu_{x_p}\right) \sigma^{-1}_{x_p} + \beta pxpxpx_p是激活之前的个节点ppp βγγ\gamma和是标量参数ββ\beta σ X p X pμxpμxp\mu_{x_p}和是均值和SD的。(请注意,通常使用方差的平方根加上一个模糊系数-假设非零元素为紧凑起见)σxpσxp\sigma_{x_p}xpxpx_p 以矩阵形式,整个层的批量归一化将为 其中b(X)=(γ⊗1p)⊙(X−μX)⊙σ−1X+(β⊗1p)b(X)=(γ⊗1p)⊙(X−μX)⊙σX−1+(β⊗1p) b(\mathbf{X}) = \left(\gamma\otimes\mathbf{1}_p\right)\odot \left(\mathbf{X} - \mu_{\mathbf{X}}\right) \odot\sigma^{-1}_{\mathbf{X}} + \left(\beta\otimes\mathbf{1}_p\right) XX\mathbf{X}是N×pN×pN\times p 1N1N\mathbf{1}_N是1的列向量 β pγγ\gamma和现在是每层归一化参数的行向量ββ\betappp σ X Ñ × p ÑμXμX\mu_{\mathbf{X}}和是矩阵,其中每一列都是列均值和标准差的向量σXσX\sigma_{\mathbf{X}}N×pN×pN \times pNNN ⊙⊗⊗\otimes是Kronecker产品,是elementwise(Hadamard)产品⊙⊙\odot ,这是一个非常简单的没有批次归一化且连续结果的单层神经网络 y=a(XΓ1)Γ2+ϵy=a(XΓ1)Γ2+ϵ y = a\left(\mathbf{X\Gamma}_1\right)\Gamma_2 + …

5
XXX和YYY独立地分布的随机变量,其中X∼χ2(n−1)X∼χ(n−1)2X\sim\chi^2_{(n-1)}和Y∼Beta(n2−1,n2−1)Y∼Beta(n2−1,n2−1)Y\sim\text{Beta}\left(\frac{n}{2}-1,\frac{n}{2}-1\right)。Z=(2Y−1)√的分布是什么Z=(2Y−1)X−−√Z=(2Y−1)XZ=(2Y-1)\sqrt X? 联合密度(X,Y)(X,Y)(X,Y)由下式给出 fX,Y(x,y)=fX(x)fY(y)=e−x2xn−12−12n−12Γ(n−12)⋅yn2−2(1−y)n2−2B(n2−1,n2−1)1{x>0,0<y<1}fX,Y(x,y)=fX(x)fY(y)=e−x2xn−12−12n−12Γ(n−12)⋅yn2−2(1−y)n2−2B(n2−1,n2−1)1{x>0,0<y<1}f_{X,Y}(x,y)=f_X(x)f_Y(y)=\frac{e^{-\frac{x}{2}}x^{\frac{n-1}{2}-1}}{2^{\frac{n-1}{2}}\Gamma\left(\frac{n-1}{2}\right)}\cdot\frac{y^{\frac{n}{2}-2}(1-y)^{\frac{n}{2}-2}}{B\left(\frac{n}{2}-1,\frac{n}{2}-1\right)}\mathbf1_{\{x>0\,,\,00\,,\,|z|

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.