统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
正态高斯向量的线性变换
我在证明以下陈述方面面临困难。它在Google上的研究论文中给出。我需要帮助证明这一说法! 令X=ASX=ASX= AS,其中AAA是正交矩阵,而SSS是高斯。在任何正交基础上具有相同分布的高斯的同位素行为SSS。 在S上应用A后,XXX高斯如何?AAASSS

2
给定的概率是多少?
假设XXX和YYY是均值μ=(μ1,μ2)μ=(μ1,μ2)\mu=(\mu_1,\mu_2)且协方差 Σ=[σ11σ12σ12σ22]Σ=[σ11σ12σ12σ22]\Sigma = \begin{bmatrix} \sigma_{11} & \sigma_{12} \\ \sigma_{12} & \sigma_{22} \\ \end{bmatrix}。\ Pr \ left(X &lt;Y | \ min \ left(X,Y \ right)\ right)的概率是Pr(X&lt;Y|min(X,Y))Pr(X&lt;Y|min(X,Y))\Pr\left(X<Y|\min\left(X,Y\right)\right)多少?

2
“让数据说明一切”是什么意思?
在阅读以下论文时,我遇到了以下声明: 如上所述,与Benzecri [1973]提出的“让数据不言自明”的想法一致,它通常在未提及任何概率模型的情况下提出。 (引自JPBenzécri。L'analyse desdonnées。《 Tome II:L'analyse des通信》。Dunod,1973年。) 从我阅读本文的方式来看,听起来像“让数据自己说出来”意味着在考虑跨数据的各种度量的过程中无需考虑似然函数或数据生成过程。 虽然我之前曾听过“让数据说明一切”的名言,但我并没有认真考虑隐含的含义。我的上述解释是这个报价所暗示的含义吗?
10 eda  quotation 

1
上UMVUE的存在和选择的估计的在人口
让是从绘制的随机样本人口其中。(X1,X2,⋯,Xn)(X1,X2,⋯,Xn)(X_1,X_2,\cdots,X_n)N(θ,θ2)N(θ,θ2)\mathcal N(\theta,\theta^2)θ∈Rθ∈R\theta\in\mathbb R 我正在寻找的UMVUE 。θθ\theta 联合密度为(X1,X2,⋯,Xn)(X1,X2,⋯,Xn)(X_1,X_2,\cdots,X_n) fθ(x1,x2,⋯,xn)=∏i=1n1θ2π−−√exp[−12θ2(xi−θ)2]=1(θ2π−−√)nexp[−12θ2∑i=1n(xi−θ)2]=1(θ2π−−√)nexp[1θ∑i=1nxi−12θ2∑i=1nx2i−n2]=g(θ,T(x))h(x)∀(x1,⋯,xn)∈Rn,∀θ∈Rfθ(x1,x2,⋯,xn)=∏i=1n1θ2πexp⁡[−12θ2(xi−θ)2]=1(θ2π)nexp⁡[−12θ2∑i=1n(xi−θ)2]=1(θ2π)nexp⁡[1θ∑i=1nxi−12θ2∑i=1nxi2−n2]=g(θ,T(x))h(x)∀(x1,⋯,xn)∈Rn,∀θ∈R\begin{align} f_{\theta}(x_1,x_2,\cdots,x_n)&=\prod_{i=1}^n\frac{1}{\theta\sqrt{2\pi}}\exp\left[-\frac{1}{2\theta^2}(x_i-\theta)^2\right] \\&=\frac{1}{(\theta\sqrt{2\pi})^n}\exp\left[-\frac{1}{2\theta^2}\sum_{i=1}^n(x_i-\theta)^2\right] \\&=\frac{1}{(\theta\sqrt{2\pi})^n}\exp\left[\frac{1}{\theta}\sum_{i=1}^n x_i-\frac{1}{2\theta^2}\sum_{i=1}^nx_i^2-\frac{n}{2}\right] \\&=g(\theta,T(\mathbf x))h(\mathbf x)\qquad\forall\,(x_1,\cdots,x_n)\in\mathbb R^n\,,\forall\,\theta\in\mathbb R \end{align} ,其中和h(\ mathbf x)= 1。h(x)=1g(θ,T(x))=1(θ2π√)nexp[1θ∑ni=1xi−12θ2∑ni=1x2i−n2]g(θ,T(x))=1(θ2π)nexp⁡[1θ∑i=1nxi−12θ2∑i=1nxi2−n2]g(\theta, T(\mathbf x))=\frac{1}{(\theta\sqrt{2\pi})^n}\exp\left[\frac{1}{\theta}\sum_{i=1}^n x_i-\frac{1}{2\theta^2}\sum_{i=1}^nx_i^2-\frac{n}{2}\right]h(x)=1h(x)=1h(\mathbf x)=1 在这里,ggg取决于θθ\theta和x1,⋯,xnx1,⋯,xnx_1,\cdots,x_n到T(x)=(∑ni=1xi,∑ni=1x2i)T(x)=(∑i=1nxi,∑i=1nxi2)T(\mathbf x)=\left(\sum_{i=1}^nx_i,\sum_{i=1}^nx_i^2\right)并且hhh独立于θθ\theta。因此,通过Fisher-Neyman分解定理,二维统计量T(X)=(∑ni=1Xi,∑ni=1X2i)T(X)=(∑i=1nXi,∑i=1nXi2)T(\mathbf X)=\left(\sum_{i=1}^nX_i,\sum_{i=1}^nX_i^2\right)足以满足θθ\theta。 但是,TTT不是一个完整的统计信息。这是因为Ëθ⎡⎣2 (∑我= 1ñX一世)2− (n + 1 )∑我= 1ñX2一世⎤⎦= 2 n (1 + n )θ2- (Ñ + 1 )2 Ñ θ2= 0∀θEθ[2(∑i=1nXi)2−(n+1)∑i=1nXi2]=2n(1+n)θ2−(n+1)2nθ2=0∀θE_{\theta}\left[2\left(\sum_{i=1}^n X_i\right)^2-(n+1)\sum_{i=1}^nX_i^2\right]=2n(1+n)\theta^2-(n+1)2n\theta^2=0\qquad\forall\,\theta …

1
负概率:外行说明
我对这里的答案很感兴趣。我想更全面地解释负概率可能意味着什么及其应用,并可能附带示例。例如,根据这些扩展的概率度量,事件具有-10%的概率意味着什么?

3
“实用”试验:它们是什么?
在推特上,一名审判员斯图尔特·尼科尔斯(Stuart Nicholls)批评了最近发表的一项研究,他说: 除了Dal-Re的一篇非常有趣的论文外,他们还举了几个质疑实用主义术语用法的例子。3期,多部位,双盲,安慰剂对照,并联,剂量增量随机试验是否真的可以称为“实用”? 有关的研究文章在这里链接。Dal-Re的论文在这里。他们推荐的“实用主义”工具在这里。我可能与Nicholls有所不同,因为我的感觉是,就治疗的性质和171名患者的N个而言,这可能是一项研究不足的研究……但这是否使其实用(相对于证实性研究?)。 我觉得我错过了重点。实际上,什么是实用的审判?从什么意义上说,什么时候没有实际意义的审判是不可行的;从肯定的意义上来讲,什么时候审判不具有实用性?

2
UMVUE
让(X1,X2,…,Xn)(X1,X2,…,Xn)(X_1,X_2,\ldots,X_n)是从密度的随机样本fθ(x)=θxθ−110&lt;x&lt;1,θ&gt;0fθ(x)=θxθ−110&lt;x&lt;1,θ&gt;0f_{\theta}(x)=\theta x^{\theta-1}\mathbf1_{00 我正在尝试找到θ的UMVUEθ1+θθ1+θ\frac{\theta}{1+\theta}。 (X1,…,Xn)(X1,…,Xn)(X_1,\ldots,X_n)的联合密度为 fθ(x1,⋯,xn)=θn(∏i=1nxi)θ−110&lt;x1,…,xn&lt;1=exp[(θ−1)∑i=1nlnxi+nlnθ+ln(10&lt;x1,…,xn&lt;1)],θ&gt;0fθ(x1,⋯,xn)=θn(∏i=1nxi)θ−110&lt;x1,…,xn&lt;1=exp⁡[(θ−1)∑i=1nln⁡xi+nln⁡θ+ln⁡(10&lt;x1,…,xn&lt;1)],θ&gt;0\begin{align} f_{\theta}(x_1,\cdots,x_n)&=\theta^n\left(\prod_{i=1}^n x_i\right)^{\theta-1}\mathbf1_{00 \end{align} 随着人口的PDF fθfθf_{\theta}属于单参数指数族,这表明,对于一个完整的充分统计量θθ\theta是T(X1,…,Xn)=∑i=1nlnXiT(X1,…,Xn)=∑i=1nln⁡XiT(X_1,\ldots,X_n)=\sum_{i=1}^n\ln X_i 由于E(X1)=θ1+θE(X1)=θ1+θE(X_1)=\frac{\theta}{1+\theta},首先想到E(X1∣T)E(X1∣T)E(X_1\mid T)将给我θ的UMVUEθ1+θθ1+θ\frac{\theta}{1+\theta}根据Lehmann-Scheffe定理, 1 + θ。不确定是否可以直接找到该条件期望,还是必须找到条件分布 X1∣∑ni=1lnXiX1∣∑i=1nln⁡XiX_1\mid \sum_{i=1}^n\ln X_i。 另一方面,我考虑了以下方法: 我们有Xi∼i.i.dBeta(θ,1)⟹−2θlnXi∼i.i.dχ22Xi∼i.i.dBeta(θ,1)⟹−2θln⁡Xi∼i.i.dχ22X_i\stackrel{\text{i.i.d}}{\sim}\text{Beta}(\theta,1)\implies -2\theta\ln X_i\stackrel{\text{i.i.d}}{\sim}\chi^2_2,使−2θT∼χ22n−2θT∼χ2n2-2\theta\, T\sim\chi^2_{2n}。 所以,rrr的阶原时刻−2θT−2θT-2\theta\,T大约为零,作为使用卡方PDF计算是E(−2θT)r=2rΓ(n+r)Γ(n),n+r&gt;0E(−2θT)r=2rΓ(n+r)Γ(n),n+r&gt;0E(-2\theta\,T)^r=2^r\frac{\Gamma\left(n+r\right)}{\Gamma\left(n\right)}\qquad ,\,n+r>0 因此,似乎对于rrr不同整数选择,我将获得θθ\theta的不同整数幂的无偏估计量(和UMVUE)。例如,E(−Tn)=1θE(−Tn)=1θE\left(-\frac{T}{n}\right)=\frac{1}{\theta}和E(1−nT)=θE(1−nT)=θE\left(\frac{1-n}{T}\right)=\theta直接给我1的UMVUE1θ1θ\frac{1}{\theta}和θθ\theta。 现在,当θ&gt;1θ&gt;1\theta>1我们有θ1+θ=(1+1θ)−1=1−1θ+1θ2−1θ3+⋯θ1+θ=(1+1θ)−1=1−1θ+1θ2−1θ3+⋯\frac{\theta}{1+\theta}=\left(1+\frac{1}{\theta}\right)^{-1}=1-\frac{1}{\theta}+\frac{1}{\theta^2}-\frac{1}{\theta^3}+\cdots。 我绝对可以得到1的UMVUE1θ,1θ2,1θ31θ,1θ2,1θ3\frac{1}{\theta},\frac{1}{\theta^2},\frac{1}{\theta^3}等。所以结合这些UMVUE是我能得到所需的UMVUEθ1+θθ1+θ\frac{\theta}{1+\theta}。此方法有效吗?还是我应该继续第一种方法?由于UMVUE存在时是唯一的,因此两者都应给我相同的答案。 明确地说,我得到E(1+Tn+T2n(n+1)+T3n(n+1)(n+2)+⋯)=1−1θ+1θ2−1θ3+⋯E(1+Tn+T2n(n+1)+T3n(n+1)(n+2)+⋯)=1−1θ+1θ2−1θ3+⋯E\left(1+\frac{T}{n}+\frac{T^2}{n(n+1)}+\frac{T^3}{n(n+1)(n+2)}+\cdots\right)=1-\frac{1}{\theta}+\frac{1}{\theta^2}-\frac{1}{\theta^3}+\cdots 即,E(∑r=0∞Trn(n+1)...(n+r−1))=θ1+θE(∑r=0∞Trn(n+1)...(n+r−1))=θ1+θE\left(\sum_{r=0}^\infty \frac{T^r}{n(n+1)...(n+r-1)}\right)=\frac{\theta}{1+\theta} 有没有可能是我需要的是UMVUE ∑r=0∞Trn(n+1)...(n+r−1)∑r=0∞Trn(n+1)...(n+r−1)\displaystyle\sum_{r=0}^\infty \frac{T^r}{n(n+1)...(n+r-1)}当θ&gt;1θ&gt;1\theta>1? 为0&lt;θ&lt;10&lt;θ&lt;10<\theta<1,我会得到g(θ)=θ(1+θ+θ2+⋯)g(θ)=θ(1+θ+θ2+⋯)g(\theta)=\theta(1+\theta+\theta^2+\cdots),因此将UMVUE不同。 已经确信的是,在第一种方法的条件期望值不能直接找到,因为E(X1∣∑lnXi=t)=E(X1∣∏Xi=et)E(X1∣∑ln⁡Xi=t)=E(X1∣∏Xi=et)E(X_1\mid \sum\ln X_i=t)=E(X_1\mid \prod X_i=e^t),我已经着手寻找条件分布X1∣∏XiX1∣∏XiX_1\mid \prod X_i。为此,我需要(X1,∏Xi)(X1,∏Xi)(X_1,\prod X_i)的联合密度。 我用了变数(X1,⋯,Xn)→(Y1,⋯,Yn)(X1,⋯,Xn)→(Y1,⋯,Yn)(X_1,\cdots,X_n)\to (Y_1,\cdots,Y_n)使得Yi=∏ij=1XjYi=∏j=1iXjY_i=\prod_{j=1}^i X_j所有i=1,2,⋯,ni=1,2,⋯,ni=1,2,\cdots,n。这导致关节支承的(Y1,⋯,Yn)(Y1,⋯,Yn)(Y_1,\cdots,Y_n)是S={(y1,⋯,yn):0&lt;y1&lt;1,0&lt;yj&lt;yj−1 for j=2,3,⋯,n}S={(y1,⋯,yn):0&lt;y1&lt;1,0&lt;yj&lt;yj−1 for …

2
随机图中三角形数量的分布和方差
考虑一个Erdos-Renyi随机图G=(V(n),E(p))G=(V(n),E(p))G=(V(n),E(p))。该组nnn顶点VVV由标V={1,2,…,n}V={1,2,…,n}V = \{1,2,\ldots,n\}。边缘的集合EEE通过随机过程构造。 让ppp是一个概率0&lt;p&lt;10&lt;p&lt;10<p<1,则每个二元集合{i,j}{i,j}\{i,j\}顶点(i≠ji≠ji \neq j)发生在边缘EEE以概率ppp,独立于其它对。 GGG中的三角形是不同顶点的无序三元组{i,j,k}{i,j,k}\{i,j,k\},因此{i,j}{i,j}\{i,j\},{j,k}{j,k}\{j,k\}和{k,i}{k,i}\{k,i\}是中的边GGG。 可能的三角形最大数量为。将随机变量定义为图观察到的三角形数。(n3)(n3)\binom{n}{3}XXXGGG 同时存在三个链接的概率为p3p3p^3。因此,X的期望值XXX由E(X)=(n3)p3E(X)=(n3)p3E(X) = \binom{n}{3} p^3。天真的,人们可能会猜测方差由E(X2)=(n3)p3(1−p3)E(X2)=(n3)p3(1−p3)E(X^2) =\binom{n}{3} p^3 (1-p^3),但事实并非如此。 下面的Mathematica代码模拟了该问题: n=50; p=0.6; t=100; myCounts=Table[Length[FindCycle[RandomGraph[BernoulliGraphDistribution[n,p]],3,All]],{tt,1,t}]; N[Mean[myCounts]] // 4216. &gt; similar to expected mean Binomial[n,3]p^3 // 4233.6 N[StandardDeviation[myCounts]] // 262.078 &gt; not similar to "expected" std Sqrt[Binomial[n,3](p^3)(1-p^3)] // 57.612 Histogram[myCounts] X的方差是XXX多少?

3
两个变量之和的方差公式的直觉
我从以前的研究中知道 V一个- [R (甲+ 乙)= V一个- [R (甲)+ Va r (B )+ 2 Co v (A ,B )V一个[R(一个+乙)=V一个[R(一个)+V一个[R(乙)+2CØv(一个,乙)Var(A+B) = Var(A) + Var(B) + 2 Cov (A,B) 但是,我不明白为什么。我可以看到,当A和B高度变化时,其效果将是“推高”方差。这是有道理的,当您从两个高度相关的变量创建一个合成时,您倾向于将A的高观测值与B的高观测值相加,A的低观测值与B的低观测值相加。在复合变量中创建极高和极低的值,从而增加复合变量的方差。 但为什么它的工作原理通过乘以协方差恰好 2?

3
MAP是
我在其中一门在线课程中遇到了这些幻灯片(第16和#17号幻灯片)。讲师试图解释最大后验估计(MAP)实际上是解决方案L(θ)=I[θ≠θ∗]L(θ)=I[θ≠θ∗]L(\theta) = \mathcal{I}[\theta \ne \theta^{*}],其中θ∗θ∗\theta^{*}是真实参数。 有人可以解释一下如何进行吗? 编辑:添加了幻灯片,以防链接断开。


5
如何测量词频数据中的离散度?
如何量化字数向量中的离散量?我正在寻找一种统计数据,该统计数据对于文档A而言会很高,因为它包含许多不经常出现的单词,而对于文档B而言却很低,因为它包含一个经常出现的单词(或几个单词)。 更一般而言,如何测量名义数据中的离散或“扩散”? 文本分析社区中是否有标准的方法?

4
为什么对重新采样的数据集进行假设检验经常会拒绝零值?
tl; dr:从空值下生成的数据集开始,我对样本进行了替换并重新采样,并对每个重新采样的数据集进行了假设检验。这些假设检验在超过5%的时间内拒绝了原假设。 在下面的非常简单的模拟中,我使用生成数据集,并为每个数据集拟合一个简单的OLS模型。然后,对于每个数据集,我通过替换替换原始数据集的行来生成1000个新数据集(该算法在Davison&Hinkley的经典文章中专门描述为适合线性回归的算法)。对于每一个,我都使用相同的OLS模型。最终,引导样本中大约16%的假设检验拒绝了null,而我们应该得到5%(就像在原始数据集中所做的那样)。X〜ñ(0 ,1 )⨿ ÿ〜ñ(0 ,1 )X〜ñ(0,1个)⨿ÿ〜ñ(0,1个)X \sim N(0,1) \amalg Y \sim N(0,1) 我怀疑这与重复观察导致虚假关联有关,因此为了进行比较,我尝试了以下代码中的两种其他方法(注释掉)。在方法2中,我修复,然后用原始数据集上OLS模型中的重采样残差替换在方法3中,我绘制了一个随机子样本而不进行替换。这两种选择均起作用,即它们的假设检验拒绝了5%的无效时间。ÿXXXÿÿY 我的问题:罪魁祸首是反复观察吗?如果是这样,考虑到这是引导程序的标准方法,那么我们到底在哪里违反标准引导程序理论? 更新#1:更多模拟 我尝试了一个更简单的方案,即的仅拦截回归模型。发生相同的问题。ÿÿY # note: simulation takes 5-10 min on my laptop; can reduce boot.reps # and n.sims.run if wanted # set the number of cores: can change this to match your machine library(doParallel) registerDoParallel(cores=8) …

6
教学贝叶斯统计的简单现实例子?
我想找到一些“现实世界的例子”来教授贝叶斯统计。贝叶斯统计允许人们将先验知识正式纳入分析。我想给学生一些简单的现实世界中的研究人员实例,这些研究人员将先验知识整合到他们的分析中,以便学生可以更好地理解为什么首先要使用贝叶斯统计的动机。 您是否知道任何简单的现实世界示例,例如估算总体均值,比例,回归等,研究人员正式将先前的信息纳入其中?我意识到贝叶斯主义者也可以使用“非信息”先验,但是我对使用信息先验(即真实先验信息)的真实示例特别感兴趣。

7
敏感性或特异性是患病率的函数吗?
标准教学说,敏感性和特异性是测试的属性,与患病率无关。但这不只是一个假设吗? 哈里森的内科学原理第19版说 长期以来,人们一直认为敏感性和特异性是测试准确性与患病率无关的参数,许多文献仍在发表这一声明。然而,这种统计学上有用的假设在临床上是简单的。...住院患者的测试敏感性可能更高,而门诊患者的测试特异性更高。 (住院患者的患病率通常高于门诊患者) 这些参数之间是否存在数学或近似图形关系? 即使这个链接也称其为“简化”。为什么? 编辑:我知道如何定义灵敏度。正如答案中所提到的,没有涉及流行的术语。我本人一直坚持认为,这些是测试的属性,不受所使用的总体影响,直到我遇到此声明,因此才提出问题。但我认为,造成这种混乱的原因不是由于定义,而是由于这些值的实际计算。特异性和敏感性是使用2x2表格计算的,这里参考人群的普遍性重要吗?这就是他们所指的吗?如果可以,功能是什么?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.