统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
了解多项式回归(MLR)的置信区间的形状
我很难掌握多项式回归的置信区间的形状。 这是一个人工示例,。左图显示了UPV(无标度预测方差),右图显示了置信区间和(人工)在X = 1.5,X = 2和X = 3处的测量点。Y^=a+b⋅X+c⋅X2Y^=a+b⋅X+c⋅X2\hat{Y}=a+b\cdot X+c\cdot X^2 基础数据的详细信息: 数据集由三个数据点(1.5; 1),(2; 2.5)和(3; 2.5)组成。 每个点被“测量”了10次,每个测量值属于。对30个结果点进行了具有多项式模型的MLR。y±0.5y±0.5y \pm 0.5 的置信区间计算与式 和 (两个公式均取自Myers,Montgomery,Anderson-Cook的“ Response Surface Methodology”第四版,第407和34页)UPV=Var[y^(x0)]σ^2=x′0(X′X)−1x0UPV=Var[y^(x0)]σ^2=x0′(X′X)−1x0 UPV=\frac{Var[\hat{y}(x_0)]}{\hat{\sigma}^2}=x_0'(X'X)^{-1}x_0 y^(x0)−tα/2,df(error)σ^2⋅x′0(X′X)−1x0−−−−−−−−−−−−−−√y^(x0)−tα/2,df(error)σ^2⋅x0′(X′X)−1x0 \hat{y}(x_0) - t_{\alpha /2, df(error)}\sqrt{\hat{\sigma}^2\cdot x_0'(X'X)^{-1}x_0} ≤μy|x0≤y^(x0)+tα/2,df(error)σ^2⋅x′0(X′X)−1x0−−−−−−−−−−−−−−√.≤μy|x0≤y^(x0)+tα/2,df(error)σ^2⋅x0′(X′X)−1x0. \leq \mu_{y|x_0} \leq \hat{y}(x_0) + t_{\alpha /2, df(error)}\sqrt{\hat{\sigma}^2\cdot x_0'(X'X)^{-1}x_0} . tα/2,df(error)=2tα/2,df(error)=2t_{\alpha /2, df(error)}=2和。σ^2=MSE=SSE/(n−p)∼0.075σ^2=MSE=SSE/(n−p)∼0.075 \hat{\sigma}^2=MSE=SSE/(n-p)\sim0.075 我对置信区间的绝对值不是特别感兴趣,而是对仅取决于的UPV形状感兴趣。x′0(X′X)−1x0x0′(X′X)−1x0x_0'(X'X)^{-1}x_0 图1: 设计空间之外的非常高的预测方差是正常的,因为我们在推断 …

1
二次形式的渐近正态性
令xx\mathbf{x}为从提取的随机向量PPP。考虑一个样本{xi}ni=1∼i.i.d.P{xi}i=1n∼i.i.d.P\{ \mathbf{x}_i \}_{i=1}^n \stackrel{i.i.d.}{\sim} P。限定x¯n:=1n∑ni=1xix¯n:=1n∑i=1nxi\bar{\mathbf{x}}_n := \frac{1}{n} \sum_{i=1}^n \mathbf{x}_i,和 c ^:=1C^:=1n∑ni=1(xi−x¯n)(xi−x¯n)⊤C^:=1n∑i=1n(xi−x¯n)(xi−x¯n)⊤\hat{C} := \frac{1}{n} \sum_{i=1}^n (\mathbf{x}_i - \bar{\mathbf{x}}_n) (\mathbf{x}_i - \bar{\mathbf{x}}_n)^\top。让和。μ:=Ex∼P[x]μ:=Ex∼P[x]\boldsymbol{\mu} := \mathbb{E}_{\mathbf{x}\sim P}[\mathbf{x}]C:=covx∼P[x,x]C:=covx∼P[x,x]C:=\mathrm{cov}_{\mathbf{x} \sim P}[\mathbf{x}, \mathbf{x}] 根据中心极限定理,假设 n−−√(x¯n−μ)→dN(0,C),n(x¯n−μ)→dN(0,C), \sqrt{n} \big( \bar{\mathbf{x}}_n - \boldsymbol{\mu} \big) \stackrel{d}{\to} \mathcal{N}(\boldsymbol{0}, C), 其中是满秩协方差矩阵。CCC 问题:我如何证明(或反对) n−−√(x¯⊤n(C^+γnI)−1x¯n−μ⊤C−1μ)→dN(0,v2),n(x¯n⊤(C^+γnI)−1x¯n−μ⊤C−1μ)→dN(0,v2),\sqrt{n} \big( \bar{\mathbf{x}}_n^\top (\hat{C} + \gamma_n I)^{-1} \bar{\mathbf{x}}_n - \boldsymbol{\mu}^\top C^{-1} …

2
美世定理是否相反?
一位同事有一个功能sss,对我们来说,它是一个黑匣子。该函数测量两个对象的相似度s (a ,b )s(a,b)s(a,b)。 我们肯定知道sss具有以下属性: 相似性分数是介于0和1之间(含0和1)的实数。 只有自我相同的对象的分数才为1。因此s (a ,b )= 1s(a,b)=1s(a,b)=1意味着a = ba=ba=b,反之亦然。 我们保证。s (a ,b )= s (b ,a )s(a,b)=s(b,a)s(a,b) = s(b,a) 现在,他想使用需要距离作为输入的算法,并依赖于满足距离公理的输入。 我的想法是,我们可以将相似性分数视为RBF核的结果有一定距离(可以是欧几里得范数或其他距离),即可以用代数重新排列,并假设相似性分数指的是RBF内核用于某些(未知)坐标系中的一对点。 小号(X一世,XĴ)− r 日志小号(X一世,XĴ)------------√= 经验( - d(米一世,米Ĵ)2[R)= d(米一世,米Ĵ)s(xi,xj)=exp⁡(−d(mi,mj)2r)−rlog⁡s(xi,xj)=d(mi,mj) \begin{align} s(x_i,x_j) &= \exp\left(-\frac{d( m_i, m_j)^2}{r}\right) \\ \sqrt{-r \log s(x_i,x_j) } &= d(m_i,m_j) \\ \end{align} 其中是一些未知向量,和X α是感兴趣的对象,并且d是一段距离。米α∈ [Rñmα∈Rnm_\alpha …

2
Iid Gamma变量的总和
令为具有概率密度函数的独立且均匀分布的随机变量的序列; 显示X1,X2,…X1,X2,…X_1,X_2,\ldotsf(x)={12x2e−x0if x>0;otherwise.f(x)={12x2e−xif x>0;0otherwise. f(x) = \left\{ \begin{array}{ll} \frac{1}{2}x^2 e^{-x} & \mbox{if $x>0$};\\ 0 & \mbox{otherwise}.\end{array} \right. limn→∞P[X1+X2+…+Xn≥3(n−n−−√)]≥12limn→∞P[X1+X2+…+Xn≥3(n−n)]≥12\lim_{n\to \infty} P[X_1+X_2+\ldots+X_n\ge 3(n-\sqrt{n})] \ge \frac{1}{2} 我尝试过的 乍一看,我认为应该使用切比雪夫不等式,因为问题是要求显示下限X1+X2+…+XnX1+X2+…+XnX_1+X_2+\ldots +X_n。但是,我想到了极限符号,该符号清楚地表明该问题可能与中央极限定理(CLT)有关 令Sn=X1+X2+…+XnSn=X1+X2+…+XnS_n=X_1+X_2+\ldots +X_n E(Sn)=∑i=0nE(Xi)=3n (since E(Xi)=3)V(Sn)=∑i=0nV(Xi)=3n (since V(Xi)=3 and Xi are i.i.d)E(Sn)=∑i=0nE(Xi)=3n (since E(Xi)=3)V(Sn)=∑i=0nV(Xi)=3n (since V(Xi)=3 and Xi are i.i.d)E(S_n)=\sum_{i=0}^{n} E(X_i)=3n \ (\text{since } E(X_i)=3) …

2
如果和是各自均值为零的独立法线变量,则也是法线变量
我试图证明这一说法: 如果和是独立随机变量,X∼N(0,σ21)X∼N(0,σ12)X\sim\mathcal{N}(0,\sigma_1^2)Y∼N(0,σ22)Y∼N(0,σ22)Y\sim\mathcal{N}(0,\sigma_2^2) 那么也是一个普通随机变量。XYX2+Y2√XYX2+Y2\frac{XY}{\sqrt{X^2+Y^2}} 对于特殊情况(例如),我们得到的著名结果是每当和是独立的变量时。实际上,更普遍地知道是独立的变量。σ1=σ2=σσ1=σ2=σ\sigma_1=\sigma_2=\sigmaXYX2+Y2√∼N(0,σ24)XYX2+Y2∼N(0,σ24)\frac{XY}{\sqrt{X^2+Y^2}}\sim\mathcal{N}\left(0,\frac{\sigma^2}{4}\right)XXXYYYN(0,σ2)N(0,σ2)\mathcal{N}(0,\sigma^2)XYX2+Y2√,X2−Y22X2+Y2√XYX2+Y2,X2−Y22X2+Y2\frac{XY}{\sqrt{X^2+Y^2}},\frac{X^2-Y^2}{2\sqrt{X^2+Y^2}}N(0,σ24)N(0,σ24)\mathcal{N}\left(0,\frac{\sigma^2}{4}\right) 最后的证明是使用的变换其中而。实际上,这里和。我试图模仿这个证明来解决手头的问题,但看起来似乎很混乱。(X,Y)→(R,Θ)→(U,V)(X,Y)→(R,Θ)→(U,V)(X,Y)\to(R,\Theta)\to(U,V)x=rcosθ,y=rsinθx=rcos⁡θ,y=rsin⁡θx=r\cos\theta,y=r\sin\thetau=r2sin(2θ),v=r2cos(2θ)u=r2sin⁡(2θ),v=r2cos⁡(2θ)u=\frac{r}{2}\sin(2\theta),v=\frac{r}{2}\cos(2\theta)U=XYX2+Y2√U=XYX2+Y2U=\frac{XY}{\sqrt{X^2+Y^2}}V=X2−Y22X2+Y2√V=X2−Y22X2+Y2V=\frac{X^2-Y^2}{2\sqrt{X^2+Y^2}} 如果我没有做任何错误,那么对于我最终得到的联合密度为(u,v)∈R2(u,v)∈R2(u,v)\in\mathbb{R}^2(U,V)(U,V)(U,V) fU,V(u,v)=2σ1σ2πexp[−u2+v2−−−−−−√(u2+v2−−−−−−√+vσ21+u2+v2−−−−−−√−vσ22)]fU,V(u,v)=2σ1σ2πexp⁡[−u2+v2(u2+v2+vσ12+u2+v2−vσ22)]f_{U,V}(u,v)=\frac{2}{\sigma_1\sigma_2\pi}\exp\left[-\sqrt{u^2+v^2}\left(\frac{\sqrt{u^2+v^2}+v}{\sigma_1^2}+\frac{\sqrt{u^2+v^2}-v}{\sigma_2^2}\right)\right] 我有上面的乘数,因为变换不是一对一的。222 因此,密度将由,该值不易评估。UUU∫RfU,V(u,v)dv∫RfU,V(u,v)dv\displaystyle \int_{\mathbb{R}}f_{U,V}(u,v)\,\mathrm{d}v 现在,我很想知道是否有证据证明我只能与工作,而不必考虑某个来表明是正常的。对我来说,找到的CDF 看起来并不那么有希望。对于的情况,我也想这样做。UUUVVVUUUUUUσ1=σ2=σσ1=σ2=σ\sigma_1=\sigma_2=\sigma 也就是说,如果和是独立的变量,那么我想证明而无需更改变量。如果我能以某种方式争论,那么我就完成了。所以这里有两个问题,一般情况,然后是特殊情况。XXXYYYN(0,σ2)N(0,σ2)\mathcal{N}(0,\sigma^2)Z=2XYX2+Y2√∼N(0,σ2)Z=2XYX2+Y2∼N(0,σ2)Z=\frac{2XY}{\sqrt{X^2+Y^2}}\sim\mathcal{N}(0,\sigma^2)Z=dXZ=dXZ\stackrel{d}{=}X Math.SE上的相关文章: X2−Y2/X2+Y2−−−−−−−√∼N(0,1)X2−Y2/X2+Y2∼N(0,1)X^2-Y^2/ \sqrt{X^2+Y^2}\sim N(0,1)当独立时X,Y∼N(0,1)X,Y∼N(0,1)X,Y\sim N(0,1)。 假设是iid,则表明是iidX,YX,YX,YN(0,1)N(0,1)N(0,1)XYX2+Y2√,X2−Y22X2+Y2√XYX2+Y2,X2−Y22X2+Y2\frac{XY}{\sqrt{X^2+Y^2}},\frac{X^2-Y^2}{2\sqrt{X^2+Y^2}}N(0,14)N(0,14)N(0,\frac{1}{4})。 编辑。 事实上,这个问题是由于我在Feller的《概率论及其应用入门》(第二卷)练习中发现的L. Shepp以及可能的提示: 当然,并且手边有的密度。U=XYX2+Y2√=11X2+1Y2√U=XYX2+Y2=11X2+1Y2U=\frac{XY}{\sqrt{X^2+Y^2}}=\frac{1}{\sqrt{\frac{1}{X^2}+\frac{1}{Y^2}}}1X21X2\frac{1}{X^2} 让我们看看我现在能做什么。除此之外,还欢迎对以上积分提供一些帮助。

2
提升Logistic回归模型
Adaboost是一种集成方法,它结合了许多弱学习者,形成了一个强大的学习者。我已经阅读过的所有关于adaboost的例子都将决策树/树用作弱学习者。我可以在adaboost中使用其他弱学习者吗?例如,如何实现adaboost(通常为boosting)来增强logistic回归模型? 分类树和逻辑回归的主要区别之一是前者输出类别(-1,1),而逻辑回归输出概率。一个想法是从一组特征中选择最佳特征X,并选择一个阈值(0.5?)将概率转换为类,然后使用加权逻辑回归来找到下一个特征,等等。 但是我认为,存在一种通用的算法来促进不同的弱学习者,而不是那些输出概率的决策树桩。我相信Logitboost是我的问题的答案,但我尝试阅读“ Additive Logistic Regression”(加性Logistic回归)论文,并陷入了中间。

3
模具100卷没有面孔出现超过20次
我正在努力解决这个问题。 模具被轧制100次。没有面孔出现超过20次的概率是多少?我的第一个想法是使用二项分布P(x)= 1-6 cmf(100,1/6,20),但这显然是错误的,因为我们对某些情况进行了多次计算。我的第二个想法是枚举所有可能的滚动x1 + x2 + x3 + x4 + x5 + x6 = 100,使得xi <= 20并将多项式求和,但这似乎计算量很大。近似解决方案也将对我有用。

5
隐藏教授(回归战舰)的回归模型[关闭]
已关闭。这个问题需要细节或说明。它当前不接受答案。 想改善这个问题吗?添加细节并通过编辑此帖子来澄清问题。 2年前关闭。 我正在做一项家庭作业,我的教授希望我们创建一个真正的回归模型,模拟数据样本,他将尝试使用我们在课堂上学到的一些技术来寻找我们真正的回归模型。同样,我们将不得不对他给我们的数据集做同样的事情。 他说,过去的所有尝试去欺骗他的人,他都能产生出非常准确的模型。有一些学生创建了一些疯狂的模型,但是可以说他能够产生一个简单的模型就足够了。 我该如何为他找到一个棘手的模型?我不想做4个二次项,3个观测值和大量方差而变得超级便宜吗?我如何才能生成一个看起来无害的数据集,该数据集下面有一个艰难的小模型? 他只是遵循以下3条规则: 您的数据集必须有一个“ Y”变量和20个“ X”变量,分别标记为“ Y”,“ X1”,...,“ X20”。 您的响应变量必须来自满足以下条件的线性回归模型: 其中和。ÿ ' 我 = β 0 + β 1 X ' 我1 + ... + β p - 1 X ' 我,p - 1 + ε 我ε 我〜Ñ (0 ,σ 2)ÿYY ÿ′一世= β0+ β1个X′我1+ … + …

3
卷积神经网络尺度敏感性
举个例子,假设我们基于一个人的照片建立一个年龄估计器。下面我们有两个穿着西装的人,但第一个显然比第二个年轻。 (来源:tinytux.com) 有很多功能可以暗示这一点,例如面部结构。但是,最有说服力的功能是头部大小与身体大小的比率: (来源:wikimedia.org) 因此,假设我们已经训练了CNN回归来预测人的年龄。在我尝试过的许多年龄预测因素中,孩子的上述图像似乎使预测愚弄了他们以为他长大了,这是由于衣服的原因,并且可能是因为他们主要依靠面部: 我想知道香草CNN架构能很好地推断出头部与躯干的比例吗? 与能够在身体和头部上装上边界框的区域RCNN相比,香草CNN会始终表现得更差吗? 就在原始CNN全局变平之前(即在所有卷积之后),每个输出都有一个对应的接收场,应该具有规模感。我知道,更快的RCNN正是在此阶段通过提出边界框建议来利用这一点,以便所有先前的卷积滤波器自动训练到所有比例。 那么,我认为香草CNN应该能够推断出头部与躯干尺寸的比例?这是正确的吗?如果是这样,使用更快的RCNN框架来利用可能已经在检测人员方面接受过预训练的事实的唯一好处是吗?

2
贝叶斯估计量不受选择偏差的影响
贝叶斯估计量是否不受选择偏差的影响? 大多数讨论高维估计的论文,例如整个基因组序列数据,通常会提出选择偏见的问题。选择偏差是由于以下事实而产生的:尽管我们有成千上万的潜在预测变量,但只有很少的预测变量会被选择,并且对所选的少数变量进行推断。因此,该过程分两个步骤进行:(1)选择预测变量的子集(2)对选择集进行推断,例如估计比值比。戴维德(Dawid)在其1994年的悖论论文中重点研究了无偏估计量和贝叶斯估计量。他将问题简化为选择最大的效果,这可能是治疗效果。 然后他说,无偏估计量受选择偏差的影响。他使用了这个例子:假设 然后每个Z iZi∼N(δi,1),i=1,…,NZi∼N(δi,1),i=1,…,N Z_i\sim N(\delta_i,1),\quad i=1,\ldots,N ZiZiZ_i对于是无偏的。令 ,估计量 但是有偏见(肯定地)表示\ max \ {\ delta_1,\ delta_2,\ ldots,\ delta_N \}。用詹森的不等式可以很容易地证明这一说法。因此,如果我们知道i _ {\ max},即最大\ delta_i的索引,我们将仅使用Z_ {i _ {\ max}}作为其估计量而无偏。但是因为我们不知道这一点,所以我们使用\ gamma_1(\ mathbf {Z})来代替它(有偏)。ž = (Ž 1,Ž 2,... ,Ž Ñ )Ť γ 1(ż)= 最大{ Ž 1,Ž 2,... ,ž Ñ } 最大值{ δ 1,δ 2,... …

2
这会给随机数带来偏差吗?
假设一个数据文件随机生成80+百万个1和0。 从这个文件中,我们想创建一个随机十进制整数的列表。 这是进行此转换的计划。 将8000万个数字分为4个二进制数字的分组。 将每个4位二进制数转换为十进制。 丢弃所有大于9的十进制值。 这将导致从0-9的随机整数字符串 这里是关注点。包含与值10到15对应的4个二进制数字的6个分组的24个二进制数字包含17个1和7个0。这种不平衡会以任何方式影响偶数与奇数整数的分布,还是损害最终的十进制数字字符串的随机性? 更新:从发布的答案来看,上面列举的方法似乎是正确的。我同意这个结论。但是,我仍然不明白为什么从二进制字符串中删除比零多两倍的数字不会使结果偏向于更少的奇数。我寻求解释。

1
解释概率测度之间的Radon-Nikodym导数?
我在某些点上已经看到了相对于另一种概率度量使用Radon-Nikodym导数,最明显的是在Kullback-Leibler散度中,其中它是模型对某些任意参数的概率度量的导数。关于真实参数:θ 0θθ\thetaθ0θ0\theta_0 dPθdPθ0dPθdPθ0\frac {dP_\theta}{dP_{\theta_0}} 这些都是在参数值条件下对数据点空间的概率度量。Pθ(D)=P(D|θ)Pθ(D)=P(D|θ)P_\theta(D)=P(D|\theta) 在Kullback-Leibler散度中或更普遍地在两个概率测度之间,这种Radon-Nikodym导数的解释是什么?

1
是否应使用自由度校正来推断GLM参数?
这个问题是受到马丁(Martijn)在这里的回答的启发。 假设我们为一个像二项式或泊松模型这样的单参数系列拟合了GLM,并且它是一个完全似然过程(相对于拟泊松模型)。然后,方差是平均值的函数。对于二项式:和Poisson。var [ X] = E[ X] E[ 1 - X]变种[X]=Ë[X]Ë[1个-X]\text{var}[X] = E[X]E[1-X]var [ X] = E[ X]变种[X]=Ë[X]\text{var}[X] = E[X] 与线性回归时残差呈正态分布的情况不同,这些系数的有限精确采样分布是未知的,它可能是结果和协变量的复杂组合。此外,使用GLM的均值估算值,可以用作结果方差的插件估算值。 但是,像线性回归一样,系数具有渐近正态分布,因此在有限样本推论中,我们可以用正态曲线近似其采样分布。 我的问题是:通过对有限样本中系数的样本分布使用T分布近似值,我们可以获得任何收益吗?一方面,我们知道方差,但我们不知道确切的分布,所以当引导程序或折刀估计器可以适当地解决这些差异时,T近似似乎是错误的选择。另一方面,在实践中,也许只偏爱保守的T分布。

2
为什么T统计量需要数据遵循正态分布
我当时在看这个笔记本,但对此陈述感到困惑: 当我们谈论正态性时,我们的意思是数据应该看起来像正态分布。这很重要,因为几个统计检验都依赖于此(例如t统计)。 我不明白为什么T统计量需要数据遵循正态分布。 确实,维基百科说了同样的话: 学生的t分布(或简称为t分布)是连续概率分布族的任何成员,该族在估计正态分布总体的均值时出现 但是,我不明白为什么这个假设是必要的。 它的公式没有向我表明数据必须服从正态分布: 我看了一下它的定义,但我不明白为什么需要这种条件。

1
多元线性回归与几个单变量回归模型
在单变量回归设置中,我们尝试建模 y=Xβ+noisey=Xβ+noisey = X\beta +noise 其中的向量Ñ观察和X ∈ [R Ñ × 中号与设计矩阵米预测因子。该解决方案是β 0 = (X Ť X )- 1 X ý。y∈Rny∈Rny \in \mathbb{R}^nnnnX∈Rn×mX∈Rn×mX \in \mathbb{R}^{n \times m}mmmβ0=(XTX)−1Xyβ0=(XTX)−1Xy\beta_0 = (X^TX)^{-1}Xy 在多元回归设置中,我们尝试建模 Y=Xβ+noiseY=Xβ+noiseY = X\beta +noise 其中是矩阵Ñ观察和p不同潜在变量。该解决方案是β 0 = (X Ť X )- 1 X ý。y∈Rn×py∈Rn×py \in \mathbb{R}^{n \times p}nnnpppβ0=(XTX)−1XYβ0=(XTX)−1XY\beta_0 = (X^TX)^{-1}XY 我的问题是,与执行不同的单变量线性回归有何不同?我在这里读到,在后一种情况下,我们考虑了因变量之间的相关性,但我从数学上看不到它。ppp

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.