统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
正常误差的假设是否暗示Y也是正常的?
除非我没有弄错,否则在线性模型中,假定响应的分布具有系统成分和随机成分。错误项捕获随机分量。因此,如果我们假设误差项是正态分布的,这是否意味着响应也是正态分布的?我认为确实可以,但是随后的诸如此类的陈述似乎相当混乱: 您可以清楚地看到,此模型中“正态性”的唯一假设是残差(或“错误”)应呈正态分布。没有关于预测变量或响应变量的分布的假设。X 我ÿ 我ϵiϵi\epsilon_ixixix_iyiyiy_i 来源:预测变量,响应和残差:真正需要正态分布的是什么?


1
证明马氏距离与杠杆之间的关系?
我在维基百科上看到过公式。与马氏距离和杠杆有关: 马氏距离与杠杆统计Hhh密切相关,但具有不同的标度:d2= (N− 1 )(h − 1ñ)。D2=(N−1)(h−1N).D^2 = (N - 1)(h - \tfrac{1}{N}). 在链接的文章中,维基百科用以下术语描述了Hhh: 在该线性回归模型,用于杠杆得分一世Ť ^ hithi^{th}数据单位被定义为:H我我= (高)我我,hii=(H)ii,h_{ii}=(H)_{ii},在一世Ť ^ hithi^{th}帽子矩阵的对角元素H= X(X⊤X)− 1X⊤H=X(X⊤X)−1X⊤H=X(X^{\top}X)^{-1}X^{\top},其中⊤表示矩阵转置。⊤⊤^{\top} 我在任何地方都找不到证明。我试图从定义开始,但是没有任何进展。任何人都可以给出提示吗?

2
泊松回归的Log Link和Identity Link的优缺点
我执行泊松回归与比较(和采取的差)在我的模型中的两个因子水平的预测均值计数的最终目标 ,而持有其他模型协变量(这些都是二进制) 不变。我想知道是否有人可以提供有关何时使用日志链接和身份链接的实用建议。考虑到我比较差异的目标,这两个不同链接函数在Poisson回归中的利弊是什么?μ^1个- μ^2μ^1−μ^2\hat{\mu}_1-\hat{\mu}_2 对于Logistic /二项式回归(使用Logit链接或Identity链接)以比较两个因子水平之间的比例差异,我也有相同的目标,需要类似的建议。我读过一些有关此问题的文章,但似乎没有人解释为什么或何时选择一个链接而不是另一个链接,以及优点/缺点。在此先感谢您的帮助! 更新: 我还意识到使用某些链接函数的主要目的是将可能的预测值的范围限制在平均响应范围内(例如,对于逻辑,该范围限制在0到1之间,对于对数链接,则将预测限制为正数)。因此,我想问的是,如果我使用身份链接进行逻辑/二项式回归,而我的结果在(0,1)范围内,是否真的需要使用逻辑链接功能或我可以简单地考虑使用身份链接吗?

2
当每个点在和都有其不确定性时的回归
我对两个变量和进行了测量。它们都具有相关的不确定性和。我想找到和之间的关系。我该怎么做?X ÿ σ X σ ÿ X ÿnnnxxxyyyσxσx\sigma_xσyσy\sigma_yxxxyyy 编辑:每个都有与之关联的不同,并且与相同。σ X ,我 ÿ 我xixix_iσx,iσx,i\sigma_{x,i}yiyiy_i 可复制的R示例: ## pick some real x and y values true_x <- 1:100 true_y <- 2*true_x+1 ## pick the uncertainty on them sigma_x <- runif(length(true_x), 1, 10) # 10 sigma_y <- runif(length(true_y), 1, 15) # 15 ## perturb …

2
Logistic回归何时合适?
我目前正在自学如何进行分类,特别是正在研究三种方法:支持向量机,神经网络和逻辑回归。我想了解的是为什么逻辑回归会比其他两个更好。 根据我对逻辑回归的理解,这个想法是使逻辑函数适合整个数据。因此,如果我的数据是二进制的,则我所有带有标签0的数据都应映射到值0(或接近它),而我所有带有值1的数据都应映射到值1(或接近它)。现在,由于逻辑函数是连续且平滑的,因此执行此回归需要我所有的数据拟合曲线。决策边界附近的数据点没有受到更大的重视,所有数据点对损失的贡献程度不同。 但是,对于支持向量机和神经网络,只有决策边界附近的那些数据点才重要。只要数据点保留在决策边界的同一侧,它将造成相同的损失。 因此,为什么逻辑回归会比支持向量机或神经网络更胜一筹,原因是逻辑回归会“浪费资源”来使曲线拟合许多不重要的(易于分类的)数据,而不是只关注决策周围的困难数据边界?

1
标准正态随机变量的平方的Pdf [关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 4年前关闭。 我有这个问题,我必须找到的pdf Y=X2Y=X2Y = X^2。所有我知道的是,XXX具有分布N(0,1)N(0,1)N(0,1)。是什么分布Y=X2Y=X2Y = X^2?与相同XXX吗?我如何找到pdf文件?

1
当比例是自变量时,转换比例的最合适方法是什么?
我以为我理解了这个问题,但是现在我不太确定,我想在继续之前先与其他人核实。 我有两个变量,X和Y。Y是一个比率,并且不受0和1的限制,并且通常呈正态分布。X是一个比例,以0和1为界(从0.0到0.6)。当我运行的线性回归时Y ~ X,我发现,它们X与Y线性关系显着。到现在为止还挺好。 但是后来我进一步调查,开始认为也许X和Y的关系可能比线性关系更曲线。对我来说,它看起来像的关系X,并Y可能接近Y ~ log(X),Y ~ sqrt(X)或者Y ~ X + X^2,或者类似的东西。我有经验上的理由认为该关系可能是曲线关系,但没有理由假设任何一种非线性关系都可能比其他任何一种更好。 我从这里有几个相关的问题。首先,我的X变量采用四个值:0、0.2、0.4和0.6。当我对这些数据进行对数或平方根转换时,这些值之间的间距会失真,因此0值与所有其他值的距离要远得多。由于缺乏更好的询问方式,这就是我想要的吗?我认为不是,因为根据接受的失真程度,我得到的结果非常不同。如果这不是我想要的,应该如何避免? 其次,要对这些数据进行对数转换,我必须在每个X值上加上一些数量,因为您不能采用0的对数。当我增加非常小的数量(例如0.001)时,我会得到非常大的失真。当我添加较大的数量(例如1)时,失真很小。是否有“正确的”数量要添加到X变量中?还是在变量中添加任何内容以X替代选择替代转换(例如,立方根)或模型(例如,逻辑回归)是否不合适? 在这个问题上我几乎找不到的东西让我觉得我应该谨慎行事。对于其他R用户,此代码将创建一些结构类似于我的数据。 X = rep(c(0, 0.2,0.4,0.6), each = 20) Y1 = runif(20, 6, 10) Y2 = runif(20, 6, 9.5) Y3 = runif(20, 6, 9) Y4 = runif(20, 6, 8.5) Y = c(Y4, Y3, Y2, Y1) plot(Y~X)

2
Iid Gumbel变量最大值的期望
我一直在经济学期刊上阅读随机效用模型中使用的特定结果。结果的一种版本是:如果 Gumbel(,则:ϵi∼iid,ϵi∼iid,\epsilon_i \sim_{iid}, μ,1),∀iμ,1),∀i\mu, 1), \forall i E[maxi(δi+ϵi)]=μ+γ+ln(∑iexp{δi}),E[maxi(δi+ϵi)]=μ+γ+ln⁡(∑iexp⁡{δi}),E[\max_i(\delta_i + \epsilon_i)] = \mu + \gamma + \ln\left(\sum_i \exp\left\{\delta_i \right\} \right), 其中γ≈0.52277γ≈0.52277\gamma \approx 0.52277是Euler-Mascheroni常数。我检查了使用R是否有意义,并且确实如此。Gumbel (μ,1)(μ,1)(\mu, 1)分布的CDF为: G(ϵi)=exp(−exp(−(ϵi−μ)))G(ϵi)=exp⁡(−exp⁡(−(ϵi−μ)))G(\epsilon_i) = \exp(-\exp(-(\epsilon_i - \mu))) 我正在尝试证明这一点,但没有成功。我已经尝试过证明自己,但是我无法走过某个特定的步骤。 谁能指出我对此的证明?如果没有,也许我可以将尝试的证据发布到卡住的地方。

2
不同的AIC定义
在Wikipedia中,Akaike的信息标准(AIC)的定义为,其中是参数的数量,是模型的对数似然性。AIC=2k−2logLAIC=2k−2log⁡L AIC = 2k -2 \log L kkklogLlog⁡L\log L 但是,我们的计量经济学家在一家备受尊敬的大学中指出,。这里是ARMA模型中误差的估计方差,是时间序列数据集中观测值的数量。AIC=log(σ^2)+2⋅kTAIC=log⁡(σ^2)+2⋅kT AIC = \log (\hat{\sigma}^2) + \frac{2 \cdot k}{T} σ^2σ^2 \hat{\sigma}^2 TT T 后一个定义是否等同于第一个定义,但仅针对ARMA模型进行了调整?还是两个定义之间存在某种冲突?

2
贝叶斯优化的GP回归中的病态条件协方差矩阵
背景与问题 我正在使用高斯过程(GP)进行回归和随后的贝叶斯优化(BO)。为了进行回归,我使用了针对MATLAB 的gpml包,并进行了一些自定义修改,但是问题很普遍。 众所周知的事实是,当两个训练输入在输入空间中太近时,协方差矩阵可能变为非正定的(此站点上有几个问题)。结果,由于数值误差,各种GP计算所需的协方差矩阵的Cholesky分解可能会失败。在使用我使用的目标函数执行BO时,在某些情况下这发生在我身上,我想对其进行修复。 拟议的解决方案 AFAIK,减轻不适的标准解决方案是在协方差矩阵的对角线上添加一个脊或块。对于GP回归,这等于增加(或增加,如果已经存在)观察噪声。 到现在为止还挺好。我修改了gpml的精确推论代码,以便每当Cholesky分解失败时,我都会尝试将协方差矩阵固定为Frobenius范数中最接近的对称正定(SPD)矩阵,这是受约翰d'Errico的MATLAB代码启发的。这样做的理由是要尽量减少对原始矩阵的干预。 这个变通办法可以完成工作,但是我注意到对于某些功能,BO的性能大大降低了-可能是每当算法需要放大某些区域时(例如,因为算法越来越接近最小值,或者因为长度缩放)问题变得越来越小)。这种行为是有道理的,因为每当两个输入点距离太近时,我都会有效地增加噪声,但这当然不是理想的选择。或者,我可以删除有问题的点,但是,有时候,我需要输入点很接近。 题 我认为GP协方差矩阵的Cholesky因式分解的数值问题不是一个新问题,但令我惊讶的是,除了增加噪声或消除彼此之间太近的点外,到目前为止,我找不到许多解决方案。另一方面,我的某些功能确实表现得很差,所以也许我的情况不是那么典型。 有什么建议/参考可以在这里有用吗?

2
评级分数与估计因子分数之和?
我很想收到有关在构建量表时何时使用“ 因子得分 ”而不是简单得分总和的建议。即“精炼”而不是“未精炼”的因素评分方法。来自DiStefano等。(2009; pdf),重点增加了: 因子得分计算方法主要有两类:精炼和非精炼。未精炼的方法是相对简单的累积过程,可提供有关个人在因素分布上的位置的信息。简单性使其具有一些吸引人的功能,即,未经改进的方法既易于计算,又易于解释。完善的计算方法使用更复杂的技术方法来创建因子得分。 与未改进的方法相比,它们更精确,更复杂,并提供标准化分数的估计值。 在我看来,如果目标是创建一个可以在研究和设置中使用的量表,那么所有量表项的简单总和或平均得分就很有意义。但是,可以说,目标是评估程序的治疗效果,而重要的对比在于样品(治疗组与对照组)之间。有什么理由使我们更喜欢因子得分来衡量总和或平均值? 要具体说明替代方案,请考虑以下简单示例: library(lavaan) library(devtools) # read in data from gist ====================================================== # gist is at https://gist.github.com/ericpgreen/7091485 # this creates data frame mydata gist <- "https://gist.github.com/ericpgreen/7091485/raw/f4daec526bd69557874035b3c175b39cf6395408/simord.R" source_url(gist, sha1="da165a61f147592e6a25cf2f0dcaa85027605290") head(mydata) # v1 v2 v3 v4 v5 v6 v7 v8 v9 # 1 3 4 3 4 …

3
为什么区分“线性”回归和“非线性”回归很重要?
区分线性模型和非线性模型的重要性是什么?问题非线性与广义线性模型:您如何指代逻辑回归,泊松等回归?它的答案是对广义线性模型的线性/非线性的非常有帮助的说明。区分线性模型和非线性模型似乎至关重要,但是我不清楚为什么?例如,考虑以下回归模型: Ë[ Y∣ X]Ë[ Y∣ X]Ë[ Y∣ X]Ë[ Y∣ X]= β0+ β1个X= β0+ β1个X+ β2X2= β0+ β21个X= { 1 + exp(− [ β0+ β1个X] }− 1(1)(2)(3)(4)(1)E[Y∣X]=β0+β1X(2)E[Y∣X]=β0+β1X+β2X2(3)E[Y∣X]=β0+β12X(4)E[Y∣X]={1+exp⁡(−[β0+β1X]}−1\begin{align} E[Y \mid X] & = \beta_0 + \beta_1 X \tag{1} \\ E[Y \mid X] & = \beta_0 + \beta_1 X + \beta_2 X^2 \tag{2} …

2
当两个序列都收敛到一个非退化随机变量时,Slutsky定理仍然有效吗?
我对Slutsky定理的一些细节感到困惑: 令{Xn}{Xn}\{X_n\},{Yn}{Yn}\{Y_n\}是两个标量/向量/矩阵随机元素序列。 如果XnXnX_n的分布收敛到一个随机元素XXX而YnYnY_n 的概率收敛到一个常数ccc,则Xn+Yn XnYn Xn/Yn →d X+c→d cX→d X/c,Xn+Yn →d X+cXnYn →d cXXn/Yn →d X/c,\eqalign{ X_{n}+Y_{n}\ &{\xrightarrow {d}}\ X+c\\ X_{n}Y_{n}\ &{\xrightarrow {d}}\ cX\\ X_{n}/Y_{n}\ &{\xrightarrow {d}}\ X/c, } 前提是ccc是可逆的,其中→d→d{\xrightarrow {d}}表示分布收敛。 如果Slutsky定理中的两个序列都收敛到一个非退化的随机变量,那么该定理仍然有效,如果无效(有人可以提供一个例子吗?),使它有效的额外条件是什么?

1
特殊概率分布
如果是在上具有非零值的概率分布,则对于哪种类型,存在常数,使得 对于所有吗?p(x)p(x)p(x)[0,+∞)[0,+∞)[0,+\infty)p(x)p(x)p(x)c>0c>0c\gt 0∫∞0p(x)logp(x)(1+ϵ)p(x(1+ϵ))dx≤cϵ2∫0∞p(x)log⁡p(x)(1+ϵ)p(x(1+ϵ))dx≤cϵ2\int_0^{\infty}p(x)\log{\frac{ p(x)}{(1+\epsilon)p({x}(1+\epsilon))}}dx \leq c \epsilon^20<ϵ<10<ϵ<10\lt\epsilon\lt 1 上面的不等式实际上是分布及其压缩版本之间的Kullback-Leibler散度。我发现这种不等式适用于指数分布,伽玛分布和威布尔分布,并且我想知道这是否适用于更大的概率分布类别。(1 + ϵ ) p (x (1 + ϵ ))p(x)p(x)p(x)(1+ϵ)p(x(1+ϵ))(1+ϵ)p(x(1+ϵ)){(1+\epsilon)}p({x}{(1+\epsilon)}) 知道不平等意味着什么吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.