统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
联合完成充分统计量:统一(a,b)
令X=(x1,x2,…xn)X=(x1,x2,…xn)\mathbf{X}= (x_1, x_2, \dots x_n)是上均匀分布的随机样本(a,b)(a,b)(a,b),其中a&lt;ba&lt;ba < b。令Y1Y1Y_1和YnYnY_n为最大和最小阶统计量。证明统计量(Y1,Yn)(Y1,Yn)(Y_1, Y_n)是参数θ = (a ,b )的共同完全充分统计量θ=(a,b)θ=(a,b)\theta = (a, b)。 对我来说,使用因式分解显示足够是没有问题的。 问题:如何显示完整性?最好是我想要一个提示。 尝试:我可以证明E[g(T(x))]=0E[g(T(x))]=0\mathbb E[g(T(x))] = 0表示g(T(x))=0g(T(x))=0g(T(x)) = 0对于一个参数均匀分布,但是我陷入了两个参数均匀分布的困境。 我尝试使用E[g(Y1,Yn)]E[g(Y1,Yn)]\mathbb E[g(Y_1, Y_n)]并使用Y1Y1Y_1和的联合分布YnYnY_n,但是由于微积分使我绊倒,所以我不确定我的方向是否正确。

2
没有UMP时如何定义拒绝区域?
考虑线性回归模型 y=Xβ+uy=Xβ+u\mathbf{y}=\mathbf{X\beta}+\mathbf{u}, u∼N(0,σ2I)u∼N(0,σ2I)\mathbf{u}\sim N(\mathbf{0},\sigma^2\mathbf{I}), E(u∣X)=0E(u∣X)=0E(\mathbf{u}\mid\mathbf{X})=\mathbf{0}。 设与。ħ 1:σ 2 0 ≠ σ 2H0:σ20=σ2H0:σ02=σ2H_0: \sigma_0^2=\sigma^2H1:σ20≠σ2H1:σ02≠σ2H_1: \sigma_0^2\neq\sigma^2 我们可以推导出,其中。并且是灭者矩阵的典型表示法,其中是因变量在上回归了。ð我中号(X)=Ñ×ķ中号X中号XŶ= ÿ ÿ ÿXyTMXyσ2∼χ2(n−k)yTMXyσ2∼χ2(n−k)\frac{\mathbf{y}^T\mathbf{M_X}\mathbf{y}}{\sigma^2}\sim \chi^2(n-k)dim(X)=n×kdim(X)=n×kdim(\mathbf{X})=n\times kMXMX\mathbf{M_X}MXy=y^MXy=y^\mathbf{M_X}\mathbf{y}=\hat{\mathbf{y}}y^y^ \hat{\mathbf{y}}yy\mathbf{y}XX\mathbf{X} 我正在阅读的书指出: 之前,我曾问过应该使用什么标准来定义拒绝区域(RR),请参阅此问题的答案,主要的是选择使测试尽可能强大的RR。 在这种情况下,备选方案是双边复合假设,通常不需要UMP检验。而且,根据书中给出的答案,作者没有显示他们是否研究了RR的功能。尽管如此,他们还是选择了两尾RR。为什么会这样,因为该假设没有“单方面”确定RR? 编辑:此图像作为练习4.14的解决方案,在本书的解决方案手册中。

3
简单线性回归,p值和AIC
我知道这个话题在这里之前已经提出过很多次了,但是我仍然不确定如何最好地解释我的回归输出。 我有一个非常简单的数据集,由一列x值和一列y值组成,并根据位置(位置)分为两组。要点看起来像这样 一位同事假设,我们应该将单独的简单线性回归拟合到每个组,我已经使用进行了拟合y ~ x * C(loc)。输出如下所示。 OLS Regression Results ============================================================================== Dep. Variable: y R-squared: 0.873 Model: OLS Adj. R-squared: 0.866 Method: Least Squares F-statistic: 139.2 Date: Mon, 13 Jun 2016 Prob (F-statistic): 3.05e-27 Time: 14:18:50 Log-Likelihood: -27.981 No. Observations: 65 AIC: 63.96 Df Residuals: 61 BIC: 72.66 Df Model: …


2
解释回归模型的方差
这可能是一个简单的解释(无论如何我都希望如此)。 我已经使用回归工具箱在Matlab中进行了一些回归分析。但是,我遇到了一项研究指出: “使用回归分析,可以仅使用四个解释60%差异的声音特征来建立预测模型” 如果需要,可以在此处找到文章的链接: 文章 我不确定这意味着什么,但我希望它简单一些。60%也是一件好事吗?我试图进行搜索,但是由于“方差”一词之前总是有一个百分比,因此很难找到答案。
13 variance 

2
关节正态性是正常随机变量总和是否正常的必要条件吗?
在我对相关问题的回答之后的评论中,用户ssdecontrol和Glen_b询问和联合正态性对于断言的正态性是否必要?当然,关节正常就足够了。在那里没有解决这个补充问题,也许值得单独考虑。Y X + YXXXYYYX+YX+YX+Y 由于联合常态意味着边际常态,我问 难道存在正常的随机变量和,使得 是一个正常的随机变量,但和是不是 共同正常的随机变量?Y X + Y X YXXXYYYX+YX+YX+YXXXYYY 如果不要求和具有正态分布,则很容易找到这样的正态随机变量。可以在我以前的答案中找到一个示例(上面提供了链接)。我认为,上面突出显示的问题的答案是“是”,并已发布(我认为是)示例作为对此问题的答案。ÿXXXYYY

1
什么是F1最佳阈值?如何计算呢?
我在R中使用了h2o.glm()函数,该函数在结果以及其他统计信息中提供了列联表。列联表的标题为“ 基于F1最佳阈值的交叉表 ” Wikipedia将F1分数或F分数定义为精确度和查全率的调和平均值。但是,仅当将逻辑回归的预测值(例如)使用截止值转换为二进制时,才能找到Precision和Recall。 现在我想起了截止点,F1得分和最佳阈值之间有什么联系。最佳阈值如何计算?F1最佳阈值如何计算? 抱歉,如果我错过了什么,我是这里的新手。
13 threshold 

2
95%置信区间的公式
我在stats.stackexchange上进行了搜索和搜索,但是找不到用于为线性回归计算值的95%置信区间的公式。有人可以提供吗?R2R2R^2 更好的是,假设我在下面的R中运行了线性回归。如何使用R代码为R2R2R^2值计算95%的置信区间。 lm_mtcars &lt;- lm(mpg ~ wt, mtcars)

3
人工神经网络背后的理论结果
我刚刚在Coursera的机器学习课程中介绍了人工神经网络,我想了解它们背​​后的更多理论。我发现他们模仿生物学的动机有些不尽人意。 从表面上看,似乎在每个级别上我们都用线性组合替换了协变量。通过反复执行,我们可以进行非线性模型拟合。这就引出了一个问题:为什么有时有时只用神经网络来拟合非线性模型就更好了。 更笼统地说,我想知道人工神经网络如何适合贝叶斯推理框架,这在ET Jaynes的书“概率论:科学逻辑”中有详细描述。或者,简单地说,为什么人工神经网络工作时会起作用?并且,当然,他们做出成功的预测意味着他们遵循了上述框架。

1
GINI和AUC曲线解释之间有什么区别?
我们过去常常使用在计分卡建模的好坏百分比的帮助下创建的提升来创建GINI曲线。但是我研究过的ROC曲线是使用以特异性(1- True Negative)为x轴和灵敏度(true positive)为Y轴的Confusion矩阵创建的。 因此,GINI和ROC的结果相同,唯一的不同是后者也考虑了一致性和不一致值(TP,FP,FN,TN)。
13 roc  gini 

4
解释glmer中的随机效应方差
我正在修订有关授粉的论文,其中数据按二项分布(水果成熟或没有成熟)。因此,我使用glmer了一种随机效果(单个植物)和一种固定效果(治疗)。审稿人想知道植物是否对坐果有影响-但我在解释glmer结果时遇到困难。 我已经在网络上阅读过,似乎直接比较glm和glmer模型可能存在问题,所以我没有这样做。我认为回答这个问题的最直接方法是将随机效应方差(下面的1.449)与总方差进行比较,或者将处理结果解释为方差。但是,如何计算这些其他方差?它们似乎未包含在下面的输出中。我读到一些关于二项式不包括残差的信息glmer-我如何解释随机效应的相对重要性? &gt; summary(exclusionM_stem) Generalized linear mixed model fit by maximum likelihood (Laplace Approximation) [glmerMod] Family: binomial ( logit ) Formula: cbind(Fruit_1, Fruit_0) ~ Treatment + (1 | PlantID) AIC BIC logLik deviance df.resid 125.9 131.5 -59.0 117.9 26 Scaled residuals: Min 1Q Median 3Q Max -2.0793 -0.8021 -0.0603 0.6544 …


4
这些基于相关性的距离是否满足三角不等式?
对于分层聚类,我经常看到以下两个“量度”(它们并不是完全正确),用于测量两个随机变量和之间的距离: \ newcommand {\ Cor} {\ mathrm {Cor}} \ begin {align} d_1(X,Y)&= 1- | \ Cor(X,Y)|,\\ d_2(X,Y)&= 1-(\ Cor(X,Y))^ 2 \ end {align} 中的一个一个满足三角不等式?如果是这样,除了进行暴力计算之外,我还应该证明它吗?如果它们不是指标,那么简单的反例是什么?XXXYYY\newcommand{\Cor}{\mathrm{Cor}} d1(X,Y)d2(X,Y)=1−|Cor(X,Y)|,=1−(Cor(X,Y))2d1(X,Y)=1−|Cor(X,Y)|,d2(X,Y)=1−(Cor(X,Y))2\begin{align} d_1(X,Y) &= 1-|\Cor(X,Y)|, \\ d_2(X,Y) &= 1-(\Cor(X,Y))^2 \end{align}


1
吉布斯输出的边际可能性
我正在从头开始复制第4.2.1节的结果 吉布斯输出的边际可能性 悉达多(Siddhartha Chib) 美国统计协会杂志,第一卷。90,第432号。(1995年12月),第1313-1321页。 它是具有已知组件数的法线模型的混合。 k≥1k≥1k\geq 1f(x∣w,μ,σ2)=∏i=1n∑j=1kN(xi∣μj,σ2j).(∗)f(x∣w,μ,σ2)=∏i=1n∑j=1kN(xi∣μj,σj2).(∗) f(x\mid w,\mu,\sigma^2) =\prod_{i=1}^n\sum_{j=1}^k \mathrm{N}(x_i\mid\mu_j,\sigma_j^2) \, . \qquad (*) 该模型的Gibbs采样器是使用Tanner和Wong的数据增强技术实现的。引入了一组分配变量并假设值为,我们指定和f(x_i \ mid z ,\ mu,\ sigma ^ 2)= \ mathrm {N}(x_i \ mid \ mu_ {z_i},\ sigma ^ 2_ {z_i})。因此,在z_i上的积分给出了原始可能性(*)。z=(z1,…,zn)z=(z1,…,zn)z=(z_1,\dots,z_n)1,…,k1,…,k1,\dots,kPr(zi=j∣w)=wjPr(zi=j∣w)=wj\Pr(z_i=j\mid w)=w_jf(xi∣z,μ,σ2)=N(xi∣μzi,σ2zi)f(xi∣z,μ,σ2)=N(xi∣μzi,σzi2)f(x_i\mid z,\mu,\sigma^2)=\mathrm{N}(x_i\mid\mu_{z_i},\sigma^2_{z_i})ziziz_i(∗)(∗)(*) 该数据集是由来自日冕的828282星系的速度形成的。 set.seed(1701) x &lt;- c( 9.172, 9.350, 9.483, 9.558, 9.775, 10.227, …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.