统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
典型设定概念
我认为典型集合的概念非常直观:如果序列出现的可能性很高,则长度为的序列将属于典型集合A (n ) ϵ。因此,任何可能的序列都将在A (n ) ϵ中。(我避免了与熵有关的形式定义,因为我试图从质上理解它。)nnnA(n)ϵAϵ(n)A_\epsilon ^{(n)}A(n)ϵAϵ(n)A_\epsilon ^{(n)} 但是,我读到,一般而言,最可能的序列不属于典型集合。这让我很困惑。 有典型集合的直观定义吗?还是仅仅是一个与常识无关的数学工具?

4
期望值与最可能值(模式)
分布的期望值是平均值,即加权平均值 f(x)f(x)f(x)E[x]=∫+∞−∞xf(x)dxE[x]=∫−∞+∞xf(x)dxE[x]=\int_{-\infty}^{+\infty} x \, \, f(x) dx 最可能的值是众数,即最可能的值。 但是,我们期望以某种方式看到很多次吗?从这里报价:E[x]E[x]E[x] 如果结果的概率不相等,则必须用加权平均值代替简单的平均值,这要考虑到某些结果比其他结果更有可能的事实。然而,直觉保持不变:x的期望值是人们期望平均发生的值。xixix_ixxx 我不明白“平均发生”是什么意思,这是否意味着,从长远来看,我希望花很多时间才能看到E[x]E[x]E[x]比x的其他值更多xxx?但这不是模式的定义吗? 那么如何解释该陈述?E [x]的概率含义是E[x]E[x]E[x]什么? 我还想举个例子,让我感到困惑。通过研究分布,我了解到模式 为,而,其中是数据的自由度。χ2χ2\chi^2χ2mode=ν−2χmode2=ν−2\chi^2_{mode}=\nu-2E[χ2]=νE[χ2]=νE[\chi^2]=\nuνν\nu 我在大学听说,在使用最小二乘法拟合一组数据后进行测试时,我应该期望得到因为“这通常会发生”。χ 2听,说:νχ2χ2\chi^2χ2≈νχ2≈ν\chi^2 \approx \nu 我是否误解了所有这些,或者期望值是否很有可能?(即使最可能的值当然是模式)


2
逻辑回归的矩阵符号
在线性回归(平方损失)中,使用矩阵,我们对目标有一个非常简洁的表示法 minimize ∥Ax−b∥2minimize ‖Ax−b‖2\text{minimize}~~ \|Ax-b\|^2 其中AAA是数据矩阵,xxx是系数,bbb是响应。 Logistic回归目标是否有类似的矩阵符号?我见过的所有符号都不能消除所有数据点的总和(像∑dataLlogistic(y,βTx)∑dataLlogistic(y,βTx)\sum_{\text data} \text{L}_\text{logistic}(y,\beta^Tx))。 编辑:感谢joceratops和AdamO的出色回答。他们的回答使我意识到线性回归具有更简洁的表示法的另一个原因是因为规范的定义封装了平方和或。但是在逻辑损失中,没有这样的定义,这使表示法有点复杂。e⊤ee⊤ee^\top e

2
R中的逐步回归-如何运作?
我正在尝试使用阶跃函数来理解R中逐步回归和向后回归之间的基本区别。对于逐步回归,我使用了以下命令 step(lm(mpg~wt+drat+disp+qsec,data=mtcars),direction="both") 对于以上代码,我得到了以下输出。 对于后向变量选择,我使用了以下命令 step(lm(mpg~wt+drat+disp+qsec,data=mtcars),direction="backward") 我得到以下输出以供后退 据我所知,当未指定任何参数时,除非在R中指定了参数“ upper”和“ lower”,否则逐步选择将作为向后选择。但是,在逐步选择的输出中,会在+中添加+ disp第二步。通过在逐步选择中再次添加+ disp来实现的功能是什么?为什么R在第二步中加上+ disp,而结果却与向后选择相同(AIC值和模型选择值)。R在逐步选择中如何工作? 我真的很想了解此功能在R中的工作方式。在此先感谢您的帮助!
15 r  regression 

3
我们真的需要包括“所有相关的预测变量”吗?
使用回归模型进行推理的基本假设是,“所有相关的预测变量”已包含在预测方程式中。理由是未能包含重要的现实因素会导致系数出现偏差,从而导致推论不准确(即省略了可变偏差)。 但是,在研究实践中,我从未见过任何类似 “所有相关预测变量”的事物。许多现象有许多重要原因,要把它们全部包括在内,将是非常困难的,即使不是不可能的话。一个现成的例子就是将抑郁症建模为结果:没有人建立类似于“所有相关变量”的模型的任何东西:例如,父母的历史,人格特质,社会支持,收入,他们的互动等,等等... 此外,除非有非常大的样本量,否则拟合这样一个复杂的模型将导致高度不稳定的估计。 我的问题很简单:“包含所有相关预测变量”的假设/建议是否只是我们“说”但实际上没有表达的意思?如果不是,那么我们为什么要提供它作为实际的建模建议? 这是否意味着大多数系数可能会产生误导?(例如,仅使用几种预测因子的人格因素和抑郁症研究)。换句话说,对于我们的科学结论而言,这有多大的问题?

5
高斯混合模型中的奇点问题
在模式识别和机器学习这本书的第9章中,有关于高斯混合模型的这一部分: 老实说,我并不真正理解为什么会产生奇异之处。谁能向我解释一下?抱歉,我只是一个本科生,并且是机器学习的新手,所以我的问题听起来有点愚蠢,但请帮助我。非常感谢你


3
逻辑回归:Scikit Learn与glmnet
我正在尝试sklearn使用glmnetR中的包复制逻辑回归库的结果。 sklearn分w ^ ,Ç1个2wŤw + C∑我= 1ñ日志(exp(- ÿ一世(XŤ一世w + c ))+ 1 )分w,C1个2wŤw+C∑一世=1个ñ日志⁡(经验值⁡(-ÿ一世(X一世Ťw+C))+1个)\min_{w,c} \frac12 w^Tw + C\sum_{i=1}^N \log(\exp(-y_i(X_i^Tw+c)) + 1) 从的渐近点来看glmnet,它的实现将成本函数 分β,β0− [ 1ñ∑我= 1ñÿ一世(β0+ xŤ一世β)- 日志(1 + e(β0+ xŤ一世β))] + λ [ (α - 1 )| | β| |22/ 2+α | | β| |1个]分β,β0-[1个ñ∑一世=1个ñÿ一世(β0+X一世Ťβ)-日志⁡(1个+Ë(β0+X一世Ťβ))]+λ[(α-1个)||β||22/2+α||β||1个]\min_{\beta, \beta_0} -\left[\frac1N \sum_{i=1}^N y_i(\beta_0+x_i^T\beta)-\log(1+e^{(\beta_0+x_i^T\beta)})\right] + …

3
对于线性分类器,更大的系数是否意味着更重要的特征?
我是从事机器学习的软件工程师。根据我的理解,线性回归(例如OLS)和 线性分类(例如对数回归和SVM)基于已训练系数 和特征变量→ x之间的内积进行预测:w⃗ w→\vec{w}x⃗ x→\vec{x} y^=f(w⃗ ⋅x⃗ )=f(∑iwixi)y^=f(w→⋅x→)=f(∑iwixi) \hat{y} = f(\vec{w} \cdot \vec{x}) = f(\sum_{i} w_i x_i) 我的问题是:训练模型后(即在计算系数之后),对于对于模型更准确地预测更重要的特征变量,系数是否会变大?wiwiw_i 换句话说,我想问的是,仅通过按系数值对变量排序,然后选择系数最高的特征,是否可以将系数的相对大小用于特征选择?如果此方法有效,那么为什么不选择功能(以及包装器和过滤器方法等)。 我之所以这样问,是因为我遇到了关于L1与L2正则化的讨论。有一个说明说: 经常提到内置特征选择是L1规范的有用属性,而L2规范则没有。这实际上是L1范数的结果,它倾向于产生稀疏系数(如下所述)。假设该模型有100个系数,但其中只有10个具有非零系数,这实际上是在说“其他90个预测变量对预测目标值无用”。 在两行之间阅读时,我猜想如果系数接近0,则具有该系数的特征变量的预测力必须很小。 编辑:我也将z缩放应用于我的数字变量。

1
(最小)批量梯度中梯度的总和或平均值是否合适?
当我实现了迷你批次梯度样例时,我只是对训练批次中所有示例的梯度进行平均。但是,我注意到,现在的最佳学习率远远高于在线梯度样例。我的直觉是,这是因为平均梯度噪声较小,因此可以更快地遵循。因此,也许仅仅总结一批的梯度也是有意义的。无论如何,这些值可以为正也可以为负。 我知道这只是一个恒定因素,可以使用学习率来平衡。但是我不知道科学家们同意哪个定义,以便我可以从神经网络论文中复制结果。 通常是否将批次的总梯度除以批次大小?

2
留一法交叉验证的高方差
我一遍又一遍地读到,由于训练折叠的大量重叠,“留一法”交叉验证具有很大的差异。但是,我不明白为什么这样:正是因为训练集几乎相同,交叉验证的性能不应该非常稳定(方差低)吗?还是我对“方差”的概念有完全错误的理解? 我也不太了解LOO如何保持公正,但差异很大?如果LOO估计值等于期望的真实估计值-那么它怎么会有高方差? 注意:我知道这里有一个类似的问题: 为什么关于误差的平均估计的留一法交叉验证(LOOCV)方差很高?但是,回答该问题的人稍后在评论中说,尽管提出了反对,但他已经意识到他的回答是错误的。

2
了解距离相关计算
据我了解,距离相关是一种健壮且通用的方法,用于检查两个数字变量之间是否存在关系。例如,如果我们有一组数字对: (x1, y1) (x2, y2) ... (xn, yn) 我们可以使用距离相关来检查两个变量(x和y)之间是否存在任何(不一定是线性的)关系。而且,x并且y可以是不同维度的向量。 计算距离相关性相对容易。首先,我们使用计算距离矩阵。然后我们使用计算距离矩阵。这两个距离矩阵的维数相同,因为x_i和y_i的数目相同(因为它们成对出现)。ÿ 我X 我ÿ 我xixix_iyiyiy_ixixix_iyiyiy_i 现在我们有很多距离可以配对。例如,(2,3)来自第一距离矩阵的元素(2,3)与来自第二距离矩阵的元素配对。因此,我们有一组成对的距离,我们可以用它来计算相关性(距离之间的相关性)。 如果两种类型的距离相关,则意味着接近Xs通常意味着接近Ys。例如,如果接近,则意味着y_7可能接近y_ {13}。因此,我们可以得出结论,Xs和Ys是相关的。x 13 y 7 y 13x7x7x_7x13x13x_{13}y7y7y_7y13y13y_{13} 听起来很合理,但是我不了解两个方面。 首先,要计算距离相关性,我们不直接使用两个距离矩阵。我们对其应用双重居中过程(以便任何行(或列)中所有元素的总和等于零)。我不明白为什么我们需要这样做。此步骤背后的逻辑(或直觉)是什么? 其次,在原始距离矩阵中,对角线上有零。因此,如果我们计算距离之间的相关性,则将具有统计上显着的相关性,因为第一矩阵中的许多零与第二矩阵中的对应零成对。该问题如何解决?

3
零成簇的非负数据模型(Tweedie GLM,零膨胀GLM等)是否可以预测精确的零?
当参数ppp(均值-方差关系的指数)在1到2之间。 类似地,零膨胀(无论是连续的还是离散的)模型可以具有大量的零。 我无法理解为什么当我使用这些模型进行预测或计算拟合值时,所有预测值都不为零。 这些模型可以实际预测确切的零吗? 例如 library(tweedie) library(statmod) # generate data y <- rtweedie( 100, xi=1.3, mu=1, phi=1) # xi=p x <- y+rnorm( length(y), 0, 0.2) # estimate p out <- tweedie.profile( y~1, p.vec=seq(1.1, 1.9, length=9)) # fit glm fit <- glm( y ~ x, family=tweedie(var.power=out$p.max, link.power=0)) # predict pred <- …

2
马尔可夫链与马尔可夫链蒙特卡洛之间有什么联系
我正在尝试使用SAS了解马尔可夫链。我了解到,马尔可夫过程是未来状态仅取决于当前状态而不取决于过去状态的过程,并且存在一个转移矩阵来捕获从一种状态到另一种状态的转移概率。 但是后来我碰到了这个术语:Markov Chain Monte Carlo。我想知道的是,马尔可夫链蒙特卡洛是否与我上面描述的马尔可夫过程有关?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.