统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
强化学习算法概述
我目前正在搜索“强化学习算法概述”,也许是它们的分类。但是除了Sarsa和Q-Learning +深度Q-Learning之外,我真的找不到任何流行的算法。 维基百科为我提供了关于不同的通用强化学习方法的概述,但是没有引用实现该方法的不同算法。 但是也许我混淆了一般的方法和算法,并且基本上像其他机器学习领域一样,在这一领域没有真正的分类。可以给我一个简短的介绍,或者只是一个参考,让我开始阅读不同的方法,它们之间的差异以及实现该方法的示例算法吗?

1
0删减的多元法线的均值和方差是多少?
设在。的均值和协方差矩阵是什么(最大逐元素计算)?Z∼N(μ,Σ)Z∼N(μ,Σ)Z \sim \mathcal N(\mu, \Sigma)RdRd\mathbb R^dZ+=max(0,Z)Z+=max(0,Z)Z_+ = \max(0, Z) 例如,这是因为,如果我们在深层网络中使用ReLU激活功能,并通过CLT假定给定层的输入近似正常,则这就是输出的分布。 (我确信很多人以前都已经计算过了,但是我找不到以合理可读的方式列出的结果。)

3
如何处理等于1或-1的随机效应相关性?
当处理复杂的最大混合模型时(估计给定数据和模型的所有可能随机效应)是完美的(+1或-1)或在某些随机效应之间几乎完美的相关性,这种情况并不罕见。为了讨论的目的,让我们观察以下模型和模型摘要 Model: Y ~ X*Cond + (X*Cond|subj) # Y = logit variable # X = continuous variable # Condition = values A and B, dummy coded; the design is repeated # so all participants go through both Conditions # subject = random effects for different subjects Random effects: Groups Name …

2
在梯度下降中使用固定步长时,为什么步长会变小?
假设我们正在做一个关于梯度合适的玩具示例,使用固定步长最小化二次函数。()α = 0.03 甲= [ 10 ,2 ; 2 ,3 ]XŤ一个XxTAxx^TAxα = 0.03α=0.03\alpha=0.03甲= [ 10 ,2 ; 2 ,3 ]A=[10,2;2,3]A=[10, 2; 2, 3] 如果在每次迭代中绘制的轨迹,我们将得到下图。当我们使用固定步长时,为什么点变得“非常密集” ?直观地,它看起来不像固定步长,而是递减的步长。Xxx PS:R代码包括情节。 A=rbind(c(10,2),c(2,3)) f <-function(x){ v=t(x) %*% A %*% x as.numeric(v) } gr <-function(x){ v = 2* A %*% x as.numeric(v) } x1=seq(-2,2,0.02) x2=seq(-2,2,0.02) df=expand.grid(x1=x1,x2=x2) contour(x1,x2,matrix(apply(df, …


3
更高的是或
因此,我进行了概率测试,但我无法真正回答这个问题。它只是问这样的事情: “考虑到是一个随机变量 0,请使用正确的不等式证明E(X ^ 2)^ 3或E(X ^ 3)^ 2等于或更高。XXXXXX ⩾⩾\geqslant 000E(X2)3E(X2)3E(X^2)^3E(X3)2E(X3)2E(X^3)^2 我唯一能想到的就是詹森的不平等,但我真的不知道如何在这里应用它。

2
显示
如果,则找到。X∼C(0,1)X∼C(0,1)X\sim\mathcal C(0,1)Y=2X1−X2Y=2X1−X2Y=\frac{2X}{1-X^2} 我们有FY(y)=Pr(Y≤y)FY(y)=Pr(Y≤y)F_Y(y)=\mathrm{Pr}(Y\le y) =Pr(2X1−X2≤y)=Pr(2X1−X2≤y)\qquad\qquad\qquad=\mathrm{Pr}\left(\frac{2X}{1-X^2}\le y\right) =⎧⎩⎨⎪⎪⎪⎪⎪⎪Pr(X∈(−∞,−1−1+y2√y])+Pr(X∈(−1,−1+1+y2√y]),ify&gt;0Pr(X∈(−1,−1+1+y2√y])+Pr(X∈(1,−1−1+y2√y]),ify&lt;0={Pr(X∈(−∞,−1−1+y2y])+Pr(X∈(−1,−1+1+y2y]),ify&gt;0Pr(X∈(−1,−1+1+y2y])+Pr(X∈(1,−1−1+y2y]),ify&lt;0\qquad\qquad=\begin{cases} \mathrm{Pr}\left(X\in\left(-\infty,\frac{-1-\sqrt{1+y^2}}{y}\right]\right)+\mathrm{Pr}\left(X\in\left(-1,\frac{-1+\sqrt{1+y^2}}{y}\right]\right),\text{if}\quad y>0\\ \mathrm{Pr}\left(X\in\left(-1,\frac{-1+\sqrt{1+y^2}}{y}\right]\right)+\mathrm{Pr}\left(X\in\left(1,\frac{-1-\sqrt{1+y^2}}{y}\right]\right),\text{if}\quad y<0 \end{cases} 我不知道上述区分大小写是否正确。 另一方面,以下似乎是一个更简单的方法: 我们可以使用身份来写Y=tan(2tan−1X)Y=tan⁡(2tan−1⁡X)Y=\tan(2\tan^{-1}X)2tanz1−tan2z=tan2z2tan⁡z1−tan2⁡z=tan⁡2z\frac{2\tan z}{1-\tan^2z}=\tan 2z 现在,X∼C(0,1)⟹tan−1X∼R(−π2,π2)X∼C(0,1)⟹tan−1⁡X∼R(−π2,π2)X\sim\mathcal C(0,1)\implies\tan^{-1}X\sim\mathcal R\left(-\frac{\pi}{2},\frac{\pi}{2}\right) ⟹2tan−1X∼R(−π,π)⟹2tan−1⁡X∼R(−π,π)\qquad\qquad\qquad\quad\implies 2\tan^{-1}X\sim\mathcal R(-\pi,\pi) ⟹tan(2tan−1X)∼C(0,1)⟹tan⁡(2tan−1⁡X)∼C(0,1)\qquad\qquad\qquad\quad\implies\tan\left(2\tan^{-1}X\right)\sim\mathcal C(0,1),最后一个是2对1转换。 但是如果要求我从定义中得出的分布,我想第一种方法就是如何进行。计算有点混乱,但是我得出正确的结论吗?也欢迎任何其他解决方案。YYY Johnson-Kotz-Balakrishnan的连续单变量分布(Vol.1)突出了柯西分布的这一特性。事实证明,这只是一般结果的特例。

2
独立平方均匀随机变量之和的平方根的期望
让X1,…,Xn∼U(0,1)X1,…,Xn∼U(0,1)X_1,\dots,X_n \sim U(0,1)是独立的,identicallly分布式标准统一的随机变量。 Let Yn=∑inX2iI seek: E[Yn−−√]Let Yn=∑inXi2I seek: E[Yn]\text{Let }\quad Y_n=\sum_i^nX_i^2 \quad \quad \text{I seek: } \quad \mathbb{E}\big[\sqrt{Y_n } \big] YnYnY_n的期望很容易: E[X2]E[Yn]=∫10y2y√=13=E[∑inX2i]=∑inE[X2i]=n3E[X2]=∫01y2y=13E[Yn]=E[∑inXi2]=∑inE[Xi2]=n3\begin{align} \mathbb{E}\left[X^2\right] &=\int_0^1\frac{y}{2\sqrt{y}}=\frac{1}{3}\\ \mathbb{E}\left[Y_n\right] &=\mathbb{E}\left[\sum_i^nX_i^2\right] = \sum_i^n\mathbb{E}\left[X_i^2\right]=\frac{n}{3} \end{align} 现在是无聊的部分。要申请LOTUS,我需要YnYnY_n的pdf 。当然,两个独立随机变量之和的pdf是其pdf的卷积。但是,这里我们有nnn随机变量,我猜想卷积会导致一个...卷积的表达式(意想不到的双关语)。有没有更聪明的方法? 我希望看到正确的解决方案,但如果不可能或过于复杂,则可以接受大nnn的渐近近似。根据詹森的不等式,我知道 E[Yn]−−−−−√=n3−−√≥E[Yn−−√]E[Yn]=n3≥E[Yn]\sqrt{\mathbb{E}[Y_n]}=\sqrt{\frac{n}{3}}\geq\mathbb{E}\left[\sqrt{Y_n}\right] 但这对我没有多大帮助,除非我还能找到一个不平凡的下限。请注意,CLT不适用于此处,因为我们拥有独立RV的总和的平方根,而不仅仅是独立RV的总和。也许可能存在其他极限定理(我忽略了),在这里可能会有帮助。

4
拟合线性模型后,是否可以将拟合残差分解为偏差和方差?
我想将数据点分类为需要更复杂的模型,或者不需要更复杂的模型。我目前的想法是将所有数据拟合为简单的线性模型,并观察残差的大小以进行此分类。然后,我读了一些关于误差的偏差和方差贡献的信息,并意识到,如果我可以直接计算偏差,那么使用总误差(残差或标准残差)可能是更好的方法。 是否可以使用线性模型直接估算偏差?有无测试数据?交叉验证是否对您有帮助? 如果不是,是否可以使用线性模型的平均自举合奏(我认为它称为装袋)来近似偏差?

2
非平稳环境中的强化学习
已关闭。这个问题需要更加集中。它当前不接受答案。 想改善这个问题吗?更新问题,使其仅通过编辑此帖子来关注一个问题。 13天前关闭。 问题1:一般而言,强化学习中是否有处理非固定环境的通用或公认方法? Q2:在我的网格世界中,当访问状态时,奖励功能会发生变化。每集奖励都会重置为初始状态。我希望我的代理学习的唯一内容是“除非真正需要,否则请不要回去”,但这会使环境不稳定。可以/应该将此非常简单的规则合并到MDP模型中吗?Q学习是解决此问题的最佳解决方案吗?有什么建议或可用的例子吗? Q3:我一直在研究具有经验重播的Q学习,作为应对非固定环境的解决方案,因为它可以消除连续更新的相关性。这是该方法的正确使用,还是更多地用于提高学习效率的方法?而且我只看到它与值近似一起使用。我不确定将其用于简单的离散状态空间(例如gridworld)是否过大,或者有其他原因。 即使您无法解决所有问题,也请随时回答或发表评论。


1
线性回归偏差方差分解中的方差项
在“统计学习的要素”中,线性模型的偏差方差分解的表达式为 其中是实际目标函数,是模型和是对线性估计。˚F (X 0)σ 2 ε ÿ = ˚F (X )+ εEr r (x0)=σ2ϵ+E[f(x0)- ËF^(x0)]2+ | | h (x0)| |2σ2ϵ,E[R[R(X0)=σϵ2+Ë[F(X0)-ËF^(X0)]2+||H(X0)||2σϵ2,Err(x_0)=\sigma_\epsilon^2+E[f(x_0)-E\hat f(x_0)]^2+||h(x_0)||^2\sigma_\epsilon^2,F(x0)F(X0)f(x_0)σ2ϵσϵ2 \sigma_\epsilon^2y=f(x)+ϵy=f(x)+ϵy=f(x)+\epsilonf^(x)f^(x)\hat f(x)f(x)f(x)f(x) 方差项在这里令我感到困扰,因为等式暗示如果目标无噪声,即,方差将为零但这对我来说没有意义,因为即使噪声为零,对于不同的训练集,我仍然可以获得不同的估计值,这意味着方差不为零。σ2ϵ=0.σϵ2=0.\sigma_\epsilon^2=0.f^(x0)f^(x0)\hat f(x_0) 例如,假设目标函数是二次方,并且训练数据包含从该二次方随机采样的两个点;显然,每次从二次目标中随机采样两个点时,我都会得到不同的线性拟合。那么方差如何为零?f(x0)f(x0)f(x_0) 谁能帮助我找出我对偏差方差分解的理解中存在的问题?

1
使用lme4 glmer和glmer.nb帮助解释计数数据GLMM-负二项式与Poisson
我对GLMM的规范和解释有一些疑问。3个问题绝对是统计学上的问题,2个是关于R的更具体的问题。我在这里发布,因为最终我认为问题是GLMM结果的解释。 我目前正在尝试安装GLMM。我使用的是美国经纬度数据库中的美国人口普查数据。我的观察是人口普查区。我的因变量是空置住房的数量,我对空置与社会经济变量之间的关系很感兴趣。这里的示例很简单,仅使用两个固定的影响:非白人人口百分比(种族)和家庭收入中位数(阶级)及其相互作用。我想包括两个嵌套的随机效应:几十年和几十年之内的片段,即(十年/片段)。我正在考虑这些随机变量,以控制空间(即区域之间)和时间(即数十年之间)的自相关。但是,我也对十年作为固定影响感兴趣,因此我也将它作为固定因素包括在内。 由于我的自变量是非负整数计数变量,因此我一直在尝试拟合泊松和负二项式GLMM。我使用的是房屋总数的对数。这意味着系数被解释为对空置率的影响,而不是对空置房屋总数的影响。 我目前有使用lme4的glmer和glmer.nb估计的泊松和负二项式GLMM的结果。根据我对数据和研究领域的了解,对系数的解释对我来说很有意义。 如果您需要数据和脚本,它们位于我的Github上。该脚本包括我在构建模型之前所做的更多描述性调查。 这是我的结果: 泊松模型 Generalized linear mixed model fit by maximum likelihood (Laplace Approximation) ['glmerMod'] Family: poisson ( log ) Formula: R_VAC ~ decade + P_NONWHT + a_hinc + P_NONWHT * a_hinc + offset(HU_ln) + (1 | decade/TRTID10) Data: scaled.mydata AIC BIC logLik deviance df.resid 34520.1 34580.6 …

1
不暗示和独立性?X YCov(f(X),Y)=0∀f(.)Cov(f(X),Y)=0∀f(.)\mathbb{Cov} \left(f(X),Y\right) = 0 \; \forall \; f(.)XXXYYY 我只熟悉以下和之间的独立性定义。ÿXXXYYY fx,y(x,y)=fx(x)fy(y)fx,y(x,y)=fx(x)fy(y) f_{x,y}(x,y) = f_x(x)f_y(y)

1
发现高维,相关数据和主要特征/协变量;多重假设检验?
我有一个约有5,000个经常相关的特征/协变量和二进制响应的数据集。数据是给我的,我没有收集。我使用套索和梯度提升来构建模型。我使用迭代的嵌套交叉验证。我报告了Lasso在梯度增强树中最大(绝对)的40个系数和40个最重要的特征(40个并没有什么特别的;它似乎是一个合理的信息量)。我还报告了这些数量在CV的折叠和迭代中的变化。 我有点想“重要”功能,不对p值或因果关系或其他任何东西做任何陈述,而是考虑将此过程视为一种现象-尽管不完美,而且是某种随机性-而不是某种现象。 假设我正确完成了所有这些操作(例如,正确执行了交叉验证,针对套索进行了缩放),这种方法是否合理?是否存在多个假设检验,事后分析,错误发现等问题?还是其他问题? 目的 预测不良事件的可能性 首先,准确估计概率 更为次要的是,作为一项健全性检查,但也许还可以揭示一些可以进一步研究的新颖预测变量,请检查上述系数和重要性。 消费者 有兴趣预测此事件的研究人员以及最终不得不修复该事件的人员 我希望他们摆脱困境 如果他们希望使用自己的数据重复所述的建模过程,则使他们能够预测事件。 为意外的预测因素提供一些启示。例如,可能发现完全出乎预料的是最佳预测器。因此,其他地方的建模者可能会更认真地考虑所述预测变量。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.