统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
每个动作只有一个输出单元时,使用神经网络进行Q学习的效率如何?
背景: 我在强化学习任务中使用了神经网络Q值近似。该方法与该问题中描述的方法完全相同,但是问题本身不同。 在这种方法中,输出数量就是我们可以采取的行动数量。简单来说,算法如下:执行动作A,探索奖励,要求NN预测所有可能动作的Q值,选择最大Q值,将特定动作A的Q计算为R + max(new_state_Q)。在预测的Q值上拟合模型,只有其中一个被代替R + max(new_state_Q)。 问题:如果产出数量很大,这种方法的效率如何? 尝试:假设我们可以采取10个动作。在每个步骤中,我们都要求模型预测10个值,而在模型的早期,这种预测就是一团糟。然后,我们修改输出的1个值,并使模型适合这些值。 对于这种方法的优缺点,我有两种相反的想法,无法确定哪种方法是正确的: 从一个角度来看,我们在随机数据上训练每个神经元9次,而在接近实际值的数据上仅训练一次。如果NN在状态S下为动作A预测5,但实际值为-100,则将使NN与值5匹配9次,然后与值-100匹配一次。听起来很疯狂。 从其他角度来看,神经网络的学习是作为错误的反向传播实现的,因此,当模型预测5且我们在5上对其进行训练时,由于错误为0,因此不会学习任何新知识。权重不受影响。并且只有当我们将计算-100并将其拟合到模型中时,它才会进行权重计算。 哪个选项正确?也许还有其他我没有考虑的东西? 更新: “有效率”是指与一种输出(预期回报)的方法进行比较。当然,在这种情况下,动作将是输入的一部分。因此,方法1根据某种状态对所有动作进行预测,方法2对某种状态下采取的特定动作进行预测。

1
神经网络是否使用有效的编码?
我的问题与有效编码假设之间的关系有关,该假设在Wikipedia页面上概述了有效编码与神经网络学习算法之间的关系。 有效编码假设和神经网络之间有什么关系? 是否有任何有效编码假设明确启发的神经网络模型? 或者说所有神经网络学习算法至少隐式地基于有效编码会更公平吗?

1
加权最小二乘方权重定义:R lm函数与
谁能告诉我为什么我从R加权最小二乘法和矩阵运算的手动解中得到不同的结果? 具体来说,我正在尝试手动求解,其中是权重的对角矩阵,是数据矩阵,是响应向量。 WAx=WbWAx=Wb\mathbf W \mathbf A\mathbf x=\mathbf W \mathbf bWW\mathbf WAA\mathbf Abb\mathbf b 我正在尝试R lm使用weights参数将结果与函数进行比较。

2
如何对截断的多项式分布进行采样?
我需要一种算法来采样截断的多项式分布。那是, x⃗ ∼1Zpx11…pxkkx1!…xk!x→∼1Zp1x1…pkxkx1!…xk!\vec x \sim \frac{1}{Z} \frac{p_1^{x_1} \dots p_k^{x_k}}{x_1!\dots x_k!} 其中是归一化常数,\ vec x具有k个正分量,并且\ sum x_i = n。我只考虑\ vec {x}在\ vec a \ le \ vec x \ le \ vec b范围内的值。→ X ķ Σ X 我 = Ñ → X → 一个 ≤ → X ≤ → bZZZx⃗ x→\vec xkkk∑xi=n∑xi=n\sum …


2
泊松参数的无偏估计
每天的事故数量是带有参数的泊松随机变量,在随机选择的10天中,观察到的事故数量为1,0,1,1,2,0,2,0,0,1,将是的无偏估计è λ?λλ\lambdaËλeλe^{\lambda} 我想用这种方式来尝试:我们知道,,但Ë (ē ˉ X)≠ ê λ。那么,所需的无偏估计量是多少?Ë(x¯)= λ = 0.8E(x¯)=λ=0.8E(\bar{x})=\lambda=0.8Ë(eX¯)≠ e λE(ex¯)≠ eλE(e^{\bar{x}})\neq\ e^{\lambda}

1
普通的最小二乘是什么?
我的一个朋友最近问什么是普通的,关于普通最小二乘。我们似乎没有在讨论中取得任何进展。我们都同意OLS是线性模型的特例,它具有许多用途,众所周知,并且是许多其他模型的特例。但这真的是全部吗? 因此,我想知道: 名字的真正来源是什么? 谁是第一个使用这个名字的人?


2
如何改善R MICE数据插补的运行时间
简而言之,我的问题是:有没有什么方法可以改善R MICE(数据插补)的运行时间? 我正在使用一个数据集(30个变量,130万行),该数据集包含(随机)丢失的数据。30个变量中约15个变量中约有8%包含NA。为了估算丢失的数据,我运行了MICE函数,该函数是MICE软件包的一部分。 我使用method =“ fastpmm”和m = 1甚至在一个子集(100,000行)上都经历了非常慢的运行时间,并且运行了大约15分钟。 有没有一种方法可以改善运行时间而又不会损失太多性能?(mice.impute.mean速度非常快,但是会带来大量的信息丢失!)。 可复制的代码: library(mice) df <- data.frame(replicate(30,sample(c(NA,1:10),1000000,rep=TRUE))) df <- data.frame(scale(df)) output <- mice(df, m=1, method = "fastpmm")

2
女士品尝茶的力量
在著名的费舍尔实验中,可观察到的是具有杯子和两种的校正猜想杯子的数量。通常,给定测试的大小,计算临界区域以拒绝零假设(女士在随机猜测)是很有趣的。使用超几何分布很容易做到这一点。以相同的方式,我可以在给定关键区域的情况下计算测试的大小。一kkkAAABBBαα\alpha 一个不同的问题是:给定替代假设,如何计算检验的功效?例如,假设女士能够在单个杯子上概率正确地猜测()。假设杯子的总数等于并且一种杯子的总数等于,那么测试的功效是什么?(不幸的是)那位女士认识。p=90%p=90%p=90\%P(guessA|trueA)=P(guess B|true B)=0.9P(guessA|trueA)=P(guess B|true B)=0.9P(\text{guess} A|\text{true} A)=P(\text{guess } B|\text{true } B)=0.9N=8N=8N=8n=N/2=4n=N/2=4n=N/2=4nnn 换句话说:如果女士知道存在一种杯子,则(替代假设下正确杯子的数量)的分布是什么?k=k=k=nnn


2
树估计量总是有偏差的吗?
我正在做决策树作业,我必须回答的问题之一是:“为什么从树中建立的估算器有偏见,而装袋如何帮助减少它们的差异?”。 现在,我知道过度拟合的模型倾向于具有非常低的偏差,因为它们试图拟合所有数据点。而且,我用Python编写了一个脚本,该脚本将树拟合到某些数据集(具有一个功能。它只是一个正弦曲线,带有一些偏离点,如下图所示)。因此,我想知道“好吧,如果我再次过度拟合数据,是否可以将偏差设为零?”。而且,事实证明,即使深度为10000,仍然有一些点无法通过曲线。 我尝试搜索原因,但找不到真正的解释。我猜想可能有些树可以完美地贯穿所有要点,而我得到的只是“运气不好”。或不同的数据集可能给了我无偏见的结果(也许是完美的正弦曲线?)。甚至可以说,也许在一开始就进行了切割,所以进一步切割不可能完全分离所有要点。 因此,考虑到此数据集(由于其他数据集可能有所不同),我的问题是:是否可能使树过度拟合到偏差变为零的点,或者是否总是会有一些偏差,即使实际上小?如果总是至少存在一些偏见,为什么会发生? PS我不知道它是否可能相关,但是我使用DecisionTreeRegressorfrom sklearn将模型拟合到数据中。
9 cart  bias 

1
通过随机度量进行集成意味着什么?
目前,我在看Dirichlet过程随机效应模型的纸和型号规格如下: 其中α是比例参数和G ^0是基量度。稍后在纸,它表明,我们整合在基座度量函数G ^0如 ∫˚F(Ý Ĵ |θ,ψ Ĵ)ÿ一世ψ一世G= X一世β+ ψ一世+ ϵ一世〜g ^〜d P(α ,G0)yi=Xiβ+ψi+ϵiψi∼GG∼DP(α,G0) \begin{align*}y_{i} &= X_{i}\beta + \psi_{i} + \epsilon_{i}\\ \psi_{i} &\sim G \\ G &\sim \mathcal{DP}\left(\alpha, G_{0}\right) \end{align*}αα\alphaG0G0G_{0}G0G0G_{0}Dirichlet处理中的基本度量是cdf还是pdf?如果基本度量是高斯会怎样?∫F(yĴ| θ, ψĴ)dG0(ψĴ)。∫f(yj|θ,ψj)dG0(ψj). \int f\left(y_{j}|\theta, \psi_{j}\right)\, dG_{0}\left(\psi_{j}\right).

2
为什么匹配对的自由度测试对数减去1?
我习惯知道“自由度”为,在这里有线性模型\ mathbf {Y} = \ mathbf {X} \ boldsymbol {\的β} + \ boldsymbol {\小量} 与\ mathbf {Y } \ in \ mathbb {R} ^ n,\ mathbf {X} \ in M_ {n \ times p}(\ mathbb {R})具有等级r的设计矩阵,\ boldsymbol {\ beta} \ in \ mathbb { R} ^ p,\ boldsymbol {\ epsilon} …

1
PCA图的楔形表示什么?
在关于文本分类的自动编码器的论文中, Hinton和Salakhutdinov演示了二维LSA(与PCA密切相关)产生的图:。 将PCA应用于绝对不同的略高维度的数据,我得到了一个看起来类似的图:(在这种情况下,我真的很想知道是否有任何内部结构)。 如果我们将随机数据输入到PCA中,则会得到一个圆盘状的斑点,因此这种楔形的形状不是随机的。它本身意味着什么吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.