统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
偏态数据回归
尝试根据人口统计和服务计算访问次数。数据非常歪斜。 直方图: qq图(左边是对数): m <- lm(d$Visits~d$Age+d$Gender+city+service) m <- lm(log(d$Visits)~d$Age+d$Gender+city+service) city和service是因子变量。 对于所有变量,我都得到一个较低的p值***,但是我也得到了.05的一个较低的r平方。我该怎么办?另一个模型可以工作吗,例如指数模型或其他模型?

1
零膨胀泊松或零膨胀负二项式的“偏差”度量?
比例偏差定义为D = 2 *(饱和模型的对数似然度减去拟合模型的对数似然度),通常用作GLM模型中拟合优度的度量。解释的偏差百分比定义为[D(零模型)-D(拟合模型)] / D(零模型),有时也用作线性回归的R平方的GLM模拟。除了ZIP和ZINB分布不属于指数分布的事实外,我很难理解为什么零膨胀建模中未使用比例偏差和百分比偏差。谁能对此有所启发或提供有用的参考?提前致谢!

3
学习应用概率的好书?
我正在寻找一本书,该书对概率论进行了深入而严格的介绍,但重点是在数学系以外最有用的材料。我听说过“概率论:探索和应用”非常不错,但是我想提出其他建议。 例如,阿奇姆·克兰克(Achim Klenke)的书对我来说太过分了……它是为证明定理而组织的,而据我所知,它并不是应用程序。同样,我也不喜欢杜雷特的书,也不喜欢比林斯利或费勒...再一次,太过关注数学研究了。


3
随机计算机模型的优化
对于Google来说,这对我来说是一个艰巨的主题,因为在搜索中使用“优化和随机”一词几乎会自动默认为搜索随机优化。但是,我真正想知道的是,当计算机模型输出是随机的(即不确定的)时,存在哪些方法可以优化计算机模型? 例如,如果您考虑一个计算机模型,其中有一些未知函数代表计算机模型的输出,那么存在许多用于解决问题的统计方法,例如f(x)f(x)f(x) minxf(x)∈Xminf(x)x∈X\begin{align*} \min&\,\,\,\, f(x)\\ x&\in\mathcal{X} \end{align*} 当f(x)f(x)f(x)是确定性的时。但是,当f(x)f(x)f(x)随机时会发生什么?有没有解决问题的方法,或者充其量只能解决 minxE[f(x)]∈XminE[f(x)]x∈X\begin{align*} \min&\,\,\,\, \mathbb{E}[f(x)]\\ x&\in\mathcal{X} \end{align*} 其中E(⋅)E(⋅)\mathbb{E}(\cdot)是通常的期望运算符。

3
另一个中心极限定理问题
令为具有的独立伯努利随机变量序列 设置 表明在分布上收敛于标准正态变量因为趋于无穷大。P { X ķ = 1 } = 1 - P { X ķ = 0 } = 1{Xn:n≥1}{Xn:n≥1}\{X_n:n\ge1\}Sn= n ∑ k=1(Xk−1P{Xk=1}=1−P{Xk=0}=1k.P{Xk=1}=1−P{Xk=0}=1k.P\{X_k=1\}=1-P\{X_k=0\}=\frac{1}{k}.小号ÑSn=∑k=1n(Xk−1k), B2n=∑k=1nk−1k2Sn=∑k=1n(Xk−1k), Bn2=∑k=1nk−1k2S_n=\sum^{n}_{k=1}\left(X_k-\frac{1}{k}\right), \ B_n^2=\sum^{n}_{k=1}\frac{k-1}{k^2} žÑSnBnSnBn\frac{S_n}{B_n}ZZZnnn 我的尝试是使用Lyapunov CLT,因此我们需要显示存在一个,使得 δ>0δ>0\delta>0limn→∞1B2+δn∑k=1nE[|Xk−1k|2+δ]=0.limn→∞1Bn2+δ∑k=1nE[|Xk−1k|2+δ]=0.\lim_{n\rightarrow \infty}\frac{1}{B_n^{2+\delta}}\sum_{k=1}^{n}E[|X_k-\frac{1}{k}|^{2+\delta}]=0. 因此设置δ=1δ=1\delta=1∑k=1nE∣∣Xk−k−1∣∣3=∑k=1n(1k−3k2+4k3−2k4)∑k=1nE|Xk−k−1|3=∑k=1n(1k−3k2+4k3−2k4) \sum_{k=1}^{n}E\left|X_k-k^{-1}\right|^{3}=\sum_{k=1}^{n} \left(\frac{1}{k}-\frac{3}{k^2}+\frac{4}{k^3}-\frac{2}{k^4}\right) 和 B3n=(∑k=1n1k−1k2)(∑k=1n1k−1k2)−−−−−−−−−−−−⎷Bn3=(∑k=1n1k−1k2)(∑k=1n1k−1k2) B_n^3=\left( \sum_{k=1}^n \frac{1}{k}-\frac{1}{k^2} \right) \sqrt{\left( \sum_{k=1}^n \frac{1}{k}-\frac{1}{k^2} \right)} 通过在计算机上评估大n,它显示∑nk=1E|Xk−k−1|3→∞∑k=1nE|Xk−k−1|3→∞\sum_{k=1}^{n}E|X_k-k^{-1}|^{3} \to \infty和B3n→∞Bn3→∞B_n^3 \to …

1
以神经网络为函数逼近的Q学习
我正在尝试使用神经网络来估计Q学习中的Q值,如有关使用神经网络进行Q学习的问题中所述。正如第一个答案中所建议的那样,我在输出层使用线性激活函数,而在隐藏层中仍使用S形激活函数(2,尽管稍后可以更改)。我还使用了单个NN,它根据建议为每个动作返回输出。Q(a)Q(a)Q(a) 但是,对于简单的车杆平衡问题,该算法仍存在分歧。所以,我担心我的Q更新是错误的。初始化之后,我在每个步骤中所做的工作如下: 使用NN对所有动作的前向传播计算。Qt(st)Qt(st)Q_t(s_t) 选择一个新动作,处于新状态。小号ŧatata_tststs_t 使用NN对所有动作的前向传播计算。Qt(st+1)Qt(st+1)Q_t(s_{t+1}) 将目标Q值设置为: 仅针对当前动作a_t,同时为其他状态设置Q_ {t + 1}(s,a_t)= Q_ {t}(s,a_t)。注意,我认为这是问题所在。一吨Q 吨+ 1(小号Qt+1(st,at)=Qt(st,at)+αt[rt+1+γmaxaQ(st+1,a)−Qt(st,at)]Qt+1(st,at)=Qt(st,at)+αt[rt+1+γmaxaQ(st+1,a)−Qt(st,at)]Q_{t+1}(s_t,a_t)=Q_t(s_t,a_t)+\alpha_t \left[r_{t+1}+\gamma \max_a Q(s_{t+1},a) - Q_t(s_t,a_t) \right]atata_t问t + 1(小号,一Ť)= QŤ(小号,一Ť)Qt+1(s,at)=Qt(s,at)Q_{t+1}(s,a_t)=Q_{t}(s,a_t) 将误差向量设置为e = QŤ 一个ř 克ë 吨- QŤ= Qt + 1- QŤË=问Ť一种[RGËŤ-问Ť=问Ť+1个-问Ť\mathbf{e}=Q_\mathrm{target}-Q_t=Q_{t+1}-Q_t 通过NN向后传播误差,以更新权重矩阵。 有人可以向我指出我哪里出问题了吗? 此外,您认为我应该在输入层和第一个隐藏层中也包含一个偏差项吗(例如,对于S型函数)?会有所作为吗? 预先非常感谢您的帮助。如果需要,我可以帮助您澄清问题或共享代码。

1
与SVM相比,支持向量回归有何不同?
我了解有关SVM和SVR的基础知识,但我仍然不知道如何找到一种将余量最大化的超平面的问题适合SVR。 其次,我读了一些关于信息,该用作SVR的容限。这是什么意思?ϵϵ\epsilon 第三,在SVM和SVR中使用的决策函数参数之间是否有区别?

2
决策树和回归-预测值是否超出训练数据范围?
对于决策树,预测值是否可以超出训练数据的范围? 例如,如果目标变量的训练数据集范围是0-100,那么当我生成模型并将其应用于其他对象时,我的值可以为-5吗?还是150? 鉴于我对决策树回归的理解是,它仍然是基于规则的-左/右进展,并且在训练集中的树的底部,它永远不会看到超出特定范围的值,因此它将永远无法预测吗?

3
Word2Vec的跳过语法模型如何生成输出向量?
我在理解Word2Vec算法的跳过语法模型时遇到问题。 在连续词袋中,很容易看到上下文词如何在神经网络中“拟合”,因为您基本上是在将每个一次性编码表示形式与输入矩阵W相乘后对它们进行平均。 但是,在skip-gram的情况下,您只能通过将一热点编码与输入矩阵相乘来获得输入词向量,然后假设通过将上下文词乘以C(=窗口大小)来表示上下文词输入矢量表示,输出矩阵为W'。 我的意思是说,词汇量为,编码为,输入矩阵,作为输出矩阵。给定单词具有一词热编码和上下文单词和(具有热代表和),如果将乘以输入矩阵,则得到,现在如何从中生成得分矢量?Ñ w ^ ∈ [R V × Ñ W¯¯ ' ∈ [R Ñ × V瓦特我X 我瓦特Ĵ 瓦特ħ X Ĵ X ħ X 我 W¯¯ ħ:= X Ť 我 W¯¯ = w ^ (我,⋅ ) ∈ [R Ñ ÇVVVNNNW∈RV×NW∈RV×NW \in \mathbb{R}^{V\times N}W′∈RN×VW′∈RN×VW' \in \mathbb{R}^{N\times V}wiwiw_ixixix_iwjwjw_jwhwhw_hxjxjx_jxhxhx_hxixix_iWWWh:=xTiW=W(i,⋅)∈RNh:=xiTW=W(i,⋅)∈RN{\bf h} := x_i^TW …


3
一个人应该使用什么损失函数来获得高精度或高召回率的二进制分类器?
我正尝试制作一个很少出现的物体(在图像中)检测器,计划使用在滑动/调整大小的窗口中应用的CNN二进制分类器。我已经构建了平衡的1:1正负训练和测试集(在这种情况下,这样做是对的吗?),分类器在测试集上的准确性很好。现在,我想控制分类器的召回率/精度,例如,它不会错误地标记过多的多数类事件。 明显的(对我来说)解决方案是使用与现在使用的相同的逻辑损失,但是通过将两种情况之一中的损失乘以某个常数,可以将I型和II型权重的误差乘以不同,这可以调整。这样对吗? PS第二个想法是,这等同于对一些训练样本进行加权。我认为,只增加一个班级就能达到相同的效果。

1
算法:不确定值时的二进制搜索
当每一步的测试可能给出错误的结果时,我需要一种算法来进行二进制搜索。 背景: 我需要让学生处于12个难度等级中最合适的位置。当前的方法是蛮力,并提出60个4答案的多项选择题,难度越来越大,在三个错误之后停下来,使学生处于等级:floor((score - 1) / 5) + 1最低为1。 我们担心客户在面对多达60个问题的考试之前会被关闭,然后才能真正使用该程序,因此我们希望最大程度地减少测试中提出的问题数量。我们还担心客户会跳过分班测试(因为它看起来很长),然后因为看起来太容易而放弃了该程序。 中位数排名实际上是2级,因此50%以上的学生得分<11(即回答<14个问题)。有趣的是,这可能是因为他们感到无聊并且不再认真对待问题(他们是年幼的孩子)。 建议的解决方案: 将测试作为对十二个项目的二进制搜索来实施,以难度级别6/7的问题开始,然后根据问题是对还是错来进行。从理论上讲,这可以在3-4个问题中找到适合他们的难度级别。 问题: 您可能会从现有的测试中猜到只有在三个错误的答案之后才结束,并使用60个问题在12个级别中进行选择,所以我们想让学生承认正确的答案(他们应该在25%的时间里做)提供不正确的答案(胖手指,错误阅读的问题等)。这对于二进制搜索尤为重要,因为即使第一个问题都错了,对第一个问题的正确回答也会使您处于难度的上半部分。 那么,有没有一种公认的二进制搜索算法可以保证单个测试的准确性? 天真的,我可能会在每个步骤中尝试3到5个问题,并且,由于较早的问题对最终结果的影响要大于对较晚的问题的影响,因此可能仅将这些附加问题添加到较早的步骤中,而不是对较后的问题。还有什么呢?
11 algorithms 

1
如何测试交叉协方差矩阵是否为非零?
我的研究背景: 在吉布斯采样中,我们分别从P(X | Y)和P(Y | X)采样(感兴趣的变量)和,其中X和Y是k维随机向量。我们知道该过程通常分为两个阶段:XXXYYYP(X|Y)P(X|Y)P(X|Y)P(Y|X)P(Y|X)P(Y|X)XXXYYYkkk 老化期,我们丢弃所有样品。将样本表示为X1∼XtX1∼XtX_1\sim X_t和Y1∼YtY1∼YtY_1\sim Y_t。 “后烙印”时期,我们将样本\ bar {X} = \ frac {1} {k} \ sum_ {i = 1} ^ k X_ {t + i}平均X¯=1k∑ki=1Xt+iX¯=1k∑i=1kXt+i\bar{X} = \frac{1}{k}\sum_{i=1}^k X_{t+i}作为最终期望的结果。 但是,“预烧”序列Xt+1∼Xt+kXt+1∼Xt+kX_{t+1}\sim X_{t+k}中的样本并不是独立分布的。因此,如果我要检查最终结果的方差,它将变为 Var[X¯]=Var[∑i=1kXt+i]=1k2(∑i=1kVar[Xt+i]+∑i=1k−1∑j=i+1kCov[Xt+i,Xt+j])Var⁡[X¯]=Var⁡[∑i=1kXt+i]=1k2(∑i=1kVar⁡[Xt+i]+∑i=1k−1∑j=i+1kCov⁡[Xt+i,Xt+j])\operatorname{Var}[\bar{X}] = \operatorname{Var}\left[\sum_{i=1}^k X_{t+i}\right] = \frac{1}{k^2}\left(\sum_{i=1}^k\operatorname{Var}[X_{t+i}] + \sum_{i=1}^{k-1} \sum_{j=i+1}^k \operatorname{Cov}[X_{t+i},X_{t+j}]\right) 这里,术语Cov[Xt+i,Xt+j]Cov⁡[Xt+i,Xt+j]\operatorname{Cov}[X_{t+i},X_{t+j}]是一个k×kk×kk\times k的互协方差矩阵适用于任何(i,j)(i,j)(i,j)与i&lt;ji&lt;ji<j。 例如,我有 Xt + 1= (1 …

3
可视化二元二项分布
问题:二元二项分布在3维空间中是什么样的? 下面是我想针对各种参数值可视化的特定功能;即,和。p 1 p 2nnnp1p1p_{1}p2p2p_{2} f(x1,x2)=n!x1!x2!px11px22,x1+x2=n,p1+p2=1.f(x1,x2)=n!x1!x2!p1x1p2x2,x1+x2=n,p1+p2=1.f(x_{1},x_{2}) = \frac{n!}{x_{1}!x_{2}!}p_{1}^{x_{1}}p_{2}^{x_{2}}, \qquad x_{1}+x_{2}=n, \quad p_{1}+p_{2}=1. 注意,有两个约束;和。另外,是一个正整数,例如。p 1 + p 2 = 1 n 5x1+x2=nx1+x2=nx_{1}+x_{2}=np1+p2=1p1+p2=1p_{1}+p_{2}=1nnn555 在使用LaTeX(TikZ / PGFPLOTS)进行了两次绘图功能的尝试。这样做,我得到以下图形的以下值:,和以及,和分别为。我尚未成功实现对域值的约束;,所以我有些困惑。p 1 = 0.1 p 2 = 0.9 n = 5 p 1 = 0.4 p 2 = 0.6 x 1 + x 2 = nn=5n=5n=5p1=0.1p1=0.1p_{1}=0.1p2=0.9p2=0.9p_{2}=0.9n=5n=5n=5p1=0.4p1=0.4p_{1}=0.4p2=0.6p2=0.6p_{2}=0.6x1+x2=nx1+x2=nx_{1}+x_{2}=n 用任何语言生成的可视化效果都很好(R,MATLAB等),但是我正在使用TikZ …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.