统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
为什么在标准差公式中对样本计数“ N”取平方根?
我正在尝试了解标准差的一个非常基本的概念。 根据公式σ=∑i=1n(xi−μ)2N−−−−−−−−−−⎷σ=∑i=1n(xi−μ)2N\sigma= \sqrt{ \dfrac{ \sum\limits_{i=1}^n (x_i-\mu)^2} N } 我不明白为什么我们要将人口“ N”减半,即为什么当我们不做{N ^ 2}时为什么要取\ sqrt {N }呢?这是否会使我们正在考虑的人口倾斜?N−−√N\sqrt{N}N2N2{N^2} 公式不应是σ=∑i=1n(xi−μ)2−−−−−−−−−√Nσ=∑i=1n(xi−μ)2N\sigma= \dfrac{ \sqrt{ \sum\limits_{i=1}^n (x_i-\mu)^2} } {N}


3
高斯过程回归玩具问题
我试图通过高斯过程回归获得一些直觉,因此我尝试了一个简单的一维玩具问题。我拿了X一世= { 1 ,2 ,3 }xi={1,2,3}x_i=\{1,2,3\} 作为输入,并且 ÿ一世= { 1 ,4 ,9 }yi={1,4,9}y_i=\{1,4,9\}作为回应。(“灵感来自”ÿ=X2y=x2y=x^2) 对于回归,我使用了标准平方指数核函数: k (Xp,Xq)=σ2F经验值( -1个2升2|Xp-Xq|2)k(xp,xq)=σf2exp⁡(−12l2|xp−xq|2)k(x_p,x_q)=\sigma_f^2 \exp \left( - \frac{1}{2l^2} \left|x_p-x_q\right|^2 \right) 我认为存在标准偏差的噪音 σñσn\sigma_n,则协方差矩阵变为: ķp q= k (Xp,Xq)+σ2ñδp qKpq=k(xp,xq)+σn2δpqK_{pq} = k(x_p,x_q) + \sigma_n^2 \delta_{pq} 超参数 (σñ,升,σF)(σn,l,σf)(\sigma_n,l,\sigma_f)通过最大化数据的对数似然来估计。在某点做出预测X⋆x⋆x_\star,我分别通过以下方法找到了均值和方差 μx⋆=kT⋆(K+σ2nI)−1yμx⋆=k⋆T(K+σn2I)−1y\mu_{x_\star} = k_\star^T (\mathbf{K}+\sigma_n^2\mathbf{I})^{-1} y σ2x⋆=k(x⋆,x⋆)−kT⋆(K+σ2nI)−1k⋆σx⋆2=k(x⋆,x⋆)−k⋆T(K+σn2I)−1k⋆\sigma_{x_\star}^2 = k(x_\star,x_\star)-k_\star^T(\mathbf{K}+\sigma_n^2\mathbf{I})^{-1} k_\star 哪里 k⋆k⋆k_\star 是之间的协方差的向量 x⋆x⋆x_\star …

2
Logistic回归中的赔率
我很难理解一种逻辑回归解释。Logistic回归是在温度与死亡或不死亡的鱼类之间。 逻辑回归的斜率为1.76。然后,鱼死亡的几率增加了exp(1.76)= 5.8。换句话说,温度每变化1摄氏度,鱼死亡的几率就会增加5.8倍。 由于2012年有50%的鱼类死亡,因此2012年温度升高1摄氏度将使鱼类死亡的发生率增至82%。 如果2012年温度升高2摄氏度,鱼死亡的发生率将升至97%。 摄氏3度升高-> 100%的鱼死亡。 我们如何计算1、2和3?(82%,97%和100%)


1
调整后的R平方是否试图估计固定分数或随机分数总体的R平方?
可以假设固定分数或随机分数来定义 r平方:ρ2ρ2\rho^2 固定分数:样本量和预测变量的特定值保持固定。因此,ρ2fρf2\rho^2_f是当预测变量值保持恒定时在总体回归方程中由结果解释的方差比例。 随机分数:预测变量的特定值是从分布中得出的。因此,指的是总体中结果中解释的方差比例,其中预测变量值对应于预测变量的总体分布。ρ2rρr2\rho^2_r 之前我曾问过这种区别是否对估计有很大的不同ρ2ρ2\rho^2。我也普遍询问过如何计算的无偏估计 ρ2ρ2\rho^2。 我看到随着样本数量的增加,固定得分和随机得分之间的区别变得不那么重要了。但是,我试图确认调整后的是用于估计固定分数还是随机分数。R2R2R^2ρ2ρ2\rho^2 问题 调整后的 旨在估计固定分数或随机分数?R2R2R^2ρ2ρ2\rho^2 是否存在关于调整后的r平方的公式与一种或其他形式之间的关系的原则性解释?ρ2ρ2\rho^2 我困惑的背景 当我读殷和范(2001,p.206)时,他们写道: 多元回归模型的基本假设之一是自变量的值是已知常数,并且在实验之前由研究人员确定。只有因变量可以随样本的不同而自由变化。该回归模型称为固定线性回归模型。 但是,在社会科学和行为科学中,研究人员很少固定自变量的值,而且自变量也容易出现随机误差。因此,已经提出了第二种应用回归模型,在该模型中,因变量和自变量都可以变化(Binder,1959; Park&Dudycha,1974)。该模型称为随机模型(或校正模型)。尽管在正态性假设下从随机模型和固定模型获得的回归系数的最大似然估计是相同的,但它们的分布却非常不同。随机模型是如此复杂,以至于需要接受更多的研究才能代替通常使用的固定线性回归模型。因此,通常采用固定模型,即使没有完全满足这些假设(Claudy,1978年)。假设违背固定回归模型的这种应用将导致“过度拟合”,因为从效果不佳的样本数据中引入的随机误差往往会在过程中被大写。结果,以这种方式获得的样本多重相关系数往往会高估真实的人口多重相关(Claudy,1978; Cohen&Cohen,1983; Cummings,1982)。 因此,我不清楚上面的说法是说调整后的补偿了随机模型引入的误差,还是只是在标记该随机模型存在的文件中作了警告,但该论文将专注于固定模型。R2R2R^2 参考文献 Yin,P.,&Fan,X.(2001年)。在多元回归中估计收缩:不同分析方法的比较。实验教育杂志,69(2),203-224。PDF格式R2R2R^2

2
什么是适应性copula?
我的基本问题是:什么是适应性copula? 我有一个来自演示文稿的幻灯片(不幸的是,我不能问幻灯片的作者),关于适应性copulae的问题,我没有明白,这意味着什么。这有什么用? 这是幻灯片: 然后幻灯片继续进行更改点测试。我想知道这是关于什么的,为什么我需要与copulae有关? 幻灯片以自适应估计的参数图结尾: 这似乎表明,我的估计落后了。任何其他解释,评论都将很棒!

3
Rademacher随机变量的乘积和
令是独立随机变量,其值分别为或,概率分别为0.5。考虑和。我希望将概率上限。我现在的最佳界限是,其中c是一个通用常数。这是通过应用简单的Chernoff 边界对概率Pr(| x_1 + \ dots + x_n | &lt;\ sqrt {t})和Pr(| y_1 + \ dots y_n | &lt;\ sqrt {t})进行下限来实现的。我能希望得到比这个界限更好的东西吗?首先,我至少可以得到x1…xa,y1…ybx1…xa,y1…ybx_1 \ldots x_a,y_1 \ldots y_b+1+1+1−1−1-1S=∑i,jxi×yjS=∑i,jxi×yjS = \sum_{i,j} x_i\times y_jP(|S|&gt;t)P(|S|&gt;t)P(|S| > t)2e−ctmax(a,b)2e−ctmax(a,b)2e^{-\frac{ct}{\max(a,b)}}cccPr(|x1+⋯+xn|&lt;t√)Pr(|x1+⋯+xn|&lt;t)Pr(|x_1 + \dots + x_n|<\sqrt{t})Pr(|y1+⋯+yn|&lt;t√)Pr(|y1+⋯+yn|&lt;t)Pr(|y_1 + \dots + y_n|<\sqrt{t})e−ctab√e−ctabe^{-c\frac{t}{\sqrt{ab}}}。如果我可以得到次高斯的尾巴,那可能是最好的,但是我们可以期望吗(我不这样认为,但也不能想到一个论点)?

1
将p值的Monte Carlo模拟应用于卡方检验的规则
我想了解chisq.test()R函数中蒙特卡罗模拟的用法。 我有一个具有128个级别/类的定性变量。我的样本数量为26(我无法对更多的“个人”进行抽样)。所以很明显,我将在某些级别上拥有0个“个人”。但是事实是,在127种可能的类别中,我只代表了非常少的类别。我听说要应用卡方检验,每个级别上至少应有5个人(我不完全了解其原因),我认为我必须使用该simulate.p.value选项来进行蒙特卡洛模拟来估计分布并计算一个p值 没有蒙特卡罗模拟,R给我p值&lt; 1e-16。通过蒙特卡洛模拟,它给了我p值4e-5。 我尝试使用26个1和101个零的向量来计算p值,并且通过蒙特卡洛模拟,得到的p值为1。 是否可以声明,即使我的样本量与可能分类的数量相比很小,观察到的分布也是如此,使得在实际总体中所有可能分类以相同的概率(1/127)存在的可能性很小?

1
预测销售的独特(?)想法
我正在开发模型来预测产品的总销售额。我大约有一年半的预订数据,因此我可以进行标准的时间序列分析。但是,对于每个已关闭或丢失的“机会”(潜在销售),我也有很多数据。“机会”沿着管道的各个阶段进行,直到关闭或丢失为止。他们还具有有关潜在买家,销售人员,互动历史记录,行业,预计预订量等的关联数据。 我的目标是最终预测总预订量,但我想考虑所有有关当前“机会”的信息,这是预订的真正“根本原因”。 我的一个想法是依次使用两个不同的模型,如下所示: 使用历史“机会”构建一个模型,该模型可预测单个“机会”引起的预订量(此步骤中,我可能会使用随机森林或什至是简单的线性回归)。 使用1中的模型来预测当前正在准备中的所有“机会”的估计预订量,然后基于每个“机会”被创建的月份对这些估计值求和。 使用时间序列模型(可能是ARIMA?),使用1.5年的每月历史时间序列数据和该月创建的所有“商机”的预测总预订量(使用1中的模型)。 可以肯定的是,这些机会转化为实际的预订会有滞后,但是时间序列模型应该能够应对滞后。 听起来如何?我已经阅读了很多有关时间序列和预测销售的信息,从我的判断中可以看出,这是一种独特的方法。因此,我非常感谢您的任何反馈!

1
关于方差加权的问题
假设我们要对一个未观察到的实现进行推断 xxx 随机变量 x~x~\tilde x,通常以均值分布 μxμx\mu_x 和方差 σ2xσx2\sigma^2_x。假设还有另一个随机变量y~y〜\tilde y (我们将其未被观察到的实现称为 yyy)的均值正态分布 μyμy\mu_y 和方差 σ2yσy2\sigma^2_y。让σxyσxy\sigma_{xy} 是...的协方差 x~x~\tilde x 和 y~y~\tilde y。 现在假设我们观察到一个信号 xxx, a=x+u~,a=x+u~,\begin{align}a=x+\tilde u,\end{align} 哪里 u~∼N(0,ϕ2x)u~∼N(0,ϕx2)\tilde u\sim\mathcal{N}(0,\phi_x^2),并在 yyy, b=y+v~,b=y+v~,\begin{align}b=y+\tilde v,\end{align} 哪里 v~∼N(0,ϕ2y)v~∼N(0,ϕy2)\tilde v\sim\mathcal{N}(0,\phi_y^2)。假使,假设u~u~\tilde u 和 v~v~\tilde v 是独立的。 的分布是什么 xxx 有条件的 a一个a 和 bbb? 到目前为止,我所知道的是: 使用反方差加权, E(x|a)=1σ2xμx+1ϕ2xa1σ2x+1ϕ2x,E(x|a)=1σx2μx+1ϕx2a1σx2+1ϕx2,\begin{align}\mathbb{E}(x\,|\,a)=\frac{\frac{1}{\sigma_x^2}\mu_x+\frac{1}{\phi_x^2}a}{\frac{1}{\sigma_x^2}+\frac{1}{\phi_x^2}},\end{align} 和 Var(x|a)=11σ2x+1ϕ2x.Var(x|a)=11σx2+1ϕx2.\begin{align} \mathbb{V}\text{ar}(x\,|\,a)=\frac{1}{\frac{1}{\sigma_x^2}+\frac{1}{\phi_x^2}}. …

1
非平方可积函数的蒙特卡洛积分
我希望这是一个正确的地方,如果不是随意将其移至更合适的论坛的话。 我一直想知道如何使用蒙特卡洛积分来处理非平方可积函数。我知道MC仍会给出适当的估计,但对于此类功能,错误是不可靠的(发散的?)。 让我们限制一个维度。蒙特卡洛积分意味着我们近似积分 一世=∫1个0d XF(x )一世=∫01个dXF(X) I = \int_0^1 \mathrm{d}x \, f(x) 使用估计 Ë=1个ñ∑我= 1ñF(X一世)Ë=1个ñ∑一世=1个ñF(X一世) E = \frac{1}{N} \sum_{i=1}^N f(x_i) 与 X一世∈ [ 0 ,1 ]X一世∈[0,1个]x_i \in [0,1]均匀分布的随机点。大数定律确保Ë≈ 我Ë≈一世E \approx I。样本方差 小号2=1个ñ− 1∑我= 1ñ(f(X一世)- Ë)2小号2=1个ñ-1个∑一世=1个ñ(F(X一世)-Ë)2 S^2 = \frac{1}{N-1} \sum_{i=1}^N (f (x_i) - E)^2 近似方差 σ2σ2\sigma^2 引起的分布 FFf。但是,如果FFf 不是平方可积的,即平方函数的积分发散,这意味着 σ2=∫1个0d X(f(x …

1
当某些输入缺少值(NA)时使用randomForest(R)进行预测
我有一个很好的randomForest分类模型,可以在预测新案例类的应用程序中使用。新案例不可避免地缺少价值。预测不适用于NA。那我该怎么办呢? data(iris) # create first the new case with missing values na.row&lt;-45 na.col&lt;-c(3,5) case.na&lt;-iris[na.row,] case.na[,na.col]&lt;-NA iris.rf &lt;- randomForest(Species ~ ., data=iris[-na.row,]) # print(iris.rf) myrf.pred &lt;- predict(iris.rf, case.na[-5], type="response") myrf.pred [1] &lt;NA&gt; 我试过了missForest。我将原始数据和新案例结合在一起missForest,与进行了比较,并在新案例中获得了NA的估算值。虽然计算量太大。 data.imp &lt;- missForest(data.with.na) 但是必须有一种方法可以使用rf-model来预测缺少值的新情况,对吗?

2
找到估计值的方差以求泊松分布的最大似然
如果是参数为 iid泊松分布,则我得出最大似然估计值为用于数据。因此,我们可以定义相应的估计量 我的问题是,您将如何计算此估计量的方差?ķ1个,… ,ķñK1,…,KnK_1, \dots, K_nββ\betaβ^(ķ1个,… ,ķñ)=1个ñ∑我= 1ñķ一世β^(k1,…,kn)=1n∑i=1nki\hat\beta (k_1, \dots, k_n) = \frac{1}{n} \sum_{i=1}^n k_iķ1个,… ,ķñk1,…,knk_1, \dots, k_nŤ=1个ñ∑我= 1ñķ一世。T=1n∑i=1nKi.T = \frac{1}{n} \sum_{i=1}^n K_i . 特别是,当每个遵循参数的泊松分布时,根据泊松的属性,我知道分布将遵循参数的泊松分布,但是是的分布?ķ一世KiK_iββ\beta∑ni=1Ki∑i=1nKi\sum_{i=1}^n K_inβnβn \betaTTT

1
傅里叶/三角插值
背景 在Epstein(1991)的一篇论文中:在从月均值获取每日气候值时,给出了用于计算周期值和偶数值的傅里叶插值的公式和算法。 在本文中,目标是通过插值从每月平均值中获取每日值。 简而言之,假设可以用谐波分量之和表示未知的每日值: 在论文中,(时间)以月表示。ÿ(t )=一个0+∑Ĵ[一个Ĵcos(2 πj t / 12 )+bĴ罪(2 πĴ t / 12 )]ÿ(Ť)=一个0+∑Ĵ[一个Ĵcos⁡(2πĴŤ/12)+bĴ罪⁡(2πĴŤ/12)] y(t) = a_{0} + \sum_{j}\left[a_{j}\,\cos(2\pi jt/12)+b_{j}\,\sin(2\pi jt/12)\right] ŤŤt 经过一些推导,显示出这些项可以通过以下方式计算: 其中表示每月平均值,表示月份。一个0一个ĴbĴ一个6b6=∑ŤÿŤ/ 12= [ (πj / 12 )/罪(πj / 12 )] ×∑Ť[ÿŤcos(2 πĴ Ť/12)/6] j=1,…,5=[(πj/12)/sin(πj/12)]×∑T[YTsin(2πjT/12)/6] j=1,…,5=[(πj/12)/sin(πj/12)]×∑T[YTcos(πT)/12]=0a0=∑TYT/12aj=[(πj/12)/sin⁡(πj/12)]×∑T[YTcos⁡(2πjT/12)/6] j=1,…,5bj=[(πj/12)/sin⁡(πj/12)]×∑T[YTsin⁡(2πjT/12)/6] j=1,…,5a6=[(πj/12)/sin⁡(πj/12)]×∑T[YTcos⁡(πT)/12]b6=0 \begin{align} a_{0} &= \sum_{T}Y_{T}/12 \\ a_{j} &= \left[ …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.