统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
何时通过最小化AIC选择型号?
公认的是,至少在某些较高水平的统计学家中,具有AIC统计值在最小值某个阈值内的模型应被认为是使AIC统计量最小的模型是适当的。例如,在[1,第221页]中,我们发现 然后,具有较小GCV或AIC的模型将被认为是最好的。当然,不应仅仅盲目地将GCV或AIC最小化。而是,应将所有具有较小GCV或AIC值的模型视为潜在适当模型,并应根据其简单性和科学相关性对其进行评估。 同样,在[2,p.144]中, 有人建议(Duong,1984年),将AIC值设在最小值c之内的模型应认为具有竞争力(c = 2为典型值)。然后可以基于诸如残差的白度(第5.3节)和模型简单性等因素从竞争模型中进行选择。 参考文献: 鲁珀特,D .;Wand,MP和Carrol,RJ 半参数回归,剑桥大学出版社,2003年 Brockwell,PJ和Davis,RA 时间序列和预测简介,John Wiley&Sons,1996年 因此,鉴于以上所述,以下两个模型中的哪一个应该是首选? print( lh300 <- arima(lh, order=c(3,0,0)) ) # ... sigma^2 estimated as 0.1787: log likelihood = -27.09, aic = 64.18 print( lh100 <- arima(lh, order=c(1,0,0)) ) # ... sigma^2 estimated as 0.1975: log likelihood = -29.38, aic …


1
联合MGF独立的充要条件
假设我有一个联合矩生成函数用于CDF的联合分布。是两个必要的和足够的用于独立条件和?我检查了几本教科书,只提到了必要性:MX,Y(s,t)MX,Y(s,t)M_{X,Y}(s,t)FX,Y(x,y)FX,Y(x,y)F_{X,Y}(x,y)MX,Y(s,t)=MX,Y(s,0)⋅MX,Y(0,t)MX,Y(s,t)=MX,Y(s,0)⋅MX,Y(0,t)M_{X,Y}(s,t)=M_{X,Y}(s,0)⋅M_{X,Y}(0,t)XXXYYY FX,Y(x,y)=FX(x)⋅FY(y)⟹MX,Y(s,t)=MX(s)⋅MY(t)FX,Y(x,y)=FX(x)⋅FY(y)⟹MX,Y(s,t)=MX(s)⋅MY(t)F_{X,Y}(x,y)=F_X(x)\cdot F_Y(y) \implies M_{X,Y}(s,t)=M_X(s) \cdot M_Y(t) 该结果很明显,因为独立性意味着。由于边际的MGF由联合MGF决定,我们具有:MX,Y(s,t)=E(esX+tY)=E(esX)E(etY)MX,Y(s,t)=E(esX+tY)=E(esX)E(etY)M_{X,Y}(s,t)=\mathbb{E}(e^{sX+tY})=\mathbb{E}(e^{sX}) \mathbb{E}(e^{tY}) X,Y independent⟹MX,Y(s,t)=MX,Y(s,0)⋅MX,Y(0,t)X,Y independent⟹MX,Y(s,t)=MX,Y(s,0)⋅MX,Y(0,t)X,Y\text{ independent} \implies M_{X,Y}(s,t)=M_{X,Y}(s,0)⋅M_{X,Y}(0,t) 但是在网上搜索后,我发现相反的情况只是短暂的参考,没有证据。以下草图证明可行吗? 给定联合MGF,这唯一地确定和及其MGF 的边际分布, 和。仅边际与许多其他可能的联合分布兼容,并且唯一地确定和独立的联合分布,其中CDF和MGF:MX,Y(s,t)MX,Y(s,t)M_{X,Y}(s,t)XXXYYYMX(s)=MX,Y(s,0)MX(s)=MX,Y(s,0)M_X(s)=M_{X,Y}(s,0)MY(t)=MX,Y(0,t)MY(t)=MX,Y(0,t)M_Y(t)=M_{X,Y}(0,t)XXXYYYFindX,Y(x,y)=FX(x)⋅FY(y)FX,Yind(x,y)=FX(x)⋅FY(y)F_{X,Y}^{\text{ind}}(x,y)=F_X(x) \cdot F_Y(y) MindX,Y(s,t)=MX(s)⋅MY(t)=MX,Y(s,0)⋅MX,Y(0,t)MX,Yind(s,t)=MX(s)⋅MY(t)=MX,Y(s,0)⋅MX,Y(0,t)M_{X,Y}^{\text{ind}}(s,t) = M_X(s) \cdot M_Y(t) = M_{X,Y}(s,0)⋅M_{X,Y}(0,t) 因此,如果我们得到原始MGF的,则为足以显示。然后根据MGF的唯一性,我们原始的联合分布为和和是独立的。MX,Y(s,t)=MX,Y(s,0)⋅MX,Y(0,t)MX,Y(s,t)=MX,Y(s,0)⋅MX,Y(0,t)M_{X,Y}(s,t) = M_{X,Y}(s,0)⋅M_{X,Y}(0,t)MX,Y(s,t)=MindX,Y(s,t)MX,Y(s,t)=MX,Yind(s,t)M_{X,Y}(s,t) = M_{X,Y}^{\text{ind}}(s,t)FX,Y(x,y)=FindX,Y(x,y)=FX(x)⋅FY(y)FX,Y(x,y)=FX,Yind(x,y)=FX(x)⋅FY(y)F_{X,Y}(x,y) = F_{X,Y}^{\text{ind}}(x,y) = F_X(x) \cdot F_Y(y)XXXYYY

4
比较最大似然估计(MLE)和贝叶斯定理
在贝叶斯定理中,,从我正在阅读的书中,称为可能性,但我认为这只是给定时的条件概率,对吗? p(x|y)p(y|x)=p(x|y)p(y)p(x)p(y|x)=p(x|y)p(y)p(x)p(y|x) = \frac{p(x|y)p(y)}{p(x)}p(x|y)p(x|y)p(x|y)ÿxxxyyy 在最大似然估计试图最大化,对不对?如果是这样,我很困惑,因为都是随机变量,对吗?为了最大限度地提高只是找出了?还有一个问题,如果这两个随机变量是独立的,则只是,对吗?然后,最大化就是最大化。x ,y p (x | y )p(x|y)p(x|y)p(x|y)x,yx,yx,yp(x|y)p(x|y)p(x|y) p(X|Ý)p(X)p(X|Ý)p(X)y^y^\hat yp(x|y)p(x|y)p(x|y)p(x)p(x)p(x)p(x|y)p(x|y)p(x|y)p(x)p(x)p(x) 也许是某些参数的函数,即,而MLE试图找到可以最大化的?或者甚至实际上是模型的参数,而不是随机变量,因此最大化可能性是找到?θ p (X | Ý ; θ )θ p (X | Ý )ÿ ÿp(x|y)p(x|y)p(x|y)θθ\thetap (x | y; θ )p(x|y;θ)p(x|y; \theta)θθ\thetap (x | y)p(x|y)p(x|y)ÿyyÿ^y^\hat y 更新 我是机器学习的新手,这个问题与我从机器学习教程中读到的内容相混淆。在这里,给定观察到的数据集,目标值为,我尝试在该数据集上拟合模型,所以我假设给定,具有一种分布形式由参数化,即,并且我假设这是后验概率,对吗?{ ÿ 1,ÿ 2,。。。,ÿ Ñ } X ý W¯¯ θ p (Ý …

3
基于数据不确定度计算线性回归斜率的不确定度
如何基于数据不确定性(可能在Excel / Mathematica中)计算线性回归斜率的不确定性? 示例: 让我们有数据点(0,0),(1,2),(2,4),(3,6),(4,8),...(8、16),但是每个y值都有不确定性为4。我发现,大多数函数会将不确定性计算为0,因为这些点与函数y = 2x完全匹配。但是,如图所示,y = x / 2也与这些点匹配。这是一个夸张的例子,但我希望它能说明我的需求。 编辑:如果我尝试解释更多,而示例中的每个点都有y的某个值,我们假装不知道这是真的。例如,第一个点(0,0)实际上可以是(0,6)或(0,-6)或介于两者之间的任何值。我要问的是,在任何流行的问题中都没有考虑到这一点的算法。在示例中,点(0,6),(1,6.5),(2,7),(3,7.5),(4,8),...(8、10)仍落在不确定性范围内,因此它们可能是正确的点,并且连接这些点的线具有一个方程:y = x / 2 + 6,而我们通过不考虑不确定性而得到的方程为:y = 2x +0。因此,k的不确定性是1,5,而n是6。 TL; DR:在图片中,有一条y = 2x线是使用最小二乘拟合计算得出的,并且可以完美拟合数据。我试图找出y = kx + n中的k和n可以改变多少,但是如果我们知道y值的不确定性,仍然可以拟合数据。在我的示例中,k的不确定度为1.5,n的不确定度为6。在图像中,有“最佳”拟合线和一条刚好适合这些点的线。

2
拟合曲线时,如何计算拟合参数的95%置信区间?
我正在为数据拟合曲线以提取一个参数。但是,我不确定该参数的确定性以及如何计算/表示其%置信区间。959595 假设数据集包含指数衰减的数据,我将曲线拟合到每个数据集。那么我要提取的信息就是指数。我知道的值ŧ和价值一,我没有兴趣的(那是来自人口变量,而不是过程我试着去模型)。bbbtttaaa 我使用非线性回归来拟合这些参数。但是,我不知道如何为任何方法计算%置信区间,因此也欢迎使用更广泛的答案。959595 f=a⋅e−btf=a⋅e−btf= a\cdot e^{-bt} 获得值后,如何计算其95%的置信区间?提前致谢!bbb959595

4
为什么在实际应用中根本不考虑采样而不更换采样?
如我所见,带替换的采样比不带替换的采样有两个优点: 1)您不必担心有限的人口校正。 2)有机会多次绘制总体中的元素-然后您可以循环使用测量并节省时间。 当然,从学术观点出发,必须研究这两种方法。但是从实际的POV来看,鉴于替换的优势,我不明白为什么不考虑不替换就进行采样。 但是我是统计学的初学者,因此可能有很多充分的理由说明为什么不进行替换可能是更好的选择-至少对于特定用例而言。拜托,让我困惑!

4
大数据假设检验
您如何对大数据进行假设检验?我写了以下MATLAB脚本来强调我的困惑。它所做的只是生成两个随机序列,并对另一个变量进行简单的线性回归。它使用不同的随机值多次执行此回归,并报告平均值。趋向于发生的是,随着我增加样本数量,平均p值变得很小。 我知道,由于测试的功效随样本数量的增加而增加,因此,给定足够大的样本,即使使用随机数据,p值也将变得足够小,以拒绝任何假设检验。我四处询问,有人说,“大数据”对效果大小的影响更为重要。测试是否显着并且影响足够大,我们需要关注。这是因为在大样本的p值将挑选的非常小的差异时,就像是解释在这里。 但是,效果大小可以通过缩放数据来确定。在下面,我将解释变量缩放到足够小的大小,从而在给定足够大的样本量的情况下,它对因变量产生了重大影响。 所以我想知道,如果存在这些问题,我们如何从大数据中获得任何见解? %make average %decide from how many values to make average obs_inside_average = 100; %make average counter average_count = 1; for average_i = 1:obs_inside_average, %do regression loop %number of observations n = 1000; %first independent variable (constant term) x(1:10,1) = 1; %create dependent variable and the one …

2
满足详细平衡的MCMC是否会产生固定分布?
我想我了解详细的平衡条件的方程,该方程表明对于转移概率和平稳分布π,如果q (x | y )π (y )= q (y | x )π (X ),qqqππ\piq(x | y)π(y)= q(y| x)π(x ),q(x|y)π(y)=q(y|x)π(x),q(x|y)\pi(y)=q(y|x)\pi(x), 如果我将其重述为: q(x | y)q(y| X)= π(x )π(y)。q(x|y)q(y|x)=π(x)π(y).\frac{q(x|y)}{q(y|x)}= \frac{\pi(x)}{\pi(y)}. 基本上,从状态转换到状态y的概率应与它们的概率密度之比成正比。Xxxÿyy

2
为什么在完全分散的点模式中,Moran的I不等于“ -1”
维基百科是错的...还是我听不懂? 维基百科:白色和黑色正方形(“象棋图案”)完全分散,因此莫兰的I为-1。如果将白色方块堆叠到板子的一半,将黑色方块堆叠到板子的另一半,则莫兰的I将接近+1。正方形颜色的随机排列将使Moran's I的值接近于0。 # Example data: x_coor<-rep(c(1:8), each=8) y_coor<-rep(c(1:8), length=64) my.values<-rep(c(1,0,1,0,1,0,1,0,0,1,0,1,0,1,0,1), length=64) rbPal <- colorRampPalette(c("darkorchid","darkorange")) my.Col <- rbPal(10)[as.numeric(cut(my.values,breaks = 10))] # plot the point pattern... plot(y_coor,x_coor,col = my.Col, pch=20, cex=8, xlim=c(0,9),ylim=c(0,9)) 如您所见,点完全分散 # Distance matrix my.dists <- as.matrix(dist(cbind(x_coor,y_coor))) # ...inversed distance matrix my.dists.inv <- 1/my.dists # diagonals are "0" diag(my.dists.inv) …

1
指数随机变量可达到的相关性
一对指数分布的随机变量和的可达到相关性的范围是多少,其中为速率参数?X1∼Exp(λ1)X1∼Exp(λ1)X_1 \sim {\rm Exp}(\lambda_1)X2∼Exp(λ2)X2∼Exp(λ2)X_2 \sim {\rm Exp}(\lambda_2)λ1,λ2>0λ1,λ2>0\lambda_1, \lambda_2 > 0

3
什么是二阶平稳过程?
我想知道在Brockwell和Davis的《时间序列和预测简介》中如何定义他的“二阶平稳过程” : 线性时间序列模型的类别(包括自回归移动平均(ARMA)模型的类别)为研究平稳过程提供了一个通用框架。实际上,每个二阶平稳过程要么是线性过程,要么可以通过减去确定性分量而转换为线性过程。这个结果称为Wold分解,将在2.6节中讨论。 在Wikipedia中, 当严格平稳性的要求仅应用于时间序列中的随机变量对时,便出现了二阶平稳性。 但是我认为这本书与Wikipedia有不同的定义,因为该书使用平稳性是广义的平稳性,而Wikipedia使用平稳性是严格的平稳性。 感谢致敬!

2
每天,每周和每年定期预测每小时时间序列
主要编辑:到目前为止,我要非常感谢Dave&Nick的回答。好消息是我开始工作了(原理是从海德曼教授的批量预测职位上借来的)。合并未完成的查询: a)如何增加auto.arima的最大迭代次数-似乎在有大量外生变量的情况下,auto.arima在达到最终模型之前达到了最大迭代次数。如果我误解了,请纠正我。 b)来自尼克的一个答案强调,我对小时间隔的预测仅从这些小时间隔中得出,不受当天早些时候发生的事件的影响。我的直觉来自于处理这些数据,告诉我这通常不会引起重大问题,但是我愿意就如何处理这些问题提出建议。 c)Dave指出,我需要一种更为复杂的方法来识别我的预测变量周围的提前/滞后时间。是否有人在R中使用编程方法有经验?我当然希望会有局限性,但是我想尽我最大的努力来开展这个项目,我毫不怀疑这也一定会对其他人有用。 d)新查询但与手头任务完全相关-选择订单时auto.arima是否考虑回归因素? 我正在尝试预测商店的造访。我要求能够考虑到假期,leap年和零星事件(主要是离群值);在此基础上,我发现ARIMAX是我最好的选择,它使用外生变量尝试对多个季节以及上述因素进行建模。 每小时24小时记录一次数据。事实证明这是有问题的,因为我的数据中有零个数字,尤其是在一天中访问量很少的时间,有时甚至在商店刚开业时根本没有访问量。而且,营业时间相对不稳定。 而且,将一个完整的时间序列作为一个具有3年以上历史数据的时间序列进行预测时,计算时间非常庞大。我认为通过将一天中的每个小时作为单独的时间序列进行计算,可以使其速度更快,并且在一天中较忙的时间进行测试似乎可以产生更高的准确性,但事实又证明,早/晚时间的问题是持续访问。我相信使用auto.arima将使过程受益,但是在达到最大迭代次数之前(因此使用手动拟合和maxit子句),它似乎无法收敛于模型。 我曾尝试通过创建一个当访问量= 0时的外生变量来处理“丢失”数据。同样,这对于一天中繁忙的时间(当唯一的无人访问时间是商店关门时)非常有用。在这些情况下,外生变量似乎可以成功地处理此问题,从而进行前瞻性预测,并且不包括前一天关闭的影响。但是,我不确定如何使用此原理来预测商店开张但并不总是会造访的安静时间。 在Hyndman教授关于R中的批量预测的帖子的帮助下,我试图建立一个循环来预测24系列,但它似乎不想从下午1点开始进行预测,也无法弄清原因。我得到“ optim中的错误(init [mask],armafn,method = optim.method,hessian = TRUE ::非有限有限差分值[1]”),但是由于所有系列的长度均相等,因此我基本上在使用同一矩阵,我不明白为什么会这样,这意味着矩阵不是全等级的,不是吗,如何用这种方法避免这种情况? https://www.dropbox.com/s/26ov3xp4ayig4ws/Data.zip date() #Read input files INPUT <- read.csv("Input.csv") XREGFDATA <- read.csv("xreg.csv") #Subset time series data from the input file TS <- ts(INPUT[,2:25], f=7) fcast <- matrix(0, nrow=nrow(XREGFDATA),ncol=ncol(TS)) #Create matrix of exogenous variables …

2
异方差和残差正态性
我猜想我有一个很好的线性回归(这是用于大学项目的,因此我并不一定要非常准确)。 关键是,如果我绘制残差与预测值的关系图,(根据我的老师的话)会有异方差的迹象。 但是,如果我绘制残差的QQ图,则很明显它们是正态分布的。此外,残差的Shapiro检验的值为,因此我认为毫无疑问,残差实际上是正态分布的。ppp0.80.80.8 问题:如果残差呈正态分布,预测值怎么会有异方差?

1
检验vs检验?
我正试图弄清楚检验和检验之间的区别。Ťttžzz 据我所知,对于这两种测试,都使用相同的测试统计量,其形式如下 b^− CSEˆ(b^)b^-CSE^(b^)\frac{\hat{b} - C}{\widehat{\operatorname{se}}(\hat{b})} 其中是一些样本统计信息,是某个参考(位置)常量(取决于测试的详细信息),而是标准错误。b^b^\hat{b}CCCSEˆ(b^)SE^(b^)\widehat{\operatorname{se}}(\hat{b})b^b^\hat{b} 那么,这两类测试之间的唯一区别是,在检验的情况下,上面的检验统计量遵循(对于某些样本确定的自由度),而在检验,相同的检验统计量遵循标准正态分布。(这反过来表明,选择检验还是检验取决于样本是否足够大。)ŤŤtŤŤtdddžžzñ(0 ,1 )ñ(0,1个)\mathcal{N}(0, 1)žžzŤŤt 这个对吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.