统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


2
ARIMA vs ARMA在不同系列上
在R(2.15.2)中,我在一个时间序列上安装了一次ARIMA(3,1,3),在一次有差异的时间序列上安装了一次ARMA(3,3)。拟合参数不同,这归因于ARIMA中的拟合方法。 同样,无论我使用哪种拟合方法,在与ARMA(3,3)相同的数据上拟合ARIMA(3,0,3)都不会得到相同的参数。 我有兴趣确定差异的出处以及可以使用哪些参数(如果有的话)拟合ARIMA,以获得与ARMA相同的拟合系数。 示例代码演示: library(tseries) set.seed(2) #getting a time series manually x<-c(1,2,1) e<-c(0,0.3,-0.2) n<-45 AR<-c(0.5,-0.4,-0.1) MA<-c(0.4,0.3,-0.2) for(i in 4:n){ tt<-rnorm(1) t<-x[length(x)]+tt+x[i-1]*AR[1]+x[i-2]*AR[2]+x[i-3]*AR[3]+e[i-1]*MA[1]+e[i-2]*MA[2]+e[i-3]*MA[3] x<-c(x,t) e<-c(e,tt) } par(mfrow=c(2,1)) plot(x) plot(diff(x,1)) #fitting different versions. What I would like to get is fit1 with ARIMA() fit1<-arma(diff(x,1,lag=1),c(3,3),include.intercept=F) fit2<-arima(x,c(3,1,3),include.mean=F) fit3<-arima(diff(x,1),c(3,0,3),include.mean=F) fit4<-arima(x,c(3,1,3),method="CSS",include.mean=F) fit5<-arima(diff(x,1),c(3,0,3),method="CSS",include.mean=F) cbind(fit1$coe,fit2$coe,fit3$coe,fit4$coe,fit5$coe) 编辑:使用条件平方和来的很接近,但还不完全是。感谢您对fit1的提示! Edit2:我不认为这是重复的。第2点和第3点解决的问题与我的不同,即使我重写了第1点提到的初始化, fit4<-arima(x,c(3,1,3),method="CSS",include.mean=F,init=fit1$coe) 我仍然得到不同的系数
13 r  time-series  arima  fitting  arma 

1
评估逻辑回归模型
我一直在研究逻辑模型,但在评估结果时遇到了一些困难。我的模型是二项式logit。我的解释变量是:具有15个级别的分类变量,二分变量和2个连续变量。我的N大于8000。 我正在尝试为公司的投资决策建模。因变量是投资(是/否),这15个级别变量是经理报告的不同投资障碍。其余变量是销售,信用和已用容量的控件。 下面是我的结果,使用rmsR中的包。 Model Likelihood Discrimination Rank Discrim. Ratio Test Indexes Indexes Obs 8035 LR chi2 399.83 R2 0.067 C 0.632 1 5306 d.f. 17 g 0.544 Dxy 0.264 2 2729 Pr(> chi2) <0.0001 gr 1.723 gamma 0.266 max |deriv| 6e-09 gp 0.119 tau-a 0.118 Brier 0.213 Coef S.E. Wald …

2
将部分排名列表转换为全局排名
我正在研究以下问题。我有一堆用户和N本书。每个用户都会为他阅读的所有图书(可能是N本书的子集)创建一个有序的排名,例如,Book 1> Book 40> Book 25。 现在,我想将这些个人用户排名转换为所有书籍的单一排序排名。 是否有任何好的或标准的方法可以尝试?到目前为止,我正在考虑将Bradley-Terry模型应用于成对比较,但是我想知道是否还有其他功能。

2
选择将组分开的PCA组件
我经常使用PCA诊断我的多元数据(具有数十万个变量和数十个或数百个样本的组学数据)。数据通常来自具有定义某些组的几个类别自变量的实验,在找到能够显示感兴趣的组之间分离的组件之前,我经常必须经过几个组件。我想出了一种相当原始的方式来找到这种可区分的组件,我想知道 在何种程度上是合理/合理的,并且 是否有更好的方法可以达到相同目的。 请注意,这是探索性的。在说服别人之前,我想说服自己。如果我发现有一些组件可以清楚地区分感兴趣的组(例如,控制组与治疗组),即使它们是响应方差的一小部分,则我更相信它,而不是受监督机器的结果学习。 这是我的方法。我将使用R中pca3d的“ metabo”示例数据集。 这个想法是评估独立变量可以解释每个分量有多少差异。为此,我为每个组件计算一个简单模型,并使用作为度量标准,以将组件从“最有趣”到“最不有趣”进行排序。R2R2R^2 require( pca3d ) # data on metabolic profiles of TB patients and controls data( metabo ) # first column is the independent variable pca <- prcomp( metabo[,-1], scale.= T ) # create a model for each component lm.m <- lm( pca$x ~ metabo[,1] …

2
两个普通乘积之和是拉普拉斯?
它显然是的情况下,如果X一世〜ñ(0 ,1 )Xi∼N(0,1)X_i \sim N(0,1),然后 X1个X2+ X3X4〜大号一个p 升一Ç ë (0 ,1 )X1X2+X3X4∼Laplace(0,1)X_1 X_2 + X_3 X_4 \sim \mathrm{Laplace(0,1)} 我看过关于任意二次形式的论文,这些总是导致可怕的非中心卡方表达式。 上面的简单关系对我来说似乎一点都不明显,所以(如果是真的!)有人能简单证明上面的关系吗?

1
哈密​​顿量蒙特卡洛和离散参数空间
我刚刚开始在stan中建立模型;为了熟悉该工具,我正在完成贝叶斯数据分析(第二版)中的一些练习。所述沃特伯克锻炼设该数据,与(Ñ ,θ )是未知的。由于汉密尔顿蒙特卡洛法令不允许离散参数,因此我已将N声明为实数∈ [ 72 ,∞ ),并使用该函数对实值二项式分布进行了编码。Ñ 〜二项式(Ñ,θ )n∼binomial(N,θ)n \sim \text{binomial}(N, \theta)(N,θ )(N,θ)(N, \theta)ñNN∈ [ 72 ,∞ )∈[72,∞)\in [72, \infty)lbeta 结果的直方图看起来与我直接计算后验密度所发现的结果几乎相同。但是,我担心可能有些微妙的原因使我总体上不相信这些结果。由于对的实值推论为非整数值分配了正概率,因此我们知道这些值是不可能的,因为分数Waterbuck实际上并不存在。另一方面,结果似乎很好,因此在这种情况下,简化似乎对推理没有影响。ñNN 是否有任何以这种方式进行建模的指导原则或经验法则,或者这种将离散参数“提升”为实际不良做法的方法?

2
摘要.glm()中的分散
我进行了glm.nb glm1<-glm.nb(x~factor(group)) 其中group为类别,x为度量变量。当我尝试获取结果摘要时,根据是否使用summary()或,我会得到略有不同的结果summary.glm。summary(glm1)给我 ... Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 0.1044 0.1519 0.687 0.4921 factor(gruppe)2 0.1580 0.2117 0.746 0.4555 factor(gruppe)3 0.3531 0.2085 1.693 0.0904 . --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1 (Dispersion parameter for Negative Binomial(0.7109) family taken to …

4
auto.arima()是否识别出模型?
我一直在尝试学习和应用ARIMA模型。我一直在阅读Pankratz撰写的关于ARIMA的精彩文章- 使用单变量Box-Jenkins模型进行预测:概念和案例。在本文中,作者在选择ARIMA模型时特别强调了简约原则。 我开始使用R包预测中的auto.arima()函数。这是我所做的,我模拟了ARIMA,然后应用。以下是两个示例。正如您在两个示例中看到的那样,清楚地确定了许多人认为不简约的模型。尤其是在示例2中,在该示例中标识ARIMA(3,0,3)的时间实际上是ARIMA(1,0,1)就足够了,而且是简约的。auto.arima()auto.arima()auto.arima() 以下是我的问题。我将不胜感激任何建议。 是否有关于何时使用/修改通过自动算法识别的模型的指南auto.arima()? 仅使用AIC(我认为auto.arima()使用)来识别模型是否有任何困难? 可以建立一个简约的自动算法吗? 顺便说一下,我auto.arima()只是作为一个例子。这将适用于任何自动算法。 以下是示例1: set.seed(182) y <- arima.sim(n=500,list(ar=0.2,ma=0.6),mean = 10) auto.arima(y) qa <- arima(y,order=c(1,0,1)) qa 以下是的结果auto.arima()。请注意,所有系数都不重要。即值<2。Ťtt ARIMA(1,0,2) with non-zero mean Coefficients: ar1 ma1 ma2 intercept 0.5395 0.2109 -0.3385 19.9850 s.e. 0.4062 0.4160 0.3049 0.0878 sigma^2 estimated as 1.076: log likelihood=-728.14 AIC=1466.28 AICc=1466.41 BIC=1487.36 以下是arima()使用ARIMA(1,0,1)顺序常规运行的结果 Series: …


3
ARMA(2,1)过程的自协方差
我需要为ARMA(2,1)进程的自协方差函数导出解析表达式,γ(k)γ(k)\gamma\left(k\right)表示为: yt=ϕ1yt−1+ϕ2yt−2+θ1ϵt−1+ϵtyt=ϕ1yt−1+ϕ2yt−2+θ1ϵt−1+ϵty_t=\phi_1y_{t-1}+\phi_2y_{t-2}+\theta_1\epsilon_{t-1}+\epsilon_t 因此,我知道: γ(k)=E[yt,yt−k]γ(k)=E[yt,yt−k]\gamma\left(k\right) = \mathrm{E}\left[y_t,y_{t-k}\right] 所以我可以写: γ(k)=ϕ1E[yt−1yt−k]+ϕ2E[yt−2yt−k]+θ1E[ϵt−1yt−k]+E[ϵtyt−k]γ(k)=ϕ1E[yt−1yt−k]+ϕ2E[yt−2yt−k]+θ1E[ϵt−1yt−k]+E[ϵtyt−k]\gamma\left(k\right) = \phi_1 \mathrm{E}\left[y_{t-1}y_{t-k}\right]+\phi_2 \mathrm{E}\left[y_{t-2}y_{t-k}\right]+\theta_1 \mathrm{E}\left[\epsilon_{t-1}y_{t-k}\right]+\mathrm{E}\left[\epsilon_{t}y_{t-k}\right] 然后,要导出自协方差函数的解析版本,我需要替换kkk -0、1、2 ...的值,直到获得对大于某个整数的所有有效的递归kkk。 因此,我将k=0k=0k=0并通过计算得出: γ(0)=E[yt,yt]=ϕ1E[yt−1yt]+ϕ2E[yt−2yt]+θ1E[ϵt−1yt]+E[ϵtyt]γ(0)=E[yt,yt]=ϕ1E[yt−1yt]+ϕ2E[yt−2yt]+θ1E[ϵt−1yt]+E[ϵtyt] \gamma \left(0\right) = \mathrm{E}\left[y_t,y_t\right] = \phi_1 \mathrm{E}\left[y_{t-1}y_t\right] + \phi_2 \mathrm{E}\left[y_{t-2}y_t\right]+\theta_1 \mathrm{E}\left[\epsilon_{t-1}y_t\right]+\mathrm{E}\left[\epsilon_ty_t\right]\\ 现在,我可以简化这些术语的前两个,然后像以前一样替换:ytyty_t γ(0)=ϕ1γ(1)+ϕ2γ(2)+θ1E[ϵt−1(ϕ1yt−1+ϕ2yt−2+θ1ϵt−1+ϵt)]+E[ϵt(ϕ1yt−1+ϕ2yt−2+θ1ϵt−1+ϵt)]γ(0)=ϕ1γ(1)+ϕ2γ(2)+θ1E[ϵt−1(ϕ1yt−1+ϕ2yt−2+θ1ϵt−1+ϵt)]+E[ϵt(ϕ1yt−1+ϕ2yt−2+θ1ϵt−1+ϵt)] \gamma\left(0\right) = \phi_1 \gamma\left(1\right) + \phi_2 \gamma\left(2\right)\\ + \theta_1 \mathrm{E}\left[\epsilon_{t-1} \left(\phi_1 y_{t-1} +\phi_2 y_{t-2} +\theta_1 \epsilon_{t-1} + \epsilon_t \right)\right]\\ …

2
具有异方差测量误差的AR(1)过程
1.问题 我对变量进行了一些测量,其中,我通过MCMC获得了分布,为简单起见,我将其假设为均值的高斯和方差。ytyty_tt=1,2,..,nt=1,2,..,nt=1,2,..,nfyt(yt)fyt(yt)f_{y_t}(y_t)μtμt\mu_tσ2tσt2\sigma_t^2 对于这些观察,我有一个物理模型,例如,但是残差似乎是相关的;特别是,我有物理上的理由认为流程足以考虑相关性,因此我计划通过MCMC获得拟合系数,为此我需要可能性。我认为解决方案很简单,但是我不太确定(它看起来很简单,以至于我遗漏了一些东西)。g(t)g(t)g(t)rt=μt−g(t)rt=μt−g(t)r_t = \mu_t-g(t)AR(1)AR(1)AR(1) 2.推导可能性 零均值流程可写为: 其中,我假设。因此,要估计的参数为(在我的情况下,我还必须添加模型的参数,但这不是问题)。但是,我观察到的是变量 ,其中我假设和是已知的(测量误差)。因为是高斯过程,所以也是。我特别知道 X 吨 = φ X 吨- 1 + ε 吨,(1 )ε 吨〜Ñ (0 ,σ 2 瓦特)θ = { φ ,σ 2 瓦特 } 克(吨)- [R 吨 = X 吨 + η 吨,(2 )η 吨〜ñ (AR(1)AR(1)AR(1)Xt=ϕXt−1+εt, (1)Xt=ϕXt−1+εt, (1)X_t = \phi X_{t-1}+\varepsilon_t,\ \ …



2
多类感知器如何工作?
我没有数学背景,但是我了解简单的Perceptron的工作原理,并且我认为我掌握了超平面的概念(我想像它是3D空间中的一个平面,它将两个点云分开,就像一条线分开一样2D空间中的两个点云)。 但是我不明白一架飞机或一条直线如何分别在3D空间或2D空间中分隔三个不同的点云–从几何上讲这是不可能的,是吗? 我试图理解Wikipedia文章中的相应部分,但是在句子“这里,输入x和输出y是从任意集合中提取”时,已经惨遭失败。有人可以向我解释多类感知器,以及它与超平面的想法如何结合,还是可以向我指出一个不太数学的解释?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.