统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
为什么我的VAR模型在非平稳数据上比固定数据能更好地工作?
我正在使用python的statsmodels VAR库为财务时间序列数据建模,有些结果令我感到困惑。我知道VAR模型假设时间序列数据是固定的。我无意中拟合了两种不同证券的非平稳对数价格对数,并且令人惊讶的是,拟合值和样本内预测在相对微不足道的固定残差下非常准确。样本内预测的为99%,预测残差系列的标准偏差为预测值的10%左右。[R2[R2R^2 但是,当我改变对数价格并将该时间序列拟合到VAR模型时,拟合值和预测值相差甚远,在均值附近处于狭窄范围内。结果,残差在预测对数收益方面比拟合值做得更好,预测残差的标准偏差比拟合数据系列大15倍,而预测序列的.007值。[R2[R2R^2 我是否会误解VAR模型上的拟合残差与其他残差?为什么非平稳时间序列会比基于相同基础数据的平稳时间序列产生更准确的预测?我在同一个python库中使用ARMA模型进行了很好的工作,却看不到像对单个系列数据建模那样的东西。


1
SVM类型之间的差异
我是新来支持向量机的人。 简短说明 R中svm的e1071软件包中的函数提供了多种选项: C分类 nu分类 一类(用于新颖性检测) eps回归 回归 这五种类型之间的直观区别是什么?在哪种情况下应使用哪一个?



2
是否允许对数据集使用平均值来改善相关性?
我有一个具有因变量和自变量的数据集。两者都不是时间序列。我有120个观察结果。相关系数为0.43 经过此计算后,我为两个变量添加了一个列,每12个观察值的平均值,结果得到2个新列,包含108个观察值(对)。这些列的相关系数为0.77 看来我以这种方式改善了相关性。可以这样做吗?我是否通过使用平均值提高了自变量的解释能力?

2
了解此PCA冰淇淋销售量与温度的关系图
我正在获取温度与冰淇淋销售的虚拟数据,并使用K均值(n个群集= 2)将其分类以区分2类(完全虚拟)。 现在,我正在对此数据进行主成分分析,我的目标是了解我所看到的。我知道PCA的目的是减少尺寸(显然不是在这种情况下)并显示元素的变化。但是,您如何阅读下面的PCA图,即在PCA图中您可以讲述温度与冰淇淋的故事?第一(X)和第二(Y)PC是什么意思?

2
Markov,Chebyshev不等式严密的随机变量
我对构造Markov或Chebyshev不等式严密的随机变量感兴趣。 一个简单的示例是以下随机变量。 。其均值为0,方差为1,并且 P (| X | ≥ 1 )= 1。对于这个随机变量,chebyshev是紧的(保持相等)。P(X= 1 )=P(X=−1)=0.5P(X=1)=P(X=−1)=0.5P(X=1)=P(X=-1) = 0.5P(|X|≥1)=1P(|X|≥1)=1P(|X| \ge 1) = 1 P(|X|≥1)≤Var(X)12=1P(|X|≥1)≤Var(X)12=1P(|X|\ge 1) \le \frac{\text{Var}(X)}{1^2} = 1 是否存在马尔可夫和切比雪夫紧的其他有趣(非均匀)随机变量?一些例子将是很好的。


1
贝叶斯在线变更点检测(边际预测分布)
我正在阅读Adams和MacKay 的贝叶斯在线变更点检测论文(链接)。 作者从写边际预测分布开始: 其中P(xt+1|x1:t)=∑rtP(xt+1|rt,x(r)t)P(rt|x1:t)(1)P(xt+1|x1:t)=∑rtP(xt+1|rt,xt(r))P(rt|x1:t)(1) P(x_{t+1} | \textbf{x}_{1:t}) = \sum_{r_t} P(x_{t+1} | r_t, \textbf{x}_t^{(r)}) P(r_t | \textbf{x}_{1:t}) \qquad \qquad (1) xtxtx_t是在时间的观测;ttt x1:tx1:t\textbf{x}_{1:t}表示直到时间的观测;ttt rt∈Nrt∈Nr_t \in \mathbb{N}是当前游程长度(自上一个更改点以来的时间,可以为0);和 x(r)txt(r)\textbf{x}_t^{(r)}是与运行相关的观察值集合。rtrtr_t 等式 1在形式上是正确的(请参阅下面@JuhoKokkala的回复),但是我的理解是,如果您想对进行实际预测,则需要将其扩展如下:xt+1xt+1x_{t+1} P(xt+1|x1:t)=∑rt,rt+1P(xt+1|rt+1,x(r)t)P(rt|x1:t)P(rt+1|rt)(1b)P(xt+1|x1:t)=∑rt,rt+1P(xt+1|rt+1,xt(r))P(rt|x1:t)P(rt+1|rt)(1b) P(x_{t+1} | \textbf{x}_{1:t}) = \sum_{r_t, r_{t+1}} P(x_{t+1} | r_{t+1}, \textbf{x}_t^{(r)}) P(r_t | \textbf{x}_{1:t}) P(r_{t+1} | r_t) \qquad (1\text{b}) 我的理由是,(未来)时间t + 1可能会有一个变化点t+1t+1t+1,但后验P(rt|x1:t)P(rt|x1:t)P(r_t | …

2
从“均匀间隔”的样本开始在单位磁盘上进行回归
我需要解决单位磁盘上的一个复杂的回归问题。最初的问题吸引了一些有趣的评论,但不幸的是没有答案。同时,我学到了更多有关此问题的知识,因此,我将尝试将原始问题分解为子问题,并查看这次是否运气更好。 我有40个温度传感器,它们定期以单位圆盘内的窄环间隔开: 这些传感器会及时获取温度。但是,由于时间变化远小于空间变化,因此我们通过忽略时间变化来简化问题,并假设每个传感器只给我一个时间平均值。这意味着我有40个样本(每个传感器一个),并且没有重复的样本。 我想根据传感器数据建立回归曲面。回归有两个目标:Ť= f(ρ ,θ )+ ϵT=f(ρ,θ)+ϵT=f(\rho,\theta)+\epsilon 我需要估算平均径向温度曲线。通过线性回归,我已经估算出了一个表面,该表面是平均温度表面,因此,我只需要针对积分我的表面,对吗?如果我使用多项式进行回归,那么这一步应该是小菜一碟。θŤ米Ë 一个Ñ= 克1个(ρ )+ ϵTmean=g1(ρ)+ϵT_{mean}=g_1(\rho)+\epsilonθθ\theta 我需要估算径向温度曲线,这样在每个径向位置。P (Ť (ρ )&lt; Ť 95(ρ ))= 0.95Ť95= 克2(ρ )+ ϵT95=g2(ρ)+ϵT_{95}=g_2(\rho)+\epsilonP(T(ρ )&lt; T95(ρ ))= 0.95P(T(ρ)&lt;T95(ρ))=.95P(T(\rho)<T_{95}(\rho))=.95 给定这两个目标,我应该使用哪种技术对单位磁盘进行回归?当然,高斯过程通常用于空间回归。但是,为单位磁盘定义一个好的内核并不是一件容易的事,因此,我想保持简单并使用多项式,除非您认为这是一个失败的策略。我读过有关Zernike多项式的信息。Zernike多项式似乎适用于单位圆上的回归,因为它们在是周期性的。θθ\theta 选择模型后,我需要选择一种估算程序。由于这是一个空间回归问题,因此应将不同位置的错误关联起来。普通最小二乘法假设存在不相关的错误,因此我想广义最小二乘会更合适。假设gls标准R分布中有一个函数,则GLS似乎是一种相对普遍的统计技术。但是,我从未使用过GLS,并且对此表示怀疑。例如,如何估计协方差矩阵?一个可行的示例,即使只有几个传感器,也将是很棒的。 PS我选择使用Zernike多项式和GLS,因为在我看来这样做是合乎逻辑的。但是,我不是专家,如果您觉得我走错了方向,请随意使用完全不同的方法。

1
数据具有不确定性的线性模型,使用R
假设我有一些不确定性的数据。例如: X Y 1 10±4 2 50±3 3 80±7 4 105±1 5 120±9 不确定度的性质可以是重复测量或实验,或例如测量仪器不确定度。 我想使用R拟合曲线,通常我会这样做lm。但是,当它给我拟合系数的不确定性以及预测间隔的不确定性时,就没有考虑数据的不确定性。查看文档,lm页面具有以下内容: 权重可以用来表示不同的观察结果具有不同的方差 因此,我认为也许这与它有关。我知道手动执行操作的原理,但是我想知道是否可以使用该lm功能执行操作。如果没有,是否还有其他功能(或包装)能够做到这一点? 编辑 看到一些评论,这里有一些澄清。举个例子: x &lt;- 1:10 y &lt;- c(131.4,227.1,245,331.2,386.9,464.9,476.3,512.2,510.8,532.9) mod &lt;- lm(y ~ x + I(x^2)) summary(mod) 给我: Residuals: Min 1Q Median 3Q Max -32.536 -8.022 0.087 7.666 26.358 Coefficients: Estimate Std. Error t …

2
零截断的Poisson和基本Poisson是嵌套的还是非嵌套的?
我已经看到了很多讨论基本Poisson回归是否为零膨胀Poisson回归的嵌套版本的文章。例如,此站点认为是这样,因为后者包括用于建模其他零的额外参数,但其他方面包括与前者相同的泊松回归参数,尽管该页面确实包含了不同意的引用。 我找不到的信息是是否嵌套了零截断的Poisson和基本的Poisson。如果零截断的Poisson只是具有额外规定零计数的概率为零的Poisson,那么我想听起来像是可能的,但我希望有一个更明确的答案。 我想知道的原因是,这会影响我是否应该使用Vuong检验(对于非嵌套模型),还是基于对数似然差的更基本的卡方检验(对于嵌套模型)。 威尔逊(2015)讨论了Vuong检验是否适合将零膨胀回归与基本检验进行比较,但我找不到讨论零截断数据的资料。

1
有人可以从Hastie的ESL书中解释一下像我5岁这样的问题吗?
我正在阅读Hastie的ESL书,而在问题2.3方面却遇到了困难。问题如下: 我们正在考虑原点处的最近邻居估计,并且由该方程式给出了从原点到最近数据点的中值距离。我不知道从哪里开始尝试得出这一点。 我知道大多数数据点比其他任何数据点(维数的诅咒)都更接近样本空间的边界,但是我很难将其转换为线性代数/概率意义。 谢谢!

1
计算多个期望值时如何最佳地分布抽奖
假设我们要计算一些期望值: EYEX|Y[f(X,Y)]EYEX|Y[f(X,Y)]E_YE_{X|Y}[f(X,Y)] 假设我们要使用蒙特卡洛模拟对此进行近似。 EYEX|Y[f(X,Y)]≈1RS∑r=1R∑s=1Sf(xr,s,yr)EYEX|Y[f(X,Y)]≈1RS∑r=1R∑s=1Sf(xr,s,yr)E_YE_{X|Y}[f(X,Y)] \approx \frac1{RS}\sum_{r=1}^R\sum_{s=1}^Sf(x^{r,s},y^r) 但是,假设从这两个分布中抽取样本成本很高,因此我们只能承受绘制固定数。 KKK 我们应该如何分配?示例包括每种分布的抽奖,或者极端情况下,外部抽奖,内部为抽奖,反之亦然,等等。K / 2 K − 1KKKK/2K/2K/2K−1K−1K-1 我的直觉告诉我,这将与分布相对于彼此的方差/熵有关。假设外一个是质点,则分割最小化MC误差将被绘制的1和绘制的的。 ÿKKKYYYX | ÿK−1K−1K-1X|YX|YX|Y 希望这很清楚。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.