统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
预测准确性计算
我们正在使用STL(R实现)来预测时间序列数据。 每天我们都会进行每日预测。我们想将预测值与实际值进行比较,并确定平均偏差。例如,我们对明天进行了预测并获得了预测点,我们希望将这些预测点与明天将要获得的真实数据进行比较。我知道,预测值和实际数据在大多数情况下可能不匹配,这就是我们希望保持每天的准确性的原因之一。 现在,我们正在尝试确定解决此问题的最佳方法是什么?任何帮助指针将不胜感激。 我看过“ 衡量预测准确性问题”,但它似乎与比较模型有关,而不是与实际值一起计算准确性。 我看过R中的精度函数实现,但与两个问题混淆: 1)它可用于真实数据还是预测数据,因为大多数教程都说“测试数据”还是“预测数据” 2)精度函数的输出似乎是值的数组而不是偏差的百分比。

1
使用Johansen方法获取协整向量
我试图更好地理解Johansen方法,因此我开发了一个示例3.1,该示例由《基于可能性的推理-协整-自回归计量经济学》一书给出, 其中有三个过程: X1t=∑i=1tϵ1i+ϵ2tX1t=∑i=1tϵ1i+ϵ2tX_{1t} = \sum_{i=1}^t \epsilon_{1i} + \epsilon_{2t} X2t=α∑i=1tϵ1i+ϵ3tX2t=α∑i=1tϵ1i+ϵ3t X_{2t} = \alpha \sum_{i=1}^t \epsilon_{1i} + \epsilon_{3t} X3t=ϵ4tX3t=ϵ4t X_{3t} = \epsilon_{4t} 因此协整向量应该是[a,-1,0]和[0,0 1],但是当我运行Johansen方法时,我无法获得它们。 我正在尝试的代码如下: import numpy as np import matplotlib.pyplot as plt import pandas as pd from statsmodels.tsa.stattools import adfuller from statsmodels.tsa.johansen import coint_johansen mu, sigma = 0, 1 # mean …

4
可以将Mann-Whitney检验用于Kruskal-Wallis之后的事后比较吗?
我进行了模拟,将动物放置在敌对环境中,并定时观察使用某种生存方法可以生存多长时间。它可以使用三种方法来生存。我使用每种生存方法对动物进行了300次模拟。所有模拟都在相同的环境中进行,但存在一定的随机性,因此每次都不同。我计算每次模拟中动物存活多少秒。活得更长些更好。我的数据如下所示: Approach 1, Approach 2, Approach 2 45,79,38 48,32,24 85,108,44 ... 300 rows of these 我不确定在此之后所做的一切,所以请让我知道我是否在做愚蠢和错误的事情。我试图找出使用特定方法在寿命上是否存在统计差异。 我对每个样本都进行了Shapiro测试,结果以很小的p值返回,因此我认为数据没有被标准化。 行上的数据彼此之间没有关系。每个模拟使用的随机种子是不同的。结果,我认为数据没有配对。 由于数据未标准化,不成对并且存在两个以上的样本,因此我进行了Kruskal Wallis检验,得出p值为0.048。然后,我继续工作,选择了曼·惠特尼。真的不确定是否应该在这里使用Mann Whitney。 我通过执行曼恩·惠特尼(Mann Whitney)测试将每种生存方法与其他方法进行了比较,即{(方法1,方法2),(方法1,方法3),(方法2,方法3)}。使用双尾检验在两对之间(方法2,方法3)之间没有统计学意义的发现,但是使用单尾检验存在显着性差异。 问题: 我不知道像这样使用Mann Whitney是否有意义。 我不知道我应该用一两个尾巴的曼·惠特尼(Mann Whitney)。

2
当CFA不能适用于多项目规模时该怎么办?
我不确定如何继续在拉瓦那做CFA。我有172名参与者的样本(我知道对于CFA来说不算多),还有28项具有7点李克特量表的项目,应该加载七个因素。我使用“ mlm”估计量进行了CFA,但模型拟合确实很差(χ2(df = 329)= 739.36;比较拟合指数(CFI)= 0.69;标准均方根残差(SRMR)=。10;近似均方根误差(RMSEA)=。09; RMSEA 90%置信区间(CI)= [.08,.10]。 我尝试了以下方法: 具有一个通用方法因子->的双因子模型未收敛。 序数数据的估计量(“ WLSMV”)—>模型拟合:(χ2(df = 329)= 462;比较拟合指数(CFI)= 0.81;标准化均方根残差(SRMR)=。09;均方根误差近似值(RMSEA)=。05; RMSEA 90%置信区间(CI)= [.04,.06]) 通过减少那些在因子上负荷较低的项目并在特定项目之间增加协方差的项目来简化模型->模型拟合:χ2(df = 210)= 295; 比较拟合指数(CFI)= 0.86;标准化均方根残差(SRMR)=。08; 近似均方根误差(RMSEA)=。07; RMSEA 90%置信区间(CI)= [.06,.08]。 现在我的问题是: 这样的模型应该怎么办? 在统计上正确的做法是什么? 报告它适合还是不适合?以及那些模型中的哪一个? 我很高兴与您讨论此事。 这是原始模型的CFA的lavaan输出: lavaan (0.5-17.703) converged normally after 55 iterations Used Total Number of observations 149 172 …

1
如何使用R生成具有时间相关协变量的生存数据
我想从包含时间相关协变量的Cox比例风险模型生成生存时间。该模型是 h(t|Xi)=h0(t)exp(γXi+αmi(t))h(t|Xi)=h0(t)exp⁡(γXi+αmi(t))h(t|X_i) =h_0(t) \exp(\gamma X_i + \alpha m_{i}(t)) 其中是从Binomial(1,0.5)和。XiXiX_imi(t)=β0+β1Xi+β2Xitmi(t)=β0+β1Xi+β2Xitm_{i}(t)=\beta_0 + \beta_1 X_{i} + \beta_2 X_{i} t 真实参数值用作γ=1.5,β0=0,β1=−1,β2=−1.5,h0(t)=1γ=1.5,β0=0,β1=−1,β2=−1.5,h0(t)=1\gamma = 1.5, \beta_0 = 0, \beta_1 = -1, \beta_2 = -1.5, h_0(t) = 1 对于与时间无关的协变量(即我生成如下h(t|Xi)=h0(t)exp(γXi)h(t|Xi)=h0(t)exp⁡(γXi)h(t|X_i) =h_0(t) \exp(\gamma X_i) #For time independent case # h_0(t) = 1 gamma <- -1 u <- runif(n=100,min=0,max=1) Xi …

1
克里金法时为什么必须提供方差图模型?
我对空间统计非常陌生,并观看了很多教程, 但是我真的不明白为什么您在克里格时必须提供一个变异函数模型。 我在R中使用gstat包,这是他们提供的示例: library(sp) data(meuse) coordinates(meuse) = ~x+y data(meuse.grid) str(meuse.grid) gridded(meuse.grid) = ~x+y m <- vgm(.59, "Sph", 874, .04) print(m) # ordinary kriging: x <- krige(log(zinc)~1, meuse, meuse.grid, model = m) 有谁能在几行中解释为什么您首先必须提供vgm?以及如何设置参数? 先感谢您!卡斯珀
9 spatial 

2
聚类嘈杂的数据或与离群值
我有两个这样的变量的嘈杂数据。 x1 <- rep(seq(0,1, 0.1), each = 3000) set.seed(123) y1 <- rep (c(0.2, 0.8, 0.3, 0.9, 0.65, 0.35,0.7,0.1,0.25, 0.3, 0.95), each = 3000) set.seed(1234) e1 = rnorm(length(x1), 0.07,0.07) set.seed(1223) e2 = rnorm(length(x1), 0.07,0.07) set.seed(1334) yn <- rnorm(20000, 0.5,0.9) set.seed(2344) xn <- rnorm(20000, 0.5,0.9) y <- c(y1 + e1,yn) x <- …

1
使用LDA作为预处理步骤时的功能标准化
如果使用多类线性判别分析(或有时也阅读“多判别分析”)进行降维(或通过PCA进行降维后的变换),则我通常会理解为即使使用完全不同的比例尺测量功能也不需要,对吗?因为LDA包含类似于马哈拉诺比斯距离的术语,已经暗示了标准化的欧几里得距离? 因此,不仅没有必要,而且在LDA上标准化和非标准化功能的结果应该完全相同!

1
在LSI中了解奇异值分解
我的问题通常是关于奇异值分解(SVD),尤其是关于潜在语义索引(LSI)。 假设我有一个,其中包含7个文档中5个单词的频率。Aword×documentAword×document A_{word \times document} A = matrix(data=c(2,0,8,6,0,3,1, 1,6,0,1,7,0,1, 5,0,7,4,0,5,6, 7,0,8,5,0,8,5, 0,10,0,0,7,0,0), ncol=7, byrow=TRUE) rownames(A) <- c('doctor','car','nurse','hospital','wheel') 我得到的矩阵分解通过使用SVD:。AAAA=U⋅D⋅VTA=U⋅D⋅VTA = U \cdot D \cdot V^T s = svd(A) D = diag(s$d) # singular value matrix S = diag(s$d^0.5 ) # diag matrix with square roots of singular values. 在1和2中指出: WordSim=U⋅SWordSim=U⋅SWordSim = …

1
为什么EM算法必须是迭代的?
假设您有一个具有单位的总体,每个单位都有一个随机变量。对于任何单位,您都会观察到值。我们想要一个\ lambda的估计。ññNX一世〜泊松(λ )X一世〜泊松(λ)X_i \sim \text{Poisson}(\lambda)n = N-ñ0ñ=ñ-ñ0n = N-n_0X一世> 0X一世>0X_i > 0λλ\lambda 有矩的方法和有条件的最大似然方法来获得答案,但是我想尝试EM算法。我得到的EM算法是 Q (λ− 1,λ ) = λ ( n +ñexp (λ− 1)- 1) +日志(λ )∑我= 1ñX一世+ K,问(λ-1个,λ)=λ(ñ+ñ经验值(λ-1个)-1个)+日志⁡(λ)∑一世=1个ñX一世+ķ, Q\left(\lambda_{-1}, \lambda\right) = \lambda \left(n + \frac{n}{\text{exp}(\lambda_{-1}) - 1}\right) + \log(\lambda)\sum_{i=1}^n{x_i} + K, 其中− 1-1个-1下标表示算法先前迭代的值,ķķK相对于参数。(我实际上认为括号中的小数中的ññn应该为n + 1ñ+1个n+1,但这似乎并不准确;这是另一个问题)。 为了具体说明,假设n = 10ñ=10n=10,∑X一世= 20∑X一世=20\sum{x_i} …

1
来自单面Kolmogorov-Smirnov检验的和的两个样本CDF是多少?
我想了解如何获得 -值对片面柯尔莫哥洛夫-斯米尔诺夫检验,以及我在努力寻找的CDF和(在两个样本的情况下)。在一个示例中,以下几处被引用为的CDF :pppD+n1,n2Dn1,n2+D^{+}_{n_{1},n_{2}}D−n1,n2Dn1,n2−D^{-}_{n_{1},n_{2}}D+nDn+D^{+}_{n} p+n(x)=P(D+n≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jpn+(x)=P(Dn+≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jp^{+}_{n}\left(x\right) = \text{P}\left(D^{+}_{n} \ge x | \text{H}_{0}\right) = x\sum_{j=0}^{\lfloor n\left(1-x\right)\rfloor}{ \binom{n}{j} \left(\frac{j}{n}+x\right)^{j-1}\left(1 - x - \frac{j}{n}\right)^{n-j}} 另外,whuber sez对此单样本CDF的表示形式略有不同(我将x替换xxx为ttt,以与此处的符号保持一致): 使用概率积分变换,唐纳德·努斯推导了它们在p上的(公共)分布。TAoCP第2卷的第57页和练习17。 (D+n≤xn−−√)=xnn∑c≤k≤x(nk)(k−x)k(x+n−k)n−k−1(Dn+≤xn)=xnn∑c≤k≤x(nk)(k−x)k(x+n−k)n−k−1\left(D^{+}_{n}\le \frac{x}{\sqrt{n}}\right)=\frac{x}{n^{n}}\sum_{c\le k\le x}\binom{n}{k}\left(k-x\right)^{k}\left(x+n-k\right)^{n-k-1} 这将适用于单样本情况下的单边假设,例如:H 0: F(x)−F0≤00: F(x)−F0≤0_{0}\text{: }F(x)-F_{0} \le 0,其中F(x)F(x)F(x)是经验CDF的xxx,和F0F0F_{0}是一些CDF。 我认为这种情况下的xxx是一个人的样本中D+nDn+D^{+}_{n}的值,⌊n(1−x)⌋⌊n(1−x)⌋\lfloor n\left(1-x\right)\rfloor是n-nx中最大的整数n−nxn−nxn-nx。(那正确吗?) 但是当一个具有两个样本时,(或的CDF是多少?例如,对于和的经验CDF ,当H?如何获得?D+n1,n2Dn1,n2+D^{+}_{n_{1},n_{2}}D−n1,n2Dn1,n2−D^{-}_{n_{1},n_{2}}0: FA(x)−FB(x)≤00: FA(x)−FB(x)≤0_{0}\text{: }F_{A}(x)-F_{B}(x) \le 0AAABBBp+n1,n2pn1,n2+p^{+}_{n_{1},n_{2}}

1
加法与乘法分解
我的问题是一个非常简单的问题,但那些问题确实让我很感激:)我真的不知道如何使用加法或乘法分解方法评估特定时间序列是否要分解。我知道有一些视觉提示可以告诉他们彼此分开,但我不明白。 以这个时间序列为例: 您如何形容? 在此先感谢您的帮助。

2
使用Poisson回归估算二元数据中调整后的风险比率
我对估算调整后的风险比率很感兴趣,类似于人们如何使用logistic回归估算调整后的优势比率。一些文献(例如this)表明,将泊松回归与Huber-White标准误差一起使用是基于模型的方法 我没有找到关于调整连续协变量如何影响这一点的文献。下面的简单模拟表明此问题并非那么简单: arr <- function(BLR,RR,p,n,nr,ce) { B = rep(0,nr) for(i in 1:nr){ b <- runif(n)<p x <- rnorm(n) pr <- exp( log(BLR) + log(RR)*b + ce*x) y <- runif(n)<pr model <- glm(y ~ b + x, family=poisson) B[i] <- coef(model)[2] } return( mean( exp(B), na.rm=TRUE ) ) } set.seed(1234) arr(.3, …

2
历史:统计在天文学中的作用
最近,我在一群相当聪明的八年级学生面前大胆地宣称,天文学为统计学的基础做出了巨大贡献,并且发明了许多统计概念用于天文学。但是,希望支持这一点,我感到非常失望。误差,均值和与均值的中位数偏差可能首先在天文学中观察到。但是,甚至错误传播的概念也可能更多地源于经典力学而非天文学。除了这些概念,我找不到更多的东西。费格尔森写道(http://arxiv.org/pdf/astro-ph/0401404.pdf): 使用最小极大拟合优度法的非线性宇宙学模型的托勒密估计参数。Al-Biruni讨论了由于仪器不准确和观察员注意力不集中而传播错误的危险。尽管一些中世纪学者建议不要进行重复测量,但他们担心误差会加在一起而不是相互补偿,但第谷·布拉赫(Tycho Brahe)却成功地证明了提高平均值的意义。 您能提出一些很好的参考资料,其中提供有关天文学与统计数据之间历史联系的更多详细信息吗? 感谢您的出色回答!

2
尽管具有正态性假设,为什么等级的皮尔逊相关性仍然有效?
我目前正在阅读有关Pearson相关性的假设。随后的t检验的一个重要假设似乎是两个变量都来自正态分布。如果他们不这样做,则提倡使用替代措施,例如Spearman rho。Spearman相关性的计算就像Pearson相关性一样,仅使用X和Y的等级而不是X和Y本身,对吗? 我的问题是:如果需要将输入到Pearson相关中的变量进行正态分布,那么即使输入变量是等级,为什么Spearman相关性的计算仍然有效?我的排名肯定不是来自正态分布... 到目前为止,我唯一得出的解释是,对rho的重要性的检验可能与Pearson相关t检验的检验有所不同(以不需要正态性的方式),但是到目前为止,我还没有找到公式。但是,当我运行一些示例时,除最后几位数字外,等级的Phoson相关性的rho和t检验的p值始终匹配。对我来说,这看起来不像是一个突破性的过程。 您可能会有任何解释和想法!

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.