统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
时间序列中的异常值检测:如何减少误报?
我想自动离群值在时间序列检测和我使用的罗布海德门提出的解决方案的修改在这里。 假设我衡量来自各个国家/地区的网站的每日访问量。对于某些日访问量只有几百或几千的国家,我的方法似乎工作合理。 但是,在一个国家每天只进行1或2次访问的情况下,该算法的范围非常狭窄(例如1±0.001),因此这2次访问被认为是异常值。我如何自动检测此类情况,以及如何处理它们以识别异常值?我不想设置一个手动的阈值,例如每天100次访问。 谢谢!


2
glmnet:如何理解多项式参数化?
接下来的问题:我想使用glmnet()预测一个(或多个)分类变量的分类响应变量。 但是,我无法理解glmnet给我的输出。 好的,首先让我们生成两个相关的分类变量: 产生资料 p <- 2 #number variables mu <- rep(0,p) sigma <- matrix(rep(0,p^2), ncol=p) sigma[1,2] <- .8 #some relationship .. diag(sigma) <- 1 sigma <- pmax(sigma, t(sigma)) n <- 100 set.seed(1) library(MASS) dat <- mvrnorm(n, mu, sigma) #discretize k <- 3 # number of categories d <- apply(dat, …

2
二次编程和套索
我正在尝试执行套索回归,其格式如下: 在最小化(Y - X w )'(Y - X w )+ λwww(是- Xw)′(是- Xw )+ λ| w |1个(Y−Xw)′(Y−Xw)+λ|w|1(Y - Xw)'(Y - Xw) + \lambda \;|w|_1 给定,建议我借助二次编程来找到最佳,二次编程采用以下形式:w ^λλ\lambdawww 最小化在,受1Xxx甲X≤b。1个2X′Q X + C ^′X12x′Qx+c′x\frac{1}{2} x'Qx + c'x甲X ≤ b 。Ax≤b.Ax \le b. 现在,我意识到应该将项转换为约束项,这非常简单。但是,我以某种方式看不到如何将第一个方程式的第一项转换为第二个方程式的第一项。我在网上找不到很多,所以决定在这里问。甲X ≤ bλλ\lambda一个X ≤ bAx≤bAx \le b

1
具有不等方差的James-Stein估计量
我发现的James-Stein估计量的每条陈述均假设所估计的随机变量具有相同(和单位)的方差。 但是所有这些示例还提到,可以使用JS估计器来估计彼此无关的数量。在维基百科的例子是台湾光,茶叶消费,并在蒙大拿州生猪重量的速度。但是,假设您对这三个量的测量将具有不同的“真实”方差。这会带来问题吗? 这与一个我不理解的,与这个问题有关的更大的概念问题联系在一起:James-Stein估计量:埃夫隆和莫里斯是如何计算棒球范例中的收缩因子的?σ2σ2\sigma^2我们计算收缩率如下:ccc c=1−(k−3)σ2∑(y−y¯)2c=1−(k−3)σ2∑(y−y¯)2 c = 1 - \frac{(k-3) \sigma^2} {\sum (y - \bar{y})^2} 直觉,我认为项实际上是-对于每个估计的数量而言都是不同的。但是该问题的讨论仅涉及使用合并方差...σ2σ2\sigma^2σ2iσi2\sigma^2_i 如果有人能消除这种混乱,我将不胜感激!

1
对数建模时的逆变换回归结果
我正在上拟合回归。通过求幂来支持变换点估计(以及置信度/预测间隔)是否有效?我不这么认为,因为但想要别人的意见。E [ f (X )] ≠ f (E [ X ] )log(y)log⁡(y)\log(y)E[f(X)]≠f(E[X])E[f(X)]≠f(E[X])E[f(X)] \ne f(E[X]) 我下面的示例显示了与反向转换的冲突(.239与.219)。 set.seed(123) a=-5 b=2 x=runif(100,0,1) y=exp(a*x+b+rnorm(100,0,.2)) # plot(x,y) ### NLS Fit f <- function(x,a,b) {exp(a*x+b)} fit <- nls(y ~ exp(a*x+b), start = c(a=-10, b=15)) co=coef(fit) # curve(f(x=x, a=co[1], b=co[2]), add = TRUE,col=2,lwd=1.2) predict(fit,newdata=data.frame(x=.7)) [1] 0.2393773 ### …

2
什么是lme4 :: lmer等同于三向重复测量方差分析?
我的问题基于此回答,该回答表明哪个lme4::lmer模型对应于两次重复测量方差分析: require(lme4) set.seed(1234) d <- data.frame( y = rnorm(96), subject = factor(rep(1:12, 4)), a = factor(rep(1:2, each=24)), b = factor(rep(rep(1:2, each=12))), c = factor(rep(rep(1:2, each=48)))) # standard two-way repeated measures ANOVA: summary(aov(y~a*b+Error(subject/(a*b)), d[d$c == "1",])) # corresponding lmer call: anova(lmer(y ~ a*b+(1|subject) + (1|a:subject) + (1|b:subject), d[d$c == "1",])) 我现在的问题是如何将其扩展到三向方差分析的情况: …

1
使用多元正态和协变量的贝叶斯建模
假设您有一个解释变量,其中表示给定坐标。您还具有一个响应变量。现在,我们可以将两个变量组合为:X=(X(s1),…,X(sn))X=(X(s1),…,X(sn)){\bf{X}} = \left(X(s_{1}),\ldots,X(s_{n})\right)sssY=(Y(s1),…,Y(sn))Y=(Y(s1),…,Y(sn)){\bf{Y}} = \left(Y(s_{1}),\ldots,Y(s_{n})\right) W(s)=(X(s)Y(s))∼N(μ(s),T)W(s)=(X(s)Y(s))∼N(μ(s),T){\bf{W}}({\bf{s}}) = \left( \begin{array}{ccc}X(s) \\ Y(s) \end{array} \right) \sim N(\boldsymbol{\mu}(s), T) 在这种情况下,我们只需选择μ(s)=(μ1μ2)Tμ(s)=(μ1μ2)T\boldsymbol{\mu}(s) = \left( \mu_{1} \; \; \mu_{2}\right)^{T},TTT是一个协方差矩阵,描述了XXX和Y之间的关系YYY。这只能说明价值XXX和YYY在sss。由于我们从XXX和Y的其他位置获取了更多点YYY,因此可以通过以下方式描述{\ bf {W}}(s)的更多值W(s)W(s){\bf{W}}(s): (XY)=N((μ11μ21),T⊗H(ϕ))(XY)=N((μ11μ21),T⊗H(ϕ))\left( \begin{array}{ccc} {\bf{X}} \\ {\bf{Y}} \end{array}\right) = N\left(\left(\begin{array}{ccc}\mu_{1}\boldsymbol{1}\\ \mu_{2}\boldsymbol{1}\end{array}\right), T\otimes H(\phi)\right) 您会注意到,我们重新排列了XX\bf{X}和\ bf {Y}的组件,YY\bf{Y}以将所有X(si)X(si)X(s_i)放在一列中,然后将所有Y(s_i)串联Y(si)Y(si)Y(s_i)在一起。每个分量H(ϕ)ijH(ϕ)ijH(\phi)_{ij}是一个相关函数ρ(si,sj)ρ(si,sj)\rho(s_i, s_j),TTT等于上述值。之所以具有协方差T⊗H(ϕ)T⊗H(ϕ)T\otimes H(\phi)是因为我们假设可以将协方差矩阵分离为C(s,s′)=ρ(s,s′)TC(s,s′)=ρ(s,s′)TC(s, s')=\rho(s, s') T。 问题1:当我计算条件Y∣XY∣X{\bf{Y}}\mid{\bf{X}},实际上我正在 根据\ bf {X}生成一组\ bf {Y}值,对吗?我已经有\ …

2
平方伽玛的期望
如果使用和参数化了Gamma分布,则:αα\alphaββ\beta E(Γ(α,β))=αβE(Γ(α,β))=αβ E(\Gamma(\alpha, \beta)) = \frac{\alpha}{\beta} 我想计算平方Gamma的期望值,即: E(Γ(α,β)2)=?E(Γ(α,β)2)=? E(\Gamma(\alpha, \beta)^2) = ? 我认为是: E(Γ(α,β)2)=(αβ)2+αβ2E(Γ(α,β)2)=(αβ)2+αβ2 E(\Gamma(\alpha, \beta)^2) = \left(\frac{\alpha}{\beta}\right)^2 + \frac{\alpha}{\beta^2} 有人知道后一种表达是否正确吗?

1
何时在多个比较中更正p值?
恐怕相关问题无法回答我的问题。我们评估> 2个分类器(机器学习)的性能。我们的零假设是表演没有差异。我们执行参数(ANOVA)和非参数(Friedman)检验来评估该假设。如果它们很重要,我们想找出在事后搜寻中哪些分类器有所不同。 我的问题是双重的: 1)多次比较测试后是否需要校正p值?在“ Alphafehler Kumulierung”上的德国维基百科站点上说,仅当在相同数据上检验多个假设时,才会出现此问题。比较分类器(1,2),(1,3),(2,3)时,数据仅部分重叠。是否仍然需要校正p值? 2)P值校正通常在通过t检验进行成对测试之后使用。在进行专门的事后测试,例如Nemenyi(非参数)或Tukey的HSD测试时,是否也有必要?对于Tukey的HSD,此答案为“否”:Tukey HSD测试是否可正确进行多次比较?。是否有规则或我必须针对每个可能的事后测试进行检查? 谢谢!

1
引导程序是否适合此连续数据?
我是一个完整的新手:) 我正在从大约745,000的人口中进行10,000个样本量的研究。每个样本代表一个“百分比相似度”。大部分样本在97%-98%左右,但少数样本在60%到90%之间,也就是说,分布严重负向倾斜。约0.6%的结果为0%,但这些将与样品分开处理。 所有10,000个样本的平均值为97.7%,仅在Excel中,StdDev为3.20。我知道StdDev在这里并不是真正适用的,因为结果不是正态分布的(因为+3.20会使您超过100%!)。 我的问题是: 自举(对我来说是个新概念)是否合适? 我是否正确引导:) 足够的样本量是多少? 我正在做的是对10,000个结果进行重新采样(并替换)并计算新的均值。我执行了数千次,并将每个均值存储在一个数组中。然后,我计算“均值”,这是我的统计结果。要计算出99%的置信区间,我选择了第0.5%的值和第99.5%的值,这产生了非常狭窄的范围:97.4%-98.0%。这是有效的结果,还是我做错了什么? 至于样本量,我仅抽样了约1.3%的人口-我不知道这是否足够。我如何知道我的样本是否代表人群?理想情况下,我希望对+/- 0.50%的平均值(即97.2%-98.2%)有99%的信心。 在此先感谢您提供任何提示!


2
如何用p量化Logistic回归中的相对变量重要性?
假设使用逻辑回归模型来预测在线购物者在单击一组在线广告(预测变量:Ad1,Ad2和Ad3)后是否将购买产品(结果:购买)。 结果是一个二进制变量:1(已购买)或0(未购买)。预测变量也是二进制变量:1(单击)或0(未单击)。因此,所有变量的比例都相同。 如果得出的Ad1,Ad2和Ad3的系数分别为0.1、0.2和03,则可以得出结论:Ad3比Ad2更重要,而Ad2比Ad1更重要。此外,由于所有变量的大小相同,因此标准化和非标准化系数应该相同,并且我们可以进一步得出结论,就其对logit(对数奇数)水平的影响而言,Ad2比Ad1重要两倍。 但是实际上,我们更关心如何根据p(购买概率)级别而不是logit(log-odds)水平比较和解释变量的相对重要性。 因此,问题是:是否有任何方法可以根据p量化这些变量的相对重要性?

1
离线学习与在线学习中的模型选择
最近,我一直在尝试学习有关在线学习的更多信息(这绝对令人着迷!),而我一直无法很好地掌握的一个主题是如何考虑离线与在线环境中的模型选择。具体而言,假设我们训练分类离线,基于一些固定数据集。例如,我们通过交叉验证来评估其性能特征,并以此方式选择最佳分类器。SSSDDD 这就是我一直在思考的问题:那么,如何将应用于在线设置呢?我们是否可以假设脱机找到的最佳作为在线分类器也能表现良好?收集一些数据来训练,然后使用相同的分类器并在找到相同参数的在线设置中“操作”它是否有意义,或者另一种方法会更好吗?在这些情况下有哪些警告?这里的主要结果是什么?依此类推。SSSSSSSSSSSSDDD 无论如何,现在已经存在了,我想我正在寻找的参考资料或资源将对我(以及希望其他人在思考这种事情!)有帮助,从而使他们从单纯地以离线方式进行思考过渡,并且随着我阅读的进展,以更连贯的方式发展思维框架来思考模型选择和这些问题。

3
连续数据堆积为零的GLM
我试图运行一个模型来估计结核病,艾滋病等灾难性疾病如何影响住院治疗。我将“每住院费用”作为因变量,并使用各种个体标记作为自变量,几乎所有变量都是虚拟变量,例如性别,户主,贫困状况,当然还有一个关于您是否生病(加上年龄)的虚拟变量。和年龄的平方)和一系列互动条件。 可以预料的是,有大量的数据(我的意思是很多)以零堆积(即,在12个月的参考期内没有住院费用)。处理此类数据的最佳方法是什么? 到目前为止,我决定将成本转换ln(1+cost)为包括所有观察值,然后运行线性模型。我在正确的轨道上吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.