统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


2
当使用OLS回归残差的误差时,为什么斜率总是正好为1?
我正在使用R中的一些简单模拟试验误差和残差之间的关系。我发现一件事是,无论样本大小或误差方差如何,当您拟合模型时,斜率始终为111 errors∼β0+β1×residualserrors∼β0+β1×residuals {\rm errors} \sim \beta_0 + \beta_1 \times {\rm residuals} 这是我正在做的模拟: n <- 10 s <- 2.7 x <- rnorm(n) e <- rnorm(n,sd=s) y <- 0.3 + 1.2*x + e model <- lm(y ~ x) r <- model$res summary( lm(e ~ r) ) e并且r即使是小样本也具有高度(但不是完美)的相关性,但我不知道为什么会自动发生这种情况。数学或几何解释将是可理解的。



1
套索如何随设计矩阵大小缩放?
如果我有一个设计矩阵,其中Ñ是尺寸的观察次数d,什么是求解的复杂性β = argmin β 1X∈ [Rn × dX∈[Rn×dX\in\mathcal{R}^{n\times d}ññnddd与LASSO,wrtn和d?我认为答案应该是关于一个LASSO迭代如何使用这些参数缩放,而不是迭代次数(收敛)如何缩放,除非您另有感觉。β^=argminβ1个2 n| |Xβ-y| |2+ λ | |β| |1个β^=精氨酸β1个2ñ||Xβ-ÿ||2+λ||β||1个\hat{\beta}=\text{argmin}_{\beta}\frac{1}{2n} ||X\beta-y||^{2} + \lambda||\beta||_{1}nñnddd 我已经阅读了以前的LASSO复杂性问题,但似乎与此处和此处有关glmnet的讨论不一致。我知道那里有很多算法,包括glmnet的GLM方法,但是我正在写一篇有关将LASSO组件替换为父算法的论文,并且希望包括关于LASSO复杂性的讨论,特别是和n。我也想知道在基本的非稀疏情况下glmnet的复杂性,但是由于整个算法的复杂性不是很明确,因此参考文献有些令人困惑。dddnnn

3
数据科学家访谈问题:线性回归低,您会怎么做
我遇到了一个工作的面试问题,面试官问我,假设您的价格弹性模型的非常低(介于5%到10%之间)。您将如何解决这个问题?R2R2R^2 除了我将进行回归诊断以查看出了什么问题或是否应该应用任何非线性方法外,我什么也没想到。我以某种方式认为面试官对我的回答不满意。尽管低,在这种情况下还有其他方法可以拟合模型并用于生产水平预测吗?R2R2R^2 编辑:在稍后的阶段,他们给了我数据以在面试中对问题进行建模,我尝试添加了滞后变量,竞争对手价格的影响,季节性假人,看是否有任何不同。达到了17.6%,在保留样本上的表现很差。我个人认为将这样的模型放在实时环境中进行预测是不道德的,因为它会产生错误的结果并导致客户流失(想象一下,使用这种模型中的定价建议对您的公司收益!)。在这种情况下还有什么其他所有人都需要知道的事情吗?我不知道的什么,我很想说“银弹”?R2R2R^2 此外,让我们想象一下,添加外生变量后再提高2%,那么在这种情况下可以做什么?我们应该放弃建模项目,还是仍然有希望开发出生产水平质量的模型,该模型由保留样本的性能来表示?R2R2R^2 Edit2:我已将此问题发布在Economics.stackexchange.com论坛上,以从经济学的角度理解此问题

1
为什么对于人工多项式展开和使用R`poly`函数会得到不同的预测?
为什么对于人工多项式展开和使用R poly函数会得到不同的预测? set.seed(0) x <- rnorm(10) y <- runif(10) plot(x,y,ylim=c(-0.5,1.5)) grid() # xp is a grid variable for ploting xp <- seq(-3,3,by=0.01) x_exp <- data.frame(f1=x,f2=x^2) fit <- lm(y~.-1,data=x_exp) xp_exp <- data.frame(f1=xp,f2=xp^2) yp <- predict(fit,xp_exp) lines(xp,yp) # using poly function fit2 <- lm(y~ poly(x,degree=2) -1) yp <- predict(fit2,data.frame(x=xp)) lines(xp,yp,col=2) 我的尝试: 截距似乎是一个问题,当我将模型与截距拟合时,即-1在模型中不存在时formula,这两行是相同的。但是,为什么没有截距,这两行是不同的? …

1
倾向评分权重中治疗权重(IPTW)的逆概率的直观解释?
我了解使用倾向得分计算权重的机制: ,然后将权重应用于回归分析,并且权重用于“控制”治疗组和对照组人群中协变量的作用或使结果与结果变量无关。p(xi)p(xi)p(x_i)wi,j=treatwi,j=control=1p(xi)=11−p(xi)wi,j=treat=1p(xi)wi,j=control=11−p(xi)\begin{align} w_{i, j={\rm treat}} &= \frac{1}{p(x_i)} \\[5pt] w_{i, j={\rm control}} &= \frac{1}{1-p(x_i)} \end{align} 但是,在直觉上,我不了解权重是如何实现的,以及为什么方程式如此构造。

2
有效采样阈值Beta分布
如何从以下分布中有效采样? X 〜乙(α ,β),x > k X〜乙(α,β), X>ķ x \sim B(\alpha, \beta),\space x > k 如果不太大,则拒绝采样可能是最好的方法,但是我不确定很大时如何进行。也许可以应用一些渐近逼近?ķķkķķk

3
统计人员说我们不太了解LASSO(正则化)的工作原理是什么意思?
我最近去过一些关于套索(正则化)的统计讨论,并且不断出现的一点是,我们并不真正了解套索为什么起作用或为什么这么好。我想知道这句话指的是什么。显然,我理解了套索为什么通过防止参数缩小来防止过度拟合而在技术上起作用的原因,但是我想知道这样的声明背后是否还有更深层的含义。有人有什么想法吗?谢谢!



1
时间序列预测的随机森林回归
我正在尝试利用RF回归对造纸厂的性能进行预测。 我每分钟都有输入数据(进纸木浆的速度和数量等)以及机器的性能(生产的纸张,机器消耗的功率)的数据,我希望做出10分钟的预测在性能变量上领先。 我有12个月的数据,因此将其分为11个月的培训时间和最后一个月的测试时间。 到目前为止,我已经创建了10个新功能,每个性能变量的滞后值在1-10分钟之内,并使用这些功能以及输入来进行预测。测试集的性能一直很好(系统是可以预测的),但是我担心我的方法中缺少某些东西。 例如,在本文中,作者陈述了他们测试随机森林模型的预测能力的方法: 通过迭代添加新一周的数据,基于更新后的数据训练新模型并预测下一周的爆发次数来进行模拟 这与利用时间序列中的“后来的”数据作为测试有何不同?我是否应该使用这种方法以及测试数据集来验证我的RF回归模型?此外,这种对森林随机回归的“自回归”方法是否对时间序列有效,如果我对未来10分钟的预测感兴趣,我是否甚至需要创建这么多滞后变量?

2
Tensorflow`tf.train.Optimizer`如何计算梯度?
我正在关注Tensorflow mnist教程(https://github.com/tensorflow/tensorflow/blob/master/tensorflow/examples/tutorials/mnist/mnist_softmax.py)。 本教程使用tf.train.Optimizer.minimize(特别是tf.train.GradientDescentOptimizer)。我看不到任何传递参数以定义渐变的参数。 Tensor流默认情况下是否使用数值微分? 有没有办法像您一样传递渐变scipy.optimize.minimize?


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.