统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
为什么“宽松套索”与标准套索不同?
如果我们开始与一组数据的,应用套索给它,将获得的溶液β 大号,我们可以再次应用套索到数据集(X 小号,ÿ ),其中小号是一组非零的指标β 大号,以得到溶液,β - [R 大号,被称为“放松套索”的解决方案(如果我错了指正!)。将溶液β 大号必须满足Karush-库恩-塔克(KKT)条件下对(X ,ÿ )(X,Y)(X,Y)(X,Y)βLβL\beta^L(XS,Y)(XS,Y)(X_S, Y)SSSβLβL\beta^LβRLβRL\beta^{RL}βLβL\beta^L(X,Y)(X,Y)(X,Y),但考虑的KKT条件的形式它是否也满足这些条件?如果是这样,第二次做LASSO有什么意义?(XS,Y)(XS,Y)(X_S, Y) 该问题是针对以下问题的后续措施: 做“双套索”或两次执行套索的优势?

2
为什么GLM与带有转换变量的LM不同
如本课程讲义(第1页)中所述,线性模型可以用以下形式编写: y=β1x1+⋯+βpxp+εi,y=β1x1+⋯+βpxp+εi, y = \beta_1 x_{1} + \cdots + \beta_p x_{p} + \varepsilon_i, 其中是响应变量, 是第说明变量。yyyxixix_{i}ithithi^{th} 通常以满足测试假设为目标,可以转换响应变量。例如,我们在每个上应用log函数。转换响应变量并不等同于执行GLM。yiyiy_i 可以采用以下形式编写GLM(再次从课程讲义中(第3页)) g(u)=β1x1+⋯+βpxp+εi,g(u)=β1x1+⋯+βpxp+εi, g(u) = \beta_1 x_{1} + \cdots + \beta_p x_{p} + \varepsilon_i, 其中仅仅是另一个符号Ÿ当我从第2页,课程讲义理解。g()称为链接函数。uuuyyyg()g()g() 在课程中,我不太了解GLM和带有转换后的变量的LM之间的区别。你能帮我吗?


2
通过ACF和PACF检查估算ARMA系数
您如何通过目视检查ACF和PACF图来估计时间序列的适当预测模型?哪一个(即ACF或PACF)告诉AR或MA(或两者)?图表的哪一部分告诉您季节性ARIMA的季节性和非季节性部分? 考虑下面显示的ACF和PCF功能。它们来自经过两次对数转换的对数变换系列,一次是简单的差异,一个是季节性的(原始数据,对数变换的数据)。您如何表征该系列?哪种型号最合适?

1
GLM中的对数似然性是否可以保证收敛到全局最大值?
我的问题是: 是否可以保证广义线性模型(GLM)收敛到全局最大值?如果是这样,为什么? 此外,链接函数对确保凸性有哪些约束? 我对GLM的理解是它们最大化了高度非线性的似然函数。因此,我可以想象有几个局部最大值,您收敛到的参数集取决于优化算法的初始条件。但是,在进行了一些研究之后,我没有找到一个单一的来源来表明存在多个局部最大值。此外,我对优化技术不是很熟悉,但是我知道Newton-Raphson方法和IRLS算法非常容易出现局部最大值。 请尽可能在直观和数学的基础上进行解释! 编辑:dksahuji回答了我的原始问题,但我想在上面添加后续问题[ 2 ]。(“链接函数上有什么约束可确保凸性?”)

2
使用带有ARIMA错误的回归进行推理的平稳性要求是什么?
使用带有ARIMA错误的回归(动态回归)进行推理的平稳性要求是什么? 具体来说,我有一个非平稳的连续结果变量,一个非平稳的连续预测变量和一个虚拟变量处理序列。我想知道治疗是否与结果变量的变化相关,该变化大于零变化之外的两个标准误差。ÿÿyX一种X一种x_aXbXbx_b 我不确定在使用ARIMA错误建模进行回归之前是否需要对这些序列进行差分处理。在回答另一个问题时,IrishStat指出的是while the original series exhibit non-stationarity this does not necessarily imply that differencing is needed in a causal model.,他然后继续补充说 unwarranted usage [of differencing] can create statistical/econometric nonsense。 该SAS用户指南表明,它是罚款,以适应回归模型ARIMA误差的非平稳序列无差分,只要残差非平稳: 请注意,平稳性要求适用于噪声序列。如果没有输入变量,则响应序列(在求和后减去平均值)和噪声序列相同。但是,如果有输入,则噪声序列是在消除输入影响后的残差。 不需要输入序列是固定的。如果输入是不稳定的,即使噪声过程可能是固定的,响应序列也将是不稳定的。 当使用非平稳输入序列时,可以在没有ARMA模型的情况下将输入变量拟合为误差,然后在确定噪声部分的ARMA模型之前考虑残差的平稳性。 另一方面,Rob Hyndman和George Athanasopoulos断言: 估计具有ARMA错误的回归的重要考虑因素是模型中的所有变量必须首先是平稳的。因此,我们首先必须检查yt和所有预测变量是否都固定。如果我们在其中任何一个都不平稳的情况下估计模型,则估计的系数可能是错误的。(x1 ,吨,… ,xķ ,吨)(X1个,Ť,…,Xķ,Ť)(x_{1,t},\dots,x_{k,t}) 一个例外是非平稳变量被共同积分的情况。如果在非平稳和预测变量之间存在线性组合,则估计的系数是正确的。ÿŤÿŤy_t 这些建议相互排斥吗?应用分析师如何进行?

3
在线学习和批处理学习有什么区别?
我目前正在阅读John Duchi和Yoram Singer撰写的论文《使用正反拆分进行有效的在线和批处理学习》。我对术语“在线”和“批处理”的使用感到非常困惑。 我认为“在线”是指我们在处理了一个单位的训练数据后更新了体重参数。然后,我们使用新的权重参数来处理训练数据的下一个单位。 但是,在上面的文章中,用法尚不清楚。


2
如何选择合适的优化算法?
我需要找到一个函数的最小值。在http://docs.scipy.org/doc/scipy/reference/optimize.html上阅读文档,我发现有几种算法可以完成相同的工作,即找到最小的算法。我怎么知道我应该选择哪一个? 列出了一些算法 使用下坡单纯形算法最小化功能。 使用BFGS算法最小化功能。 使用非线性共轭梯度算法最小化函数。 使用Newton-CG方法将函数f最小化。 使用修改的Powell方法最小化功能。 我的函数是线性的。维度约为232750(这是我每次必须计算多少个不同的渐变),一次计算渐变和成本大约需要2分钟,因此并不便宜。我认为我没有约束。它是确定性的和连续的。

3
将更多变量添加到多变量回归中是否会更改现有变量的系数?
假设我有一个由3个变量组成的多变量(几个独立变量)回归。这些变量中的每一个都有给定的系数。如果我决定引入第四个变量并重新运行回归,则三个原始变量的系数会改变吗? 更广泛地说:在多变量(多个独立变量)回归中,给定变量的系数是否受另一个变量的系数影响?

5
样本均值的抽样分布如何近似于总体均值?
我尝试学习统计信息是因为我发现它是如此普遍,以至于如果我对它的理解不正确,它就会禁止我学习一些东西。我很难理解样本均值的抽样分布这一概念。我不明白某些书籍和网站对它的解释方式。我想我有一个了解,但不确定它是否正确。以下是我试图理解它的尝试。 当我们谈论某种呈正态分布的现象时,通常(并非总是)涉及人口。 我们希望使用推论统计来预测有关某些人口的某些信息,但是并没有所有的数据。我们使用随机抽样,大小为n的每个样本被选择的可能性均等。 因此,我们抽取大量样本,假设为100,然后根据中心极限定理,这些样本的均值分布将近似为正态。样本均值的平均值将近似于总体均值。 现在我不明白的是,很多时候您会看到“一个100个人的样本……”我们是否需要10个或100个100个人的样本来近似均值人口?还是我们可以抽取一个足够大的样本(比如说1000),然后说均值将近似于总体均值?还是我们从1000人中抽取了1000个人,然后从100个人中随机抽取了100个人中的100个人,然后将其用作近似值? 是否采取足够大的样本来近似(几乎)均值始终有效?人口甚至需要正常工作才能正常工作吗?

3
将R预测包与缺失值和/或不规则时间序列一起使用
R forecast包以及zoo用于不规则时间序列和内插缺失值的包给我留下了深刻的印象。 我的应用程序是在呼叫中心流量预测方面,因此(几乎)总是缺少周末的数据,可以通过很好地处理zoo。此外,一些离散的点可能会丢失,我只是用的r NA为。 事实是:所有的预测包的漂亮的魔法,比如eta(),auto.arima()等等,似乎期望普通ts的物体,不包含任何丢失的数据,即等间隔的时间序列。我认为在现实世界中仅存在等时时间序列的应用确实存在,但是-我认为-非常有限。 几个离散的问题NA的值可容易地通过使用任何的提供内插函数来解决zoo,以及通过forecast::interp。之后,我运行了预测。 我的问题: 有人建议更好的解决方案吗? (我的主要问题)至少在我的应用程序域中,呼叫中心流量预测(据我所能想象的大多数其他问题域),时间序列不是等距的。至少我们有重复的“工作日”计划或类似的计划。什么是最好的处理方式,同时仍然使用预测包的所有酷魔术? 我是否应该“压缩”时间序列以填充周末,进行预测,然后再次“充气”数据以在周末重新插入NA值?(我认为这是一种耻辱吗?) 是否有计划使预测程序包与不定期的时间序列程序包(如Zoo或其兼容程序)完全兼容?如果是,何时和否,为什么不呢? 我对预测(以及一般的统计数据)还很陌生,所以我可能会忽略一些重要的事情。

2
R中插入符号包中的PCA和k倍交叉验证
我刚刚重新观看了Coursera上机器学习课程的演讲。在教授讨论PCA以便在有监督的学习应用程序中对数据进行预处理的部分中,他说PCA仅应在训练数据上执行,然后使用映射来转换交叉验证和测试集。另请参阅PCA和火车/测试区。 但是,在caretR包中,传递给train()函数的训练数据已经由PCA处理。因此,当算法执行k倍交叉验证时,交叉验证集已经通过PCA preProcess()和进行了处理,predict()并且实际上已用于PCA“拟合”中。 我对情况的理解正确吗?是否表示插入符号与PCA(或实际上使用任何缩放/定中心方法)进行交叉验证的过程是“错误的”,因为数据的预处理是在交叉验证集和训练集上进行的?如果是这样,这将对结果产生多大的影响?



By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.