统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
使用通用优化器复制glmnet线性回归的结果
如标题所示,我正在尝试使用来自library的LBFGS优化器从g​​lmnet linear复制结果lbfgs。只要我们的目标函数(没有L1正则化项)是凸的,此优化器就可以让我们添加L1正则化项,而不必担心可微性。 glmnet纸中的弹性净线性回归问题由 其中X \ in \ mathbb {R} ^ {n \ times p}是设计矩阵,y \ in \ mathbb {R} ^ p是观测向量,\ alpha \ in [0,1]是弹性网参数,而\ lambda> 0是正则化参数。运算符\ Vert x \ Vert_p表示通常的Lp范数。 X∈[RÑ×pý∈[Rpα∈[0,1]λ>0‖X‖p分β∈ [Rp1个2 n∥ β0+ Xβ- ÿ∥22+ α λ ∥ β∥1个+ 12(1 - α )λ ∥ β∥22minβ∈Rp12n‖β0+Xβ−y‖22+αλ‖β‖1+12(1−α)λ‖β‖22\min_{\beta \in \mathbb{R}^p} \frac{1}{2n}\Vert …




2
参考要求:工作数据科学家的古典统计
我是一位工作数据科学家,在回归,其他机器学习类型算法和编程(数据分析和通用软件开发)方面都有扎实的经验。我一生的大部分时间都集中在构建预测精度模型(在各种业务约束下工作),以及构建数据管道以支持我自己(和其他人)的工作。 我没有接受过统计学方面的正规培训,我的大学教育重点是纯数学。因此,错过了学习许多经典主题的机会,尤其是各种流行的假设检验和推论技巧。 这些主题是否有适合我背景和经验水平的人参考?我可以处理(并欣赏)数学上的严格性,也可以欣赏算法的观点。我倾向于喜欢为读者提供指导性练习的参考书,既有(又有)数学和(或)编程方面的重点。

2
图形模型和玻尔兹曼机器在数学上相关吗?
虽然我实际上是在物理课上用玻尔兹曼机进行编程的,但我对它们的理论特性并不熟悉。相反,我对图形模型的理论了解很少(关于Lauritzen的《图形模型》的前几章)。 问题:图形模型和玻尔兹曼机器之间是否存在有意义的关系?玻尔兹曼机是图形模型的一种吗? 显然,玻尔兹曼机是一种神经网络。我听说有些神经网络在数学上与图形模型有关,而有些则没有。 CrossValidated上的相关问题没有回答我的问题: 这类似于之前已经问过的先前问题:层次模型,神经网络,图形模型,贝叶斯网络之间的关系是什么?但更具体。 此外,对该问题的公认答案并不能澄清我的困惑-即使神经网络的标准图形表示中的节点不表示随机变量,也不一定意味着不存在这种表示形式。具体来说,我正在考虑马尔可夫链的典型图形表示中的节点如何表示可能状态的集合,而不是随机变量,但是也可以创建一个图形,显示之间的条件依赖关系XiXiX_iXiXiX_i,这表明每个马尔可夫链实际上都是一个马尔可夫随机场。答案还说,神经网络(可能包括Boltzmann机器)是“判别性的”,但没有更详细地解释该主张的含义,也没有明显的后续问题“图形模型不是可判别的吗?” 已解决。同样,可接受的答案链接到凯文·墨菲(Kevin Murphy)的网站(当我学习贝叶斯网络时,我实际上阅读了他的博士学位论文),但是该网站仅讨论贝叶斯网络,而根本没有提及神经网络,因此无法阐明它们的方式。是不同的。 这另一个问题可能与我的最相似:将神经网络数学建模为图形模型但是,没有一个答案被接受,同样也仅提供参考,但不解释参考(例如,此答案)。希望有一天我能够理解这些参考资料,但现在我已经具备基本的知识水平,并且最希望得到一个尽可能简化的答案。此外,链接到顶部答案(http://www.cs.toronto.edu/~tijmen/csc321/lecture_notes.shtml)的多伦多课程解决了此问题,但没有非常详细。此外,可能无法回答我的问题的一次讲座的笔记也没有公开。 3月25日,讲座13b:信仰网7:43。对于此幻灯片,请记住Boltzmann Machines。那里也有隐藏的单位和可见的单位,而且都是概率性的。BM和SBN的共同点是多于区别。9:16 如今,“图形模型”有时被视为神经网络的特殊类别,但在此处描述的历史中,它们被认为是非常不同的系统类型。

3
您何时会在分类中使用PCA而不是LDA?
我正在阅读这篇文章,了解主成分分析和多重判别分析(线性判别分析)之间的区别,并且我试图理解为什么您会使用PCA而不是MDA / LDA。 解释总结如下: 粗略地讲,在PCA中,我们试图找到数据散布最大的方差最大的轴(在一个类内,因为PCA将整个数据集视为一个类),而在MDA中,我们额外在最大化各类之间的散布。 您不是总想同时最大化方差和最大化类之间的差异吗?

2
比较R中两个多项式回归之间差异的统计显着性
因此,首先,我在这个论坛上进行了一些研究,我知道 已经提出了非常相似的问题,但是通常没有得到正确答案,或者有时答案不够详尽,我无法理解。所以这一次我的问题是:我有两组数据,每组数据都像这样进行多项式回归: Ratio<-(mydata2[,c(2)]) Time_in_days<-(mydata2[,c(1)]) fit3IRC <- lm( Ratio~(poly(Time_in_days,2)) ) 多项式回归图为: 系数为: > as.vector(coef(fit3CN)) [1] -0.9751726 -4.0876782 0.6860041 > as.vector(coef(fit3IRC)) [1] -1.1446297 -5.4449486 0.5883757 现在,我想知道,是否有一种方法可以使用R函数进行检验,从而知道两个天数的相关区间为[ 1100]。 根据我的理解,我无法直接应用方差分析测试,因为这些值来自两组不同的数据或AIC(用于比较模型/真实数据)。 我试图按照@Roland在相关问题中给出的说明进行操作,但在查看结果时可能会误解了一些内容: 这是我所做的: 我将两个数据集合并为一个。 f是@Roland谈到的可变因素。我将第一组的数字设置为1,将另一组的数字设置为0。 y<-(mydata2[,c(2)]) x<-(mydata2[,c(1)]) f<-(mydata2[,c(3)]) plot(x,y, xlim=c(1,nrow(mydata2)),type='p') fit3ANOVA <- lm( y~(poly(x,2)) ) fit3ANOVACN <- lm( y~f*(poly(x,2)) ) 我的数据现在看起来像这样: 红色的fit3ANOVA仍在工作,但我对蓝色的问题fit3ANOVACN有疑问,该模型的结果很奇怪。我不知道拟合模型是否正确,我不明白@Roland的确切含义。 考虑@DeltaIV解决方案,我想在那种情况下: 即使模型重叠,它们的模型也存在显着差异。我可以这样假设吗?

1
箱形图刻痕与Tukey-Kramer间隔
来自“ R”中箱形图的“缺口” 帮助文档(或原始文本)给出以下内容: 如果两个地块的凹口不重叠,这就是两个中间值不同的“有力证据”(Chambers等,1983,第62页)。有关使用的计算,请参见boxplot.stats。 并且“ boxplot.stats ”给出以下内容: 槽口(如果需要)扩展到+/- 1.58 IQR / sqrt(n)。这似乎是基于与McGill等人(1978年,第16页)中Chambers等人(1983,第62页)中1.57公式相同的计算。它们基于中位数的渐近正态性和所比较的两个中位数的大致相等的样本大小,并且据说对样本的基本分布不敏感。这个想法似乎是为两个中位数的差异给出大约95%的置信区间。 现在,我更加熟悉使用Tukey-Kramer测试的JMP版本比较列的平均值。 JMP文档提供了以下内容: 显示针对所有均值之间差异的测试。这是Tukey或Tukey-Kramer HSD(诚实的显着差异)测试。(Tukey 1953,Kramer 1956)。如果样本大小相同,则此测试为精确的alpha级测试;如果样本大小不同,则为保守测试(Hayter 1984)。 问题:两种方法之间的联系的本质是什么?有没有办法将一个变成另一个? 看起来有人正在寻找中位数的大约95%CI,然后确定是否存在重叠;另一个是“精确阿尔法测试”(我的样本大小相同),用于确定两组样本的中位数是否在彼此的合理范围内。 我参考了软件包,但是我对逻辑背后的数学感兴趣。

1
如何获得非PCA特征向量的向量的“特征值”(解释方差的百分比)?
我想了解如何获取数据集的方差百分比,而不是在PCA提供的坐标空间中,而是在稍微不同的一组(旋转)向量上。 set.seed(1234) xx <- rnorm(1000) yy <- xx * 0.5 + rnorm(1000, sd = 0.6) vecs <- cbind(xx, yy) plot(vecs, xlim = c(-4, 4), ylim = c(-4, 4)) vv <- eigen(cov(vecs))$vectors ee <- eigen(cov(vecs))$values a1 <- vv[, 1] a2 <- vv[, 2] theta = pi/10 rotmat <- matrix(c(cos(theta), sin(theta), -sin(theta), …

1
在R中的ARIMA时间序列中绘制预测值
这个问题可能有一个以上的严重误解,但这并不是要正确地进行计算,而是要着眼于某些重点来激发时间序列的学习。 在试图理解时间序列的应用时,似乎对数据进行去趋势化使得预测未来值变得难以置信。例如,gtemp来自astsa程序包的时间序列如下所示: 在绘制预测的未来值时,需要考虑过去几十年的上升趋势。 但是,为了评估时间序列的波动,需要将数据转换为固定的时间序列。如果我把它模型或差分(我想这是因为中间的进行了ARIMA过程1中order = c(-, 1, -))为: require(tseries); require(astsa) fit = arima(gtemp, order = c(4, 1, 1)) 然后尝试预测未来价值(年),我错过了上升趋势部分:505050 pred = predict(fit, n.ahead = 50) ts.plot(gtemp, pred$pred, lty = c(1,3), col=c(5,2)) 不必一定要对特定ARIMA参数进行实际优化, 如何恢复图的预测部分中的上升趋势? 我怀疑某个地方存在“隐藏”的OLS,这会导致这种不稳定吗? 我遇到了的概念drift,可以将其合并到包的Arima()功能中forecast,从而得出合理的图形: par(mfrow = c(1,2)) fit1 = Arima(gtemp, order = c(4,1,1), include.drift = T) future = forecast(fit1, …

2
同一班级中五个孩子具有相同名字的概率
在婴儿命名论坛上,准父母一直在重复他们的《对珍妮弗的恐惧》的某些版本:“我不希望我的孩子成为同班5名孩子中的一个。” 事实是,没有哪个名字比这种受欢迎程度更接近了,即使在詹妮弗热潮的高峰期,您也没有一个班上有五个人。我想为这些父母提供某种答案,那就是这种名字重复的巧合是多么不可能。 使用美国社会保障局(Social Security Administration)广泛的婴儿名字数据(https://www.ssa.gov/oact/babynames/limits.html),有人可以告诉我如何计算出在美国有5个小学班的机会同名的孩子?(为简单起见,“同名”是指相同的拼写,“学校班级”是指所有孩子都出生于同一年。)我没有指定班级人数,但绝对应大于4 。:-)

1
定期样条以适应定期数据
在对这个问题的评论中,用户@whuber引用了使用样条曲线的定期版本来拟合定期数据的可能性。我想了解更多有关此方法的信息,特别是定义样条曲线的方程式,以及如何在实践中实现它们(我主要是R用户,但如有需要,可以使用MATLAB或Python)。同样,但这是“很高兴”的事情,很高兴知道与三角多项式拟合有关的可能的优点/缺点,这就是我通常如何处理此类数据(除非响应不是很平稳,在这种情况下,我会切换到具有周期性内核的高斯过程。

3
为什么测试误差的CV估计会低估实际测试误差?
据我了解,测试错误的k倍交叉验证估计通常会低估实际测试错误。我很困惑为什么会这样。我明白了为什么训练误差通常低于测试误差的原因-因为您正在使用与估计误差相同的数据来训练模型!但这不是交叉验证的情况-在训练过程中,您特别忽略了测量误差的折线。 另外,说测试误差的交叉验证估计向下偏是否正确?

2
期望
令,,,为独立的。的期望是什么?X1X1X_1X2X2X_2⋯⋯\cdotsXd∼N(0,1)Xd∼N(0,1)X_d \sim \mathcal{N}(0, 1)X41(X21+⋯+X2d)2X14(X12+⋯+Xd2)2\frac{X_1^4}{(X_1^2 + \cdots + X_d^2)^2} 容易找到。但是我不知道如何找到。您能提供一些提示吗?E(X21X21+⋯+X2d)=1dE(X12X12+⋯+Xd2)=1d\mathbb{E}\left(\frac{X_1^2}{X_1^2 + \cdots + X_d^2}\right) = \frac{1}{d}X41(X21+⋯+X2d)2X14(X12+⋯+Xd2)2\frac{X_1^4}{(X_1^2 + \cdots + X_d^2)^2} 到目前为止我得到了什么 我想通过对称找到。但这与因为可能不等于。因此,我需要其他一些想法来找到期望。E(X41(X21+⋯+X2d)2)E(X14(X12+⋯+Xd2)2)\mathbb{E}\left(\frac{X_1^4}{(X_1^2 + \cdots + X_d^2)^2}\right)E(X21X21+⋯+X2d)E(X12X12+⋯+Xd2)\mathbb{E}\left(\frac{X_1^2}{X_1^2 + \cdots + X_d^2}\right)E(X4i(X21+⋯+X2d)2)E(Xi4(X12+⋯+Xd2)2)\mathbb{E}\left(\frac{X_i^4}{(X_1^2 + \cdots + X_d^2)^2}\right)E(X2iX2j(X21+⋯+X2d)2)E(Xi2Xj2(X12+⋯+Xd2)2)\mathbb{E}\left(\frac{X_i^2X_j^2}{(X_1^2 + \cdots + X_d^2)^2}\right) 这个问题来自哪里 数学堆栈交换中的一个问题要求S ^ {d-1}上的单位均匀随机向量x的方差。我的推导表明,答案非常取决于\ mathbb {E} \ left(\ frac {X_i ^ 4} {(X_1 …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.