统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
预测是判断统计学家能力的“黄金标准”吗?
上周末,我正在阅读Faraway的带有R(第一版)的线性模型教科书。Faraway有一章称为“统计策略和模型不确定性”。他描述(第158页)时,他使用非常复杂的模型人工生成了一些数据,然后要求学生对数据进行建模,并将学生的预测结果与读取结果进行比较。不幸的是,大多数学生过度拟合了测试数据,并给出了完全超出预期的预测值。为了解释这种现象,他给我写了一些令人印象深刻的话: “模型之所以如此不同,是因为学生以不同的顺序应用了各种方法。有些人在变换之前进行了变量选择,而另一些则相反。有些人在模型更改后重复了一种方法,而其他人则没有。我研究了这些策略那几个用于学生和找不到什么明显的错误与他们所做的一切。有一个学生在计算犯了错误他或她的预测值,但没有什么明显错误的其余部分。在这个任务中的表现并没有表现出与考试有任何关系。 ” 我受过教育,模型预测的准确性是我们选择最佳模型性能的“黄金标准”。如果我没记错的话,这也是Kaggle比赛中常用的方法。但是在这里Faraway观察到了一些不同的性质,即模型预测性能可能与无关具有相关统计人员的能力。换句话说,我们能否根据预测能力建立最佳模型并不能真正取决于我们的经验。相反,它取决于巨大的“模型不确定性”(运气不佳?)。我的问题是:在现实生活中的数据分析中也是如此吗?还是我对基本的东西感到困惑?因为如果这是真的,那么对真实数据分析的意义是巨大的:在不知道数据背后的“真实模型”的情况下,经验丰富/经验不足的统计学家所做的工作之间就没有本质的区别:两者都只是前面的疯狂猜测。可用的培训数据。


1
赔率变得简单
我在理解赔率时遇到了一些麻烦,我只想对如何解释赔率进行基本解释。 我发现了各种与赔率相关的帖子,但其中大多数比我想理解的要复杂。这是我如何解释赔率的示例:如果某事件发生的几率是3比1,那么该事件每发生1次就会发生3次。我不知道这种解释是否正确。因此,在解释赔率方面的任何指导和更多示例将不胜感激。

5
无限次滚动选择的模具的平均值
如果我无数次掷骰子,并且总是选择两个骰子中的较高者,那么期望的最高平均值是否会超过3.5? 看来一定是因为,如果我掷出一百万个骰子,并且每次都选择最高值,那么每次掷出六位数的可能性就非常大。因此,预期均值必须类似于5.999999999999 ... 但是,我似乎无法通过仅使用2个骰子来弄清楚我的示例的期望值是多少。有人可以帮我打电话吗?会勉强超过3.5吗?这甚至是可以计算的吗?
13 dice 

1
说明“本征”如何帮助反转矩阵
我的问题与geoR:::.negloglik.GRF或中利用的计算技术有关geoR:::solve.geoR。 在线性混合模型设置中: 其中和分别是固定效应和随机效应。此外,Y=Xβ+Zb+eY=Xβ+Zb+e Y=X\beta+Zb+e ββ\betabbbΣ=cov(Y)Σ=cov(Y)\Sigma=\text{cov}(Y) 估算效果时,需要计算 ,通常可以使用来完成,但是有时几乎不可逆,因此请运用技巧(X′Σ−1X)−1X′Σ−1Y(X′Σ−1X)−1X′Σ−1Y (X'\Sigma^{-1}X)^{-1}X'\Sigma^{-1} Y solve(XtS_invX,XtS_invY)(X′Σ−1X)(X′Σ−1X)(X'\Sigma^{-1}X)geoR t.ei=eigen(XtS_invX) crossprod(t(t.ei$vec)/sqrt(t.ei$val))%*%XtS_invY (可以在geoR:::.negloglik.GRF和中看到geoR:::.solve.geoR)等于分解 ,其中,因此 (X′Σ−1X)=ΛDΛ−1(X′Σ−1X)=ΛDΛ−1 (X'\Sigma^{-1}X)=\Lambda D \Lambda^{-1}\\ Λ′=Λ−1Λ′=Λ−1\Lambda'=\Lambda^{-1}(X′Σ−1X)−1=(D−1/2Λ−1)′(D−1/2Λ−1)(X′Σ−1X)−1=(D−1/2Λ−1)′(D−1/2Λ−1) (X'\Sigma^{-1}X)^{-1}=(D^{-1/2}\Lambda^{-1})'(D^{-1/2}\Lambda^{-1}) 两个问题: 本征分解如何帮助反转?(X′Σ−1X)(X′Σ−1X)(X'\Sigma^{-1}X) 还有其他可行的选择(强大且稳定)吗?(例如qr.solve或chol2inv?)

1
协作过滤的最新技术
我正在研究一个用于协同过滤(CF)的项目,即完成部分观察到的矩阵或更一般的张量。我是该领域的新手,最终,对于这个项目,我不得不将我们的方法与当今其他著名的方法进行比较,将提议的方法与它们进行比较,即CF中的最新技术。 我的搜索显示了以下方法。确实,我是通过查看其中的一些论文及其参考文献,或者在进行比较时查看实验部分来发现它们的。我很高兴知道新提出的方法并与SoTA进行比较,那么以下哪个是一个不错的选择?如果没有他们,我很高兴认识一个好的代表。 基于矩阵分解: 加权低秩近似(ICML 2003) 为协作过滤建模用户评级配置文件(NIPS 2003) 协同过滤的多重乘数模型(ICML 2004) 用于协作预测的快速最大保证金矩阵分解(ICML 2005) 概率矩阵分解(NIPS 2007) 贝叶斯概率矩阵分解(ICML 2008) 基于回归的潜在因子模型(KDD 2009) 具有高斯过程的非线性矩阵分解(ICML 2009) 动态Poission分解(ACM会议推荐系统大会2015) 基于张量分解 使用多维方法将上下文信息整合到推荐系统中(ACM信息系统交易(TOIS)2005) 贝叶斯概率张量因式分解(SIAM Data Mining 2010) 通过黎曼优化实现低秩张量完成(BIT数值数学54.2(2014))

3
回归模型的定义和定界
一个令人尴尬的简单问题-但似乎之前尚未在Cross Validated上问过: 回归模型的定义是什么? 还有一个支持问题 什么不是回归模型? 关于后者,我对棘手的示例感兴趣,这些示例的答案不是立即显而易见的,例如ARIMA或GARCH。

3
线性回归:是否有任何非正态分布给出OLS和MLE的身份?
这个问题的灵感来自长期的评论讨论: 线性回归如何使用正态分布? 在通常的线性回归模型中,为了简单此处写入只有一个预测器: ÿ一世= β0+ β1个X一世+ ϵ一世Yi=β0+β1xi+ϵi Y_i = \beta_0 + \beta_1 x_i + \epsilon_i 其中X一世xix_i是已知的常数,ϵ一世ϵi\epsilon_i是零均值独立误差项。如果我们除了承担的误差正态分布,则通常的最小二乘估计和最大似然估计β0,β1个β0,β1\beta_0, \beta_1是相同的。 因此,我的问题很简单:误差项是否存在其他分布,以使mle与普通最小二乘方估计量相同?一种含义很容易显示,另一种则不然。

1
这是什么样的图表?
很抱歉这个模糊的问题,但是这张表出现在Biddle等人的文章中。2009年,我之前从未遇到过类似的事情。这是一个带有斜边的条形图,有时是“角”。这些是什么意思?这种图表有名称吗? 根据/meta/244083/site-for-asking-about-charts,我认为学术界是最好的询问场所。

7
将结果称为“接近”或“某种”有意义是错误的吗?
关于类似问题的普遍共识是:将结果称为“高度重要”是错误的吗?“高度显着”是一种有效的(尽管不是特定的)方式,用于描述p值远低于预设的显着性阈值的关联强度。但是,如何描述稍微高于阈值的p 值呢?我已经看到一些论文使用诸如“有些重要”,“几乎重要”,“接近重要性”之类的术语。我发现这些术语有些不切实际,在某些情况下,这是一种界限分明的卑鄙的方式,可以从有意义的结果中排除有意义的结果。这些术语可以用来描述“仅仅错过”您的p值临界值的结果吗?

3
对中和缩放虚拟变量
我有一个包含分类变量和连续变量的数据集。建议我将分类变量转换为每个级别的二进制变量(即A_level1:{0,1},A_level2:{0,1})-我认为有些人将其称为“虚拟变量”。 话虽这么说,然后使用新变量对整个数据集进行居中和缩放会产生误导吗?似乎我将失去变量的“开/关”含义。 如果产生误导,是否意味着我应该分别对连续变量进行居中和缩放,然后将其重新添加到我的数据集中? TIA。


1
假设PCA始终旋转坐标轴,那么“旋转”和“未旋转”的主要成分是什么?
据我了解,主要成分是通过旋转坐标轴使其与最大方差方向对齐来获得的。 不过,我一直在阅读有关“未旋转的主成分”的信息,而我的统计软件(SAS)为我提供了varimax旋转的主成分以及未旋转的主成分。在这里,我很困惑:当我们计算主成分时,轴已经旋转了。那为什么还需要轮换呢?“未旋转的主要成分”是什么意思?

1
如何训练深度网络的LSTM层
我正在使用lstm和前馈网络对文本进行分类。 我将文本转换为一键向量,然后将其输入到lstm中,这样我就可以将其总结为单个表示形式。然后,我将其馈送到另一个网络。 但是我如何训练LSTM?我只想按顺序对文本进行分类-是否应在未经培训的情况下进行输入?我只想将段落表示为单个项目,然后将其输入分类器的输入层。 我将不胜感激与此有关的任何建议! 更新: 所以我有一个lstm和一个分类器。我将lstm的所有输出并平均池化,然后将平均值输入分类器。 我的问题是我不知道如何训练lstm或分类器。我知道对于lstm的输入应该是什么,对于该输入的分类器的输出应该是什么。由于它们是两个单独的网络,它们只是按顺序激活的,因此我需要知道和不知道lstm的理想输出应该是什么,它也是分类器的输入。有没有办法做到这一点?

3
卷积神经网络如何精确地使用卷积代替矩阵乘法?
我正在读Yoshua Bengio关于深度学习的书,它在第224页上说: 卷积网络只是简单的神经网络,它在其至少一层中使用卷积代替一般的矩阵乘法。 但是,我不是100%确定如何从数学上精确地“通过卷积替换矩阵乘法”。 我真正感兴趣的是为1D中的输入向量定义此值(例如),因此我将没有输入作为图像并尝试避免2D的卷积。x∈Rdx∈Rdx \in \mathbb{R}^d 因此,例如,在“正常”神经网络中,操作和馈送模式可以简洁地表达,如Andrew Ng的注释: ˚F (Ž (升+ 1 ))= 一个(升+ 1 )W(l)a(l)=z(l+1)W(l)a(l)=z(l+1) W^{(l)} a^{(l)} = z^{(l+1)} f(z(l+1))=a(l+1)f(z(l+1))=a(l+1) f(z^{(l+1)}) = a^{(l+1)} 其中是在使向量通过非线性之前计算的向量。非线性作用在向量并且是有关层的隐藏单元的输出/激活。 ˚F Ž (升)一个(升+ 1 )z(l)z(l)z^{(l)}fffz(l)z(l)z^{(l)}a(l+1)a(l+1)a^{(l+1)} 对我来说,这种计算很清楚,因为矩阵乘法已为我明确定义,但是,用卷积代替矩阵乘法对我来说似乎并不明确。即 ˚F (Ž (升+ 1 ))= 一个(升+ 1 )W(l)∗a(l)=z(l+1)W(l)∗a(l)=z(l+1) W^{(l)} * a^{(l)} = z^{(l+1)} f(z(l+1))=a(l+1)f(z(l+1))=a(l+1) f(z^{(l+1)}) = a^{(l+1)} 我想确保我能精确地数学理解上述方程式。 …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.