统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
如何编写Bertrand盒悖论的蒙特卡罗模拟?
在Mensa International Facebook页面上发布了以下问题: \quad\quad\quad\quad\quad\quad\quad\quad 该帖子本身收到了1000多个评论,但由于我知道这是Bertrand的“盒子悖论”,而答案是,因此我不会在此处详细讨论辩论。让我感兴趣的是,如何使用蒙特卡洛方法回答这一问题?该算法如何解决这个问题?2323\frac23 这是我的尝试: 生成到之间的均匀分布的随机数。0 1NNN000111 让事件框包含选择的2个金球(方框1)小于一半。 计数数字,小于,并调用结果作为。秒0.50.50.5SSS 由于确定如果选择了框1,就肯定会得到金球,如果选择了框2,则只有50%的机会会得到金球,因此,得到序列GG的概率为 P(B2=G|B1=G)=SS+0.5(N−S)P(B2=G|B1=G)=SS+0.5(N−S)P(B2=G|B1=G)=\frac{S}{S+0.5(N-S)} 在R中实现上述算法: N <- 10000 S <- sum(runif(N)<0.5) S/(S+0.5*(N-S)) 上面程序的输出大约是,几乎与正确答案匹配,但是我不确定这是正确的方法。是否有适当的方法以编程方式解决此问题?0.670.670.67

3
研究人员1运行1000个回归,研究人员2仅运行1,两者都得到相同的结果-他们应该做出不同的推论吗?
想象一个研究人员正在探索一个数据集并运行1000个不同的回归,他发现其中一个有趣的关系。 现在想象一下,具有相同数据的另一位研究人员 仅进行了1次回归,结果发现另一位研究人员进行了1000次回归才能找到相同的结果。研究者2不认识研究者1。 研究人员1是否应做出与研究人员2不同的推论?为什么?例如,研究人员1应该执行多重比较校正,而研究人员2不应该执行多重比较校正吗? 如果研究人员2首先向您显示了他的单一回归,您将做出什么推论?如果该研究人员1向您显示了他的结果之后,您是否应该更改自己的推断?如果是这样,那为什么重要呢? PS 1:如果谈论假设研究者使问题变得抽象,请考虑一下:假设您使用最佳方法对论文进行了一次回归。然后,另一位研究人员使用相同的数据探索了1000种不同的回归,直到发现与您运行的完全相同的回归。你们两个应该推论吗?两种情况的证据是否相同?如果您知道其他研究人员的结果,是否应该更改自己的推论?公众应如何评估两项研究的证据? PS 2:请尽量具体,并在可能的情况下提供数学/理论上的依据!

1
是个根本转变建议?
我的同事想在通过将响应变量提高到(即)的幂后,对一些数据进行分析。 ÿ0.1251818\frac18y0.125y0.125y^{0.125} 我对此感到不舒服,但努力阐明原因。我想不出这种转换的任何机械原理。我以前也从未看过它,我担心它可能会夸大I型错误率或某种程度-但我无力支持这些担忧! 另外,我的同事发现,在AIC比较中,这些转换后的模型优于未转换的模型。这本身是否可以证明其用途合理?

1
广义加性模型(GAM),交互作用和协变量
我一直在探索许多用于预测的工具,并且发现广义可加模型(GAM)具有最大的潜力。GAM非常棒!它们允许非常简洁地指定复杂的模型。但是,同样的简洁性使我有些困惑,特别是在GAM如何理解交互作用项和协变量方面。 考虑一个示例数据集(发布后的代码可重现),其中y是一个由几个高斯扰动的单调函数,外加一些噪声: 数据集具有一些预测变量: x:数据索引(1-100)。 w:辅助功能标记出y存在高斯的部分。w的值为1-20,其中x介于11到30之间,以及51到70之间。否则w为0。 w2:w + 1,因此没有0值。 R的mgcv软件包可轻松为这些数据指定许多可能的模型: 模型1和2非常直观。默认情况下,y仅根据索引值进行x平滑度预测会产生一些模糊正确的提示,但过于平滑。y仅根据w结果预测存在于的“平均高斯”模型中y,而没有其他w值的“感知”模型,所有其他数据点的值均为0。 模型3同时使用x和w作为1D平滑,产生了很好的拟合。模型4使用x并w在2D平滑中使用,也非常适合。这两个模型非常相似,尽管不完全相同。 模型5 x通过“ 模型” w。模型6则相反。mgcv的文档指出,“ by参数可确保平滑函数乘以[by参数中给定的协变量]”。那么5和6型不应该等效吗? 模型7和8使用预测变量之一作为线性项。这些对我来说很直观,因为它们只是在使用GLM对这些预测变量进行处理,然后将影响添加到模型的其余部分。 最后,模型9与模型5相同,除了模型x“通过” w2(为w + 1)进行了平滑处理。对我而言,奇怪的是,w2“ by”交互中缺少零会产生明显不同的效果。 所以,我的问题是: 3型和4型的规格之间有何区别?还有其他例子可以更清楚地说明差异吗? 确切地说,“通过”在这里做什么?我在伍德的书中读到的大部分内容以及该网站的内容都表明“ by”会产生乘法效应,但是我很难理解它的直觉。 为什么模型5和9之间会有如此显着的差异? 接下来是Reprex,用R编写。 library(magrittr) library(tidyverse) library(mgcv) set.seed(1222) data.ex <- tibble( x = 1:100, w = c(rep(0, 10), 1:20, rep(0, 20), 1:20, rep(0, 30)), w2 = …
12 r  modeling  gam  mgcv 

5
线性回归过时了吗?[关闭]
已关闭。这个问题是基于观点的。它当前不接受答案。 想改善这个问题吗?更新问题,以便通过编辑此帖子以事实和引用的形式回答。 2年前关闭。 我目前正在参加线性回归课程,但我无法撼动自己的感觉,即我正在学习的内容不再与现代统计学或机器学习相关。当如今有这么多有趣的数据集经常违反线性回归的许多不切实际的假设时,为什么要花那么多时间进行简单或多元线性回归的推理?为什么不代之以关于更灵活,更现代的工具(如使用支持向量机或高斯过程进行回归)的推理呢?尽管比在空间中找到一架超飞机要复杂得多,但这不会为学生提供更好的背景来解决现代问题吗?

1
GAM适合性摘要
如果我们适合GAM,例如: gam.fit = gam::gam(Outstate ~ Private + s(Room.Board, df = 2) + s(PhD, df = 2) + s(perc.alumni, df = 2) + s(Expend, df = 5) + s(Grad.Rate, df = 2), data = College) 在哪里,我们使用数据集College,该数据集可以在package中找到ISLR。 现在,如果找到适合的摘要,则可以看到: > summary(gam.fit) Call: gam(formula = Outstate ~ Private + s(Room.Board, df = 2) + …
12 anova  gam 

2
了解逻辑回归和可能性
参数估计/逻辑回归训练如何真正起作用?我将尽我所能。 输出是y的逻辑函数输出,其概率形式取决于x的值: P(y=1|x)=11+e−ωTx≡σ(ωTx)P(y=1|x)=11+e−ωTx≡σ(ωTx)P(y=1|x)={1\over1+e^{-\omega^Tx}}\equiv\sigma(\omega^Tx) P(y=0|x)=1−P(y=1|x)=1−11+e−ωTxP(y=0|x)=1−P(y=1|x)=1−11+e−ωTxP(y=0|x)=1-P(y=1|x)=1-{1\over1+e^{-\omega^Tx}} 对于一个维度,所谓的赔率定义如下: p(y=1|x)1−p(y=1|x)=p(y=1|x)p(y=0|x)=eω0+ω1xp(y=1|x)1−p(y=1|x)=p(y=1|x)p(y=0|x)=eω0+ω1x{{p(y=1|x)}\over{1-p(y=1|x)}}={{p(y=1|x)}\over{p(y=0|x)}}=e^{\omega_0+\omega_1x} 现在添加log函数以线性形式获取W_0和W_1: Logit(y)=log(p(y=1|x)1−p(y=1|x))=ω0+ω1xLogit(y)=log(p(y=1|x)1−p(y=1|x))=ω0+ω1xLogit(y)=log({{p(y=1|x)}\over{1-p(y=1|x)}})=\omega_0+\omega_1x 现在到问题部分 使用似然性(Big X是y) 谁能说出为什么我们两次考虑y = 1的概率?由于: L(X|P)=∏i=1,yi=1NP(xi)∏i=1,yi=0N(1−P(xi))L(X|P)=∏i=1,yi=1NP(xi)∏i=1,yi=0N(1−P(xi))L(X|P)=\prod^N_{i=1,y_i=1}P(x_i)\prod^N_{i=1,y_i=0}(1-P(x_i))P(y=0|x)=1−P(y=1|x)P(y=0|x)=1−P(y=1|x)P(y=0|x)=1-P(y=1|x) 以及如何从中得到ω的值?

2
构造示例显示
如何构造一个E(1X)=1E(X)E(1X)=1E(X)\mathbb{E}\left(\frac{1}{X}\right)=\frac{1}{\mathbb{E}(X)}假设P(X≠0)=1P(X≠0)=1\mathbb{P}(X\ne0)=1? E(X )成立。 从Jensen不等式得出的正值RV XXX的不等式类似于E(1X)≥1E(X)E(1X)≥1E(X)\mathbb{E}\left(\frac{1}{X}\right)\ge\frac{1}{\mathbb{E}(X)}(如果X&lt;0X&lt;0X<0则为反向不等式)。这是因为该映射x↦1xx↦1xx\mapsto\frac{1}{x}对于x&gt;0x&gt;0x>0是凸的,对于x&lt;0x&lt;0x<0凹的。遵循詹森不等式中的等式条件,我猜想分布必须退化才能保持所需的等式。如果X=1X=1X=1ae,则等式成立的一个简单情况当然是在问题书中找到的一个示例:考虑一个离散随机变量XXX,使得P(X=−1)=19,P(X=12)=P(X=2)=49P(X=−1)=19,P(X=12)=P(X=2)=49\mathbb{P}(X=-1)=\frac{1}{9}, \mathbb{P}(X=\frac{1}{2})=\mathbb{P}(X=2)=\frac{4}{9}。然后可以很容易地验证E(1X)=1E(X)=1E(1X)=1E(X)=1\mathbb{E}\left(\frac{1}{X}\right)=\frac{1}{\mathbb{E}(X)}=1。 此示例表明,XXX不必为正(或负)ae即可保持标题中的相等。这里的分布也不退化。 我如何构造一个示例,可能就像我在书中找到的那样?有动力吗?

1
使用样条或分数多项式时,如何处理丢失的数据?
我正在阅读多变量模型构建: Patrick Royston和Willie Sauerbrei提出的基于分数多项式的实用回归分析模型,用于对连续变量进行建模。到目前为止,我印象深刻,这是我以前从未考虑过的有趣方法。 但是作者没有处理丢失的数据。的确,在p。17他们说丢失数据“引入了许多其他问题。这里不考虑。” 多重插补是否可以使用分数多项式&gt; 在某些方面(但不是全部),FP是样条曲线的替代方法。样条回归处理缺失数据是否更容易?

3
有没有人比今天的Usain Bolt快?
编辑:我对给定样本统计量的给定总体中确定“真实”最大值的可能性的技术问题和方法更感兴趣。从创纪录的短跑时间来估算比博尔特先生更快的跑动者的可能性是显而易见的,这是显而易见的。通过想象并非如此来嘲笑我。 Usain Bolt是最快跑出100m的人。但是,鉴于运动员的数量很少,看来“真正的”最快的人还活着坐在某个地方的沙发上,从未尝试过竞争性的跑步生涯。 我试图利用这样一个事实,即正态分布尾部的样本之间的差异越来越小。我正在使用它通过将Usain与第二快,第三快等进行比较,来计算存在比Usain Bolt更快的人的可能性。 为此,我试图通过将正态分布的CDF相对于的导数计算出来,从而将“ Usain Bolt”之外的最大值计算出来,将其yyy提高到第nnn个(其中nnn约为7,000,000,000或样本小于“最大值”-其背后的逻辑在“ 德国坦克问题维基百科”页面中进行了描述,该页面概括了不同分布之间的关系,例如: ∫∞0yfYN(y)dy=λn∫∞0y[12[1+erf(y−μσ2√)]]n−112πσ2√e−(y−μ)22σ2dy∫0∞yfYN(y)dy=λn∫0∞y[12[1+erf⁡(y−μσ2)]]n−112πσ2e−(y−μ)22σ2dy\int_{0}^{\infty}y f_{Y_N} (y)dy = \lambda n \int_{0}^{\infty} y \left [ \tfrac12\left[1 + \operatorname{erf}\left( \frac{y-\mu}{\sigma\sqrt{2}}\right)\right] \right ]^{n-1} \frac{1}{\sqrt{2\pi\sigma^2}}\, e^{-\frac{(y - \mu)^2}{2 \sigma^2}}dy 这是一种计算存在某人的概率比Usain Bolt更快的有效方法吗? 在“其他分布的德国坦克问题”之外,这种问题是否有名称? 有没有一种很好的方法可以从分布的极端样本估计标准偏差?查找有关有史以来最快的1亿个破折号的信息很容易,很难找到平均值和方差) 感谢您耐心与没有背景知识的程序员打交道。

3
PCA优化是否凸出?
主成分分析(PCA)的目标函数是使L2范数中的重构误差最小化(请参阅此处的 2.12节。另一种观点试图使投影的方差最大化。我们在此处也有一篇很不错的文章:PCA的目标函数是什么?)。 我的问题是PCA优化凸出吗?(我在这里找到了一些讨论,但希望有人可以在这里提供有关CV的很好的证明)。


2
GLM和GAM中的样条
仅在GAM模型中提供样条而不在GLM模型中提供样条是错误的吗?我前不久听到了这个消息,想知道这是否只是一个误解,或有什么道理。这是一个例子:

1
为什么冗余均值参数化可以加快Gibbs MCMC?
在Gelman&Hill(2007)的书(使用回归和多级/层次模型进行数据分析)中,作者声称包括冗余均值参数可以帮助加快MCMC。 给定的示例是“飞行模拟器”(公式13.9)的非嵌套模型: yiγjδk∼N(μ+γj[i]+δk[i],σ2y)∼N(0,σ2γ)∼N(0,σ2δ)yi∼N(μ+γj[i]+δk[i],σy2)γj∼N(0,σγ2)δk∼N(0,σδ2) \begin{align} y_i &\sim N(\mu + \gamma_{j[i]} + \delta_{k[i]}, \sigma^2_y) \\ \gamma_j &\sim N(0, \sigma^2_\gamma) \\ \delta_k &\sim N(0, \sigma^2_\delta) \end{align} 他们建议重新参数化,并添加平均参数和,如下所示:μγμγ\mu_\gammaμδμδ\mu_\delta γj∼N(μγ,σ2γ)δk∼N(μδ,σ2δ)γj∼N(μγ,σγ2)δk∼N(μδ,σδ2) \begin{align} \gamma_j \sim N(\mu_\gamma, \sigma^2_\gamma) \\ \delta_k \sim N(\mu_\delta, \sigma^2_\delta) \end{align} 提供的唯一理由是(第420页): 仿真可能会陷入整个矢量(或)远离零的配置中(即使分配了均值为0的分布)。最终,模拟将收敛到正确的分布,但是我们不想等待。γγ\gammaδδ\delta 冗余均值参数如何解决此问题? 在我看来,非嵌套模型的速度较慢,主要是因为和呈负相关。(实际上,如果一个总数上升,则另一个则必须下降,因为它们的总和被数据“固定”了)。冗余均值参数是否有助于降低和之间的相关性,或完全减少其他方面的相关性?γγ\gammaδδ\deltaγγ\gammaδδ\delta

2
Kaggle比赛是不是偶然赢了?
Kaggle竞赛根据坚持下来的测试集确定最终排名。 保留的测试集是一个样本;它可能不代表正在建模的总体。由于每个提交都像一个假设,因此赢得竞争的算法可能完全有可能比其他方法更好地匹配测试集。换句话说,如果选择了不同的测试集并重复了比赛,排名会保持不变吗? 对于赞助公司而言,这并不重要(可能前20名提交者会改善他们的基准)。尽管具有讽刺意味的是,他们最终可能会使用比其他前五名更糟糕的第一名的模型。但是,对于竞争参与者来说,Kaggle似乎最终是一种机会游戏-不需要偶然找到正确的解决方案,而是需要偶然找到与测试集匹配的解决方案! 是否可以改变比赛方式,以便所有无法在统计上区分的顶级球队获胜?或者,在这一组中,最简约或计算便宜的模型能否获胜?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.