统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
贝叶斯统计如何处理先验缺失?
这个问题的灵感来自于我最近的两次互动,一次是在简历中,另一次是在Economics.se。 在那里,我已经发布了一个答案,以著名的“信封悖论”(请注意,不是在 “正确答案”,而是从具体的假设,流程约情况的结构的答案)。一段时间后,一个用户发表了评论,我进行了交谈,试图了解他的观点。很明显,他在思考贝叶斯方法,并不停地谈论先验-然后我恍然大悟,我对我自己说:“等一下,谁说过任何事先什么吗?在路上,我已经制定了问题,这里没有先验条件,他们只是不需要输入图片,也不需要”。 最近,我在简历中看到了关于统计独立性的答案。我向作者评论说他的判决 “ ...如果事件在统计上是独立的,那么(根据定义)我们不能从观察另一个事件中学到任何事情。” 是公然的错误。在评论交流中,他一直回头谈(他的话) ““学习”是否意味着基于对另一个事物的观察来改变我们对事物的信念? 再一次,很明显,他正在思考贝叶斯方法,并且他认为不言而喻,我们是从某种信念(即先验)开始的,然后是我们如何更改/更新它们的问题。但是,如何建立第一至第一的信念? 由于科学必须符合现实,因此我注意到存在这样的情况,即所涉及的人类没有先例(一件事,我一直都没有任何先例地进入情况,并且请不要争辩说我确实有先例,但是我只是不了解而已,让我们在此处进行虚假的精神分析)。 因为我碰巧听到过“无信息先验”一词,所以我将问题分为两个部分,并且我可以肯定,在贝叶斯理论中精通的用户确切知道我要问的问题: 问题1:是否没有先验等价物(从严格的理论意义上讲)与没有信息的先验相提并论? 如果对Q1的回答是“是”(请作详细说明),则意味着贝叶斯方法是普遍适用的,并且从一开始就适用,因为在任何情况下,涉案人员都宣称“我没有先验”,我们可以补充一下。它所处的先验地位对于手头的案件没有多大意义。 但是,如果对Q1的回答为“否”,那么Q2就会出现: 问题2:如果问题1的答案为“否”,是否表示在没有先验条件的情况下,贝叶斯方法从一开始就不适用,我们必须首先通过某种非贝叶斯方法形成先验条件,这样我们就可以随后应用贝叶斯方法了?

2
哪种分布形式产生“毕达哥拉斯的期望”?
令和是由相同的未指定分布形式生成的独立连续随机变量,但允许使用不同的参数值。我感兴趣的是找到一种参数分布形式,对于所有允许的参数值,其以下采样概率均适用:ý 〜DIST (θ Ý)X〜距离(θX)X〜距离(θX)X \sim \text{Dist}(\theta_X)ÿ〜距离(θÿ)ÿ〜距离(θÿ)Y \sim \text{Dist}(\theta_Y) P(X> Y| θX,θÿ)= θ2Xθ2X+ θ2ÿ。P(X>ÿ|θX,θÿ)=θX2θX2+θÿ2。\mathbb{P}(X > Y| \theta_X, \theta_Y) = \frac{\theta_X^2}{\theta_X^2 + \theta_Y^2}. 我的问题:谁能告诉我这适合的连续分布形式?是否有导致这种情况的(非平凡的)一般条件? 我的初步想法:如果将两个参数乘以任何非零常数,则概率保持不变,因此是某种比例参数是有意义的。θθ\theta


2
当我在逻辑回归设置中使用平方损失时,这里发生了什么?
我正在尝试使用平方损失对玩具数据集进行二进制分类。 我正在使用mtcars数据集,使用英里/加仑和重量来预测传输类型。下图显示了两种不同颜色的传输类型数据,以及由不同损失函数生成的决策边界。平方损失是 ∑i(yi−pi)2∑i(yi−pi)2\sum_i (y_i-p_i)^2,其中yiyiy_i是地面实况标签(0或1)和pipip_i是预测概率pi=Logit−1(βTxi)pi=Logit−1(βTxi)p_i=\text{Logit}^{-1}(\beta^Tx_i)。换句话说,我将逻辑损失替换为分类设置中的平方损失,其他部分相同。 对于一个玩具的例子 mtcars数据,在很多情况下,我得到的模型与逻辑回归相似(请参见下图,随机种子为0)。 但是在某些方面(如果我们这样做 set.seed(1)),平方损失似乎效果不佳。 这是怎么回事 优化不收敛?与平方损失相比,逻辑损失更易于优化?任何帮助,将不胜感激。 码 d=mtcars[,c("am","mpg","wt")] plot(d$mpg,d$wt,col=factor(d$am)) lg_fit=glm(am~.,d, family = binomial()) abline(-lg_fit$coefficients[1]/lg_fit$coefficients[3], -lg_fit$coefficients[2]/lg_fit$coefficients[3]) grid() # sq loss lossSqOnBinary<-function(x,y,w){ p=plogis(x %*% w) return(sum((y-p)^2)) } # ---------------------------------------------------------------- # note, this random seed is important for squared loss work # ---------------------------------------------------------------- set.seed(0) x0=runif(3) x=as.matrix(cbind(1,d[,2:3])) y=d$am opt=optim(x0, lossSqOnBinary, …

6
我怎么能发现正态分布?
什么是正态分布的第一个推导,您能否重现该推导并在其历史背景下进行解释? 我的意思是,如果人类忘记了正态分布,那么我最有可能重新发现它的方式是什么,最可能的推导是什么?我猜想最初的推导一定是作为尝试寻找快速方法来计算基本离散概率分布(例如二项式)的副产品而来的。那是对的吗?


2
伽玛随机变量对数的偏度
考虑伽玛随机变量 。对于均值,方差和偏度,有一些简洁的公式:X∼Γ(α,θ)X∼Γ(α,θ)X\sim\Gamma(\alpha, \theta) E[X]Var[X]Skewness[X]=αθ=αθ2=1/α⋅E[X]2=2/α−−√E[X]=αθVar⁡[X]=αθ2=1/α⋅E[X]2Skewness⁡[X]=2/α\begin{align} \mathbb E[X]&=\alpha\theta\\ \operatorname{Var}[X]&=\alpha\theta^2=1/\alpha\cdot\mathbb E[X]^2\\ \operatorname{Skewness}[X]&=2/\sqrt{\alpha} \end{align} 现在考虑对数转换后的随机变量。维基百科给出了均值和方差的公式:Y=log(X)Y=log⁡(X)Y=\log(X) E[Y]Var[Y]=ψ(α)+log(θ)=ψ1(α)E[Y]=ψ(α)+log⁡(θ)Var⁡[Y]=ψ1(α)\begin{align} \mathbb E[Y]&=\psi(\alpha)+\log(\theta)\\ \operatorname{Var}[Y]&=\psi_1(\alpha)\\ \end{align} 通过digamma和trigamma函数定义为γ函数对数的一阶和二阶导数。 偏度的公式是什么? 会出现四伽马功能吗? (让我对此感到疑惑的是在对数正态分布和伽马分布之间进行选择,请参阅Gamma与对数正态分布。在其他方面,它们的偏度属性有所不同。特别是,对数正态的对数偏度几乎等于零。伽玛对数的偏度为负。但是如何为负?

2
当我们只有关于当前素食者的调查数据时,如何计算对素食主义者的平均坚持时间?
调查了随机样本。他们被问是否吃素食。如果他们回答“是”,他们还被要求说明他们吃素饮食已经连续多长时间了。我想使用此数据来计算对素食主义的平均坚持时间。换句话说,当某人成为素食主义者时,我想知道他们平均会长期保持素食。假设: 所有受访者都给出了正确准确的答复 世界是稳定的:素食主义的流行没有改变,平均遵守时间也没有改变。 到目前为止我的推理 我发现分析世界的玩具模型很有帮助,每年年初两个人成为素食主义者。每次,他们其中一名保持素食一年,另一年保持三年。显然,这个世界的平均遵守时间为(1 + 3)/ 2 = 2年。这是说明该示例的图形。每个矩形代表一个素食主义时期: 假设我们在第4年中期(红线)进行了调查。我们得到以下数据: 如果从第3年开始的任何一年进行调查,我们将获得相同的数据。 (2 * 0.5 + 1.5 + 2.5)/ 4 = 1.25 我们低估了我们的假设,因为我们假设所有人在调查后都不再是素食主义者,这显然是错误的。为了获得接近于这些参与者保持素食的真实平均时间的估计,我们可以假设他们平均报告了素食主义时期的一半时间,并且将报告的持续时间乘以2。从人群中(就像我正在分析的人群),我认为这是一个现实的假设。至少它会给出正确的期望值。但是,如果只做一倍,我们的平均值为2.5,这被高估了。这是因为人保持素食的时间越长,他在当前素食者样本中的可能性就越大。 然后,我认为当前素食者样本中某人的概率与他们的素食主义时长成正比。为了解决这种偏见,我尝试将当前素食者的人数除以他们预计的坚持时间: 但是,这也会给出错误的平均值: (2 * 1 +⅓* 3 +⅕* 5)/(2 +⅓+⅕)= 4 / 2.533333 = 1.579年 如果将素食者的人数除以他们的正确坚持时间,就会得出正确的估计: (1 +⅓*(1 + 3 + 5))/(1 +⅓* 3)= 2年 但是,如果我使用预测的坚持时间是行不通的,那是我实际拥有的全部。我不知道还能尝试什么。我读了一些有关生存分析的信息,但是我不确定在这种情况下如何应用它。理想情况下,我还希望能够计算90%的置信区间。任何提示将非常感谢。 编辑:可能上面的问题没有答案。但是还有另一项研究随机询问了人们是否是素食主义者,以及过去有多少次素食主义者。我也知道学习和其他方面每个人的年龄。也许可以将此信息与当前素食者的调查结合使用,以某种方式获得平均值。实际上,我所说的研究只是其中的一个难题,但它是非常重要的一个难题,我想从中得到更多。

1
R中混合模型公式中随机效应的威尔金森式表示法的起源,例如(1 | id)
R中的模型公式,例如 y ~ x + a*b + c:d 基于所谓的Wilkinson表示法:Wilkinson和Rogers 1973,用于方差分析的阶乘模型的符号描述。 本文没有讨论混合模型的符号(那时可能还不存在)。那么R中的混合模型公式lme4以及相关程序包中使用了什么,例如 y ~ x + a*b + c:d + (1|school) + (a*b||town) 来自?谁是第一次引入它们,何时引入?是否有针对他们的“ Wilkinson表示法”之类的商定术语?我专门指的是 (model formula | grouping variable) (model formula || grouping variable)

1
Kaggle的私人排行榜是否可以很好地预测获胜模型的样本外性能?
虽然不能使用私有测试集的结果进一步完善模型,但难道不是基于私有测试集的结果从大量模型中选择模型吗?您是否仅通过该过程就不会过度适合私有测试集? 根据 Bailey et.al的“伪数学和金融欺诈行为:回测过拟合对样本外性能的影响”。从同一数据集上评估的大量模型中选择最佳模型时,“过度拟合”相对容易。Kaggle的私人排行榜不是这样吗? 私有排行榜上表现最佳的模型是将最佳数据推广到样本外数据的模型,其统计依据是什么? 公司是否最终使用了获胜的模型,还是仅仅在私人排行榜上提供“游戏规则”,而公司实际上对讨论问题所产生的见解更感兴趣?


4
“ as”代表什么?
我正在阅读文章,看到以下句子: 对于给定的mar,如果具有上限或下限,则must必须收敛(为)。由于可能性始终为非负值,因此0为下限。 “ as”代表什么?这是常见用法吗?我的猜测是“渐近”,但我想验证一下。

7
为什么偏斜数据不是建模的首选?
在大多数情况下,人们谈论变量转换(针对预测变量和响应变量)时,他们都在讨论处理数据偏斜的方法(例如对数转换,Box和Cox转换等)。我无法理解的是为什么消除偏斜被认为是一种常见的最佳实践?偏度如何影响诸如基于树的模型,线性模型和非线性模型之类的各种模型的性能?什么样的模型更受偏斜的影响,为什么?

5
合奏方法如何胜过其所有成分?
我对整体学习有些困惑。简而言之,它可以运行k个模型并获得这k个模型的平均值。如何保证k个模型的平均值比任何一个模型都好?我确实知道这种偏见是“分散”或“平均”的。但是,如果集成中有两个模型(即k = 2),而其中一个模型比另一个模型差,该集合不会比更好的模型差吗?


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.