统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
为什么,但是呢?
在此AP主页上,作者Peter Flanagan-Hyde在“ 随机变量与代数变量”一文中对代数变量和随机变量进行了区分。 他在某种程度上说 X + X ≠ 2 Xx+x=2xx+x=2xx + x = 2x,但是 X+X≠2XX+X≠2XX + X \neq 2X -实际上,这是文章的副标题。 代数变量和随机变量之间的基本区别是什么?

3
进行MCMC:使用锯齿/ stan或自己实施
我是贝叶斯统计研究的新手。我从研究人员那里听说,贝叶斯研究人员可以更好地自己实现MCMC,而不是使用JAGS / Stan之类的工具。我可以问一下,除了学习目的之外,自行实现MCMC算法(使用像R这样的“不太快”的语言)有什么好处?
13 bayesian  mcmc 


5
数理统计的哪些领域可高度采用?
我即将完成统计学方面的荣誉,我真的想获得博士学位,因为我发现数学统计学非常有趣。我最想攻读博士学位的研究领域是随机过程和时间序列。 但是,我也想在获得博士学位后在私营部门从事职业。我想知道私人机构中最常使用哪些数学统计领域,以及哪些类型的工作? 显然,我不会因为可以就业而去做博士学位,但是我认为这绝对是我需要考虑的事情,因此需要一些建议。

5
为什么要研究线性回归?
给定两个随机变量和我们可以计算它们的“相关系数”,并在这两个随机变量之间形成最佳拟合线。我的问题是为什么?η Çξξ\xiηη\etaCcc 1)有随机变量和以最坏的方式依赖,即且尽管。如果只考虑线性回归,那么人们将完全不知道这一点。η ξ = ˚F (η )C ^ = 0ξξ\xiηη\etaξ= f(η)ξ=f(η)\xi = f(\eta)c = 0c=0c=0 2)为什么要线性?随机变量之间还可以存在其他类型的关系。为什么要从其他所有人中选出那个?
13 regression 

3
为什么高阶多项式有大系数
在Bishop的机器学习书中,它讨论了将多项式函数曲线拟合到一组数据点的问题。 令M为多项式拟合的阶数。它指出 我们看到,随着M的增加,系数的大小通常会变大。特别是对于M = 9的多项式,通过产生较大的正值和负值,系数已经微调到数据,因此相应的多项式函数恰好与每个数据点匹配,但与数据点之间(尤其是在数据点的末端附近)匹配范围)功能显示出较大的振荡。 我不明白为什么大值意味着更紧密地拟合数据点。我认为这些值会在小数点后变得更精确,而不是为了更好地拟合。

2
截断正态分布在神经网络中初始化权重有什么好处?
在前馈神经网络中初始化连接权重时,重要的是随机初始化它们,以避免学习算法无法打破的任何对称性。 我在不同地方(例如TensorFlow的MNIST教程)中看到的建议是使用标准偏差为的截断正态分布,其中是输入的数量给定的神经元层。1个ñ--√1个ñ\dfrac{1}{\sqrt{N}}ññN 我相信标准偏差公式可确保反向传播的梯度不会很快溶解或放大。但是我不知道为什么我们要使用截断的正态分布而不是正态正态分布。是否要避免稀疏的异常权重?


1
实践中仍在使用常客性条件推理吗?
我最近回顾了南希·里德,巴恩多夫-尼尔森,理查德·考克斯以及是的罗纳德·费舍尔的一些旧论文,这些论文涉及惯常主义范式中的“条件推论”概念,这似乎意味着推论仅基于考虑样本空间的“相关子集”,而不是整个样本空间。 作为一个关键的例子,如果您还考虑样本的变异系数(称为辅助统计量),则可以改善基于t统计量的置信区间(Goutis&Casella,1992)。 作为经常使用基于似然性推断的人,我假设当我形成一个渐近%置信区间时,我正在执行(近似)条件推断,因为似然性取决于观察样本。αα\alpha 我的问题是,除了条件逻辑回归之外,我还没有看到在推断之前对辅助统计条件进行调整的想法的使用。这种类型的推理是仅限于指数族,还是现在使用其他名称,所以它似乎仅是有限的。 我发现最近的一篇文章(Spanos,2011年)似乎对有条件推论(即无礼)所采用的方法产生了严重怀疑。取而代之的是,它提出了一个非常明智且数学上不那么费解的建议,即可以通过删节通常的无条件采样分布来解决“不规则”情况下的参数推断(其中分布的支持由参数确定)。 弗雷泽(Fraser(2004))很好地证明了条件性,但我仍然感到,要对复杂的情况实际应用条件推理,不仅需要运气和独创性,而且肯定比调用卡方更为复杂。 “近似”条件推断的似然比统计量的近似。 威尔士(2011,第163页)可能已经回答了我的问题(3.9.5,3.9.6)。 他们指出了巴苏的著名结果(巴苏定理),其中可能有不止一个辅助统计量,这是关于哪个“相关子集” 最相关的问题。更糟糕的是,它们显示了两个示例,这些示例说明即使您具有唯一的辅助统计信息,也无法消除其他相关子集的存在。 他们继续得出结论,只有贝叶斯方法(或与之等效的方法)才能避免此问题,从而实现无条件的条件推断。 参考文献: ttt Spanos,阿里斯。“重新审视韦尔奇统一模型:有条件推论的情况吗?”。 统计科学进展与应用 5(2011):33-52。 DAS弗雷泽(Fraser),“辅助条件和条件推断”。 统计科学 19.2(2004):333-369。 威尔士,艾伦·H 。统计推论。卷 916.约翰·威利父子,2011年。

1
史蒂夫·徐(Steve Hsu)对中国天才的计算
物理学家史蒂夫·许(Steve Hsu)在博客中写道: 假设分布呈正态分布,那么在美国,+ 4SD的表现只有大约10,000人,而在欧洲则是类似的数字,因此这是一个相当好的人口群体(大约是美国每年前几百名高中生)。 如果将东北亚的数字推算至中国的13亿人口,那么在这个水平上您会得到大约300,000个人,这实在是压倒性的。 您可以仅使用和这样的常用算术运算符向非统计学家解释普通语言下的史蒂夫陈述吗?+++−−-

1
深度卷积神经网络有哪些有用的数据增强技术?
背景: 在看到Geoffrey Hinton的精彩演讲后,我最近更深入地了解了在训练卷积神经网络时数据增强的重要性。 他解释说,当代的卷积神经网络无法概括被测对象的参照系,这使得网络很难真正地理解对象的镜像是相同的。 已经进行了一些研究来尝试对此进行补救。这是许多例子之一。我认为这有助于确定当今训练卷积神经网络时关键数据的增长程度。 数据增强技术很少相互对照。因此: 问题: 从业人员在哪些论文中报告其表现特别出色? 您发现有用的一些数据增强技术是什么?

2
从频繁结果中得出贝叶斯先验
如何将频繁出现的结果转换为贝叶斯先验结果? 考虑以下非常普通的场景:过去进行了一次实验,并测量了某些参数结果。该分析是采用常客方法进行的。结果中给出了置信区间。φϕϕ\phiϕϕ\phi 我现在正在进行一些新的实验,我想测量一些其他参数,例如和。我的实验与以前的研究不同---它不是使用相同的方法进行的。我想进行贝叶斯分析,因此需要将先验放在和。φ θ φθθ\thetaϕϕ\phiθθ\thetaϕϕ\phi 以前没有进行过测量,因此我在其上放了一个无信息的信息(例如其统一的信息)。 θθ\theta 如前所述,有一个先前的结果,以置信区间给出。要在我的当前分析中使用该结果,我需要将以前的常客性结果转换为内容丰富的先验信息以进行分析。 ϕϕ\phi 在这种组合方案中不可用的一个选项是重复先前的分析,以贝叶斯方式进行测量。 如果我可以做到这一点,那么将具有先前实验的后验,然后将其用作我的先验,那么就没有问题了。ϕϕ\phi ϕϕ\phi 我应该如何将常客身份CI转换为贝叶斯先验分布以进行分析?或者换句话说,我怎么可能对他们的翻译结果frequentest在成后,我会再在我的分析之前使用?φϕϕ\phiϕϕ\phi 欢迎讨论此类型问题的任何见解或参考。

1
为什么算术平均值小于对数正态分布中的分布平均值?
所以,我有一个随机过程生成数正态分布随机变量XXX。这是相应的概率密度函数: 我想估计分配是原始分配的几个时刻,让我们说第一次的时刻:算术平均值。为此,我绘制了100个随机变量10000次,以便可以计算10000次算术平均值估计。 有两种不同的方法可以估算均值(至少,这是我的理解:我可能是错的): 通过清楚地计算的算术平均值以通常的方式: X¯= ∑我= 1ñX一世ñ。X¯=∑i=1NXiN.\bar{X} = \sum_{i=1}^N \frac{X_i}{N}. 或先根据基本正态分布估算和μ:μ = N ∑ i = 1 log (X i)σσ\sigmaμμ\mu然后平均值作为 ˉ X =EXP(μ+1μ = ∑我= 1ñ日志(X一世)ñσ2= ∑我= 1ñ(日志(X一世)- μ )2ñμ=∑i=1Nlog⁡(Xi)Nσ2=∑i=1N(log⁡(Xi)−μ)2N\mu = \sum_{i=1}^N \frac{\log (X_i)}{N} \quad \sigma^2 = \sum_{i=1}^N \frac{\left(\log (X_i) - \mu\right)^2}{N}X¯= 经验(μ + 12σ2)。X¯=exp⁡(μ+12σ2).\bar{X} = \exp(\mu + \frac{1}{2}\sigma^2). 问题在于,与每个这些估计相对应的分布在系统上是不同的: …

1
logistic回归和分数响应回归之间有什么区别?
据我所知,逻辑模型和分数响应模型(frm)之间的区别在于,因变量(Y)其中frm为[0,1],而logistic为{0,1}。此外,frm使用拟似然估计器确定其参数。 通常,我们可以使用glm来获得逻辑模型glm(y ~ x1+x2, data = dat, family = binomial(logit))。 对于frm,我们更改family = binomial(logit)为family = quasibinomial(logit)。 我注意到我们也可以family = binomial(logit)用来获取frm的参数,因为它给出了相同的估计值。请参阅以下示例 library(foreign) mydata <- read.dta("k401.dta") glm.bin <- glm(prate ~ mrate + age + sole + totemp, data = mydata ,family = binomial('logit')) summary(glm.bin) 返回, Call: glm(formula = prate ~ mrate + age + …

1
在荟萃分析中指定效果大小的先验
我的问题上的担忧影响大小先验概率,在我的项目的措施是科恩的。通过阅读文献,似乎经常使用模糊的先验,例如在众所周知的八种流派的贝叶斯荟萃分析示例中。在这八所学校的示例中,我看到一个模糊的先验用于估计mu,例如 。dDDμθ〜正常(0 ,100 )μθ∼normal⁡(0,100)\mu_{\theta} \sim \operatorname{normal}(0, 100) 我的学科是心理学,效应的大小通常很小。因此,我正在考虑使用以下优先级:。我如此严格的先验的理由是,根据我对先验的理解,我将先验概率定为-1到1,在95%的先验概率中,有5%的先验概率大于- 1或1。μθ〜正常(0 ,.5 )μθ∼normal⁡(0,.5)\mu_{\theta} \sim \operatorname{normal}(0, .5)μθμθ\mu_{\theta} 由于影响如此之少,这种先验是否合理?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.