统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


2
显示贝叶斯模型平均(BMA)优点的简单示例
我将贝叶斯模型平均(BMA)方法纳入研究,并将很快向同事介绍我的工作。但是,BMA在我的领域并没有那么知名,因此在向他们介绍所有理论之后并将其实际应用于我的问题之前,我想提出一个简单而有启发性的示例,说明BMA为何起作用。 我在考虑一个简单的示例,其中有两个模型可供选择,但是真正的数据生成模型(DGM)介于两者之间,证据并不真正支持其中的任何一个。因此,如果您选择一个并继续进行下去,则将忽略模型不确定性并产生错误,但是BMA尽管真实模型不是模型集的一部分,但至少可以正确给出感兴趣参数的后验密度。例如,每天有两个天气预报(A和B),并且一个人希望最好地预测天气,因此在经典统计中,您首先会尝试找到两者之间的最佳天气预报者,但是如果真相介于两者之间,该怎么办? (也就是说,有时A是正确的,有时B是正确的)。但是我无法将其形式化。那样的东西,但是我很愿意接受想法。我希望这个问题足够具体! 在文献中,到目前为止,我还没有找到任何很好的例子: Kruschke(2011)虽然很好地介绍了贝叶斯统计,但并没有真正关注BMA,而他在第4章中介绍的抛硬币示例对于介绍贝叶斯统计非常有用,但并没有真正说服其他研究人员使用BMA。(“为什么我又有三个模型,一个为什么说硬币是公平的,而另一个说它在任一方向上都有偏见?”) 我阅读的所有其他内容(Koop 2003,Koop / Poirier / Tobias(2007),Hoeting等人(1999)以及大量其他文章)都是很好的参考,但是我还没有在其中找到一个简单的玩具示例。 但是也许我只是错过了一个很好的消息来源。 那么,有没有人有介绍BMA的好榜样?也许甚至显示出可能性和后继者,因为我认为这将很有启发性。


2
用多个预测变量解释逻辑回归模型
我执行了多元逻辑回归分析,因变量Y是进入某特定时期内在疗养院中的死亡,并得到以下结果(请注意,变量开始于A连续值,而变量开始于连续值B): Call: glm(Y ~ A1 + B2 + B3 + B4 + B5 + A6 + A7 + A8 + A9, data=mydata, family=binomial) Deviance Residuals: Min 1Q Median 3Q Max -1.0728 -0.2167 -0.1588 -0.1193 3.7788 Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 20.048631 6.036637 3.321 0.000896 *** A1 0.051167 …
12 r  regression  logistic 

1
三角形分布的MLE?
是否可以将常规的MLE程序应用于三角形分布?-我正在尝试,但是在数学上似乎一步一步被定义分布的方式所阻塞。我试图利用一个事实,即我知道c上下的样本数量(不知道c):如果n是样本总数,则这两个数字是cn和(1-c)n。但是,这似乎无助于推导。此刻的时刻给出了c的估计量,没有太大的问题。这里的MLE阻塞的确切性质是什么(如果确实存在)? 更多细节: 让我们考虑在,并在规定的分配由: [ 0 ,1 ] [ 0 ,1 ]Ccc[ 0 ,1 ][0,1][0,1][ 0 ,1 ][0,1][0,1] F(x ; c )= 2 xCf(x;c)=2xcf(x;c) = \frac{2x}{c}如果x <c如果c <= x,则 F(x ; c )= 2 (1 − x )(1 − c )f(x;c)=2(1−x)(1−c)f(x;c) = \frac{2(1-x)}{(1-c)} 让我们从这个分布中取 iid样本,以给定该样本的c的对数似然性为例:{ x i }ñnn{ x一世}{xi}\{x_{i}\} 升^(c | …

3
线性回归中误差的方差-协方差矩阵
实际上,统计分析软件包如何计算var / cov误差矩阵? 从理论上我很清楚这个想法。但实际上没有。我的意思是,如果我有一个随机变量向量,我知道方差/协方差矩阵将得到均值偏差向量的外部乘积:。ΣX =( X1个,X2,… ,Xñ)⊤X=(X1,X2,…,Xn)⊤\textbf{X}=(X_{1}, X_{2}, \ldots, X_{n})^\topΣΣ\SigmaΣ = E [(X - E(X))(X - E(X))⊤]Σ=E[(X−E(X))(X−E(X))⊤]\Sigma=\mathrm{E}\left[(\textbf{X}-\mathrm{E}(\textbf{X}))(\textbf{X}-\mathrm{E}(\textbf{X}))^\top\right] 但是当我有一个样本时,我观察到的误差不是随机变量。甚至更好,但只有在我从相同人群中抽取了多个相同样本的情况下才可以。否则,他们被给予。因此,我的问题再次是:一个统计软件包如何从研究人员提供的观察结果列表(即样本)开始生成var / cov矩阵?


1
在每个代码块之前或每个项目一次设置种子?
标准建议是设置一个随机种子,以便可以重现结果。但是,由于种子是随着伪随机数的绘制而前进的,因此,如果任何一段代码绘制了一个额外的数字,则结果可能会发生变化。 乍一看,版本控制似乎是一种解决方案,因为当您将结果记录在便笺或纸上时,它至少可以让您返回并重现现有的版本。但是,由于只需要抽奖就可以解决问题,因此,如果更新R,结果也可能会更改。 我意识到这可能仅在极少数情况下是有问题的,但是我很好奇这里是否有最佳实践。这是我在自己的工作中一直在努力的事情。

2
PyMC初学者:如何从拟合模型中实际采样
我正在尝试一个非常简单的模型:在假设我知道精度的情况下拟合法线,我只想找到均值。下面的代码似乎正确适合普通。但是在拟合之后,我想从模型中采样,即生成类似于我的data变量的新数据。我知道我可以trace("mean")用来获取均值变量的样本。但是如何从模型本身获取新样本? 我看过文档,例如http://pymc-devs.github.io/pymc/database.html#accessing-sampled-data。我还查看了很多示例,例如采矿灾难,以及概率编程笔记本中的一些示例,而没有一个提及。我(或多或少是MCMC初学者)期望从拟合模型中取样才是重点!我想念什么? from pymc import * data = np.array([-1, 0, 4, 0, 2, -2, 1, 0, 0, 2, 1, -3, -1, 0, 0, 1, 0, 1]) mean = Uniform("mean", -4, 4) precision = 2.0**-2 obs = Normal("obs", mean, precision, value=data, observed=True) model = Model( {"mean": mean, "obs": obs}) mcmc = …
12 mcmc  pymc 

1
当属性是名义的时,个人的最佳距离函数是什么?
我不知道在名义(无序分类)属性的情况下要使用个体之间的距离函数。我正在阅读一些教科书,他们建议使用简单匹配功能,但有些书则建议我将标称值更改为二进制属性,并使用Jaccard系数。但是,如果名义属性的值不是2怎么办?如果该属性中有三个或四个值怎么办? 应该为名义属性使用哪个距离函数?

2
变量向量如何表示超平面?
我正在阅读《统计学习的要素》,在第12页(第2.3节)中,将线性模型表示为: Yˆ=XTβˆY^=XTβ^\widehat{Y} = X^{T} \widehat{\beta} ...其中是预测变量/自变量/输入的列向量的转置。(它前面指出“所有矢量都假定为列矢量”,所以这不是使成为行矢量,而成为列矢量吗?) X 牛逼βXTXTX^{T}XTXTX^{T}βˆβ^\widehat{\beta} 包含一个“ ”,将其与对应的系数相乘,得出(恒定)截距。1XXX111 它继续说: 在维输入-输出空间中,表示一个超平面。如果常量包含在,则超平面包括原点,并且是子空间;如果不是,则为仿射集,在点处切割轴 。(X ,ÿ)X Ý (0 ,^ β 0)(p+1)(p+1)(p + 1)(X, Yˆ)(X, Y^)(X,\ \widehat{Y})XXXYYY(0, β0ˆ)(0, β0^)(0,\ \widehat{\beta_0}) “ ”是否描述了由预测变量,截距的“ ”和串联而成的向量?为什么在中包含“ ”会迫使超平面通过原点,并确保将“ ”与相乘?1 Ÿ 1 X 1 ^ β 0(X, Yˆ)(X, Y^)(X,\ \widehat{Y})111YˆY^\widehat{Y}111XXX111β0ˆβ0^\widehat{\beta_0} 我听不懂这本书。任何帮助/建议/资源链接将不胜感激。

1
样本协方差矩阵不可逆时该怎么办?
我正在研究一些聚类技术,其中对于给定的d维向量簇,我假设一个多元正态分布并计算样本d维平均向量和样本协方差矩阵。 然后,当尝试确定一个新的,看不见的d维向量是否属于该簇时,我正在通过以下度量来检查其距离: (Xi−μ^X)′σ^−1X(Xi−μ^X)>B0.95(p2,−p2)(Xi−μ^X)′σ^X−1(Xi−μ^X)>B0.95(p2,−p2)\left(X_i-\hat{\mu}_X\right)'\hat{\sigma}_X^{-1}\left(X_i-\hat{\mu}_X\right)>B_{0.95}\left(\frac{p}{2},\frac{-p}{2}\right) 这需要我计算协方差矩阵的逆。但是给定一些样本,我不能保证协方差矩阵是可逆的,如果不是,我该怎么办?σ^Xσ^X\hat{\sigma}_X 谢谢

1
如何找到多维点之间的方差?
假设我有一个矩阵X,它的n乘p,即它有n个观测值,每个观测值都在p维空间中。 如何找到这n个观测值的方差? 在p = 1的情况下,我只需要使用正则方差公式。如果p> 1。
12 variance 

3
要报告的有效位数
在比较标准的情况下(例如,大学一年级),是否有更科学的方法来确定要报告的平均位数或置信区间的有效位数。 我已经看到要在表格中放置有效数字的数量,为什么我们不使用有效数字和卡方拟合的有效数字的数量,但是这些似乎并没有使问题产生影响。 在我的课堂上,我试图向学生解释,当他们的成绩有如此大的标准误差时,报告15位有效数字是浪费墨水-我的直觉是应该将其四舍五入到大约。这与ASTM- 报告测试结果所指的E29并没有太大区别,在E29中,该值应介于和。0.05 σ 0.5 σ0.25σ0.25σ0.25\sigma0.05σ0.05σ0.05\sigma0.5σ0.5σ0.5\sigma 编辑: 当我有如下一组数字时x,我应该使用几位数来打印均值和标准差? set.seed(123) x <- rnorm(30) # default mean=0, sd=1 # R defaults to 7 digits of precision options(digits=7) mean(x) # -0.04710376 - not far off theoretical 0 sd(x) # 0.9810307 - not far from theoretical 1 sd(x)/sqrt(length(x)) # standard error of mean …

4
对数线性模型
有人可以解释为什么我们以非专业术语使用对数线性模型吗?我来自工程学背景,对于我来说,这确实是一个困难的话题,即统计学。我将不胜感激。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.