统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
具有良好的常客属性意味着什么?
我经常听到这个短语,但从未完全理解它的意思。短语“良好的常客属性”目前在Google上有2750笔点击,在Scholar.google.com 上有 536笔,在stats.stackexchange.com上有4笔。 我发现一个明确的定义最接近来自最终幻灯片在这个斯坦福大学演讲,其状态 报告95%置信区间的意思是,即使在不同的估计问题之间,您也可以将“真实”参数“圈住”在您提出的95%的索赔中。这是具有良好的频繁性的估计程序的定义特征:它们在重复使用时经过仔细检查。 对此进行一点思考,我认为“良好的频率特性”一词意味着对贝叶斯方法,特别是区间构造的贝叶斯方法的某种评估。我知道贝叶斯区间意味着包含概率为的参数的真实值。频率间隔的构造应使得,如果间隔构造的过程被重复了很多次,则大约p * 100 %pppp * 100 %p∗100%p*100\%的间隔将包含参数的真实值。贝叶斯间隔通常不会保证间隔的百分比将覆盖参数的真实值。但是,某些贝叶斯方法也碰巧具有这样的性质:如果重复很多次,它们将覆盖大约的真实值。当他们拥有该属性时,我们就说它们具有“良好的常客属性”。p * 100 %p∗100%p*100\% 是对的吗?我认为这还不止于此,因为该短语是指良好的常客属性,而不是具有良好的常客属性。


1
距离差的统计意义
我在二维网格上有3000多个矢量,具有近似均匀的离散分布。一些向量对满足一定条件。注意:该条件仅适用于向量对,不适用于单个向量。我有大约1500个这样的对的列表,我们称其为组1。组2包含所有其他向量对。我想找出第1组中一对向量之间的距离是否明显小于两个向量之间的平均距离。我怎样才能做到这一点? 统计检验:中心极限定理适用于我的情况吗?也就是说,我可以采用距离样本的方法,并使用学生的t检验比较满足条件的样本的方法与不满足条件的样本的方法吗?否则,什么统计检验适用于此? 样本数量和样本数量:我知道这里有两个变量,对于两个组中的每一个,我需要获取n个大小为m的样本,并取每个样本的平均值。有没有选择n和m的原则方法?它们应该尽可能大吗?还是只要它们具有统计意义,就应该尽可能地少?这两个组的名称是否应该相同?还是对于包含更多向量对的第2组,它们应该更大?

1
使用进行假设检验,因为收敛速度更快?
假设我有是iid,并且我想做一个假设检验,为0。假设我有大n,并且可以使用中心极限定理。我还可以做一个测试为0,这等效于测试为0。此外,收敛到卡方,其中收敛到法线。因为具有更快的收敛速度,所以我不应该将其用于测试统计量,这样我将获得更快的收敛速度并且测试会更高效吗?X1,…,XnX1,…,XnX_1,\ldots,X_nμμ\muμ2μ2\mu^2μμ\mun(X¯2−0)n(X¯2−0)n(\bar{X}^2 - 0)n−−√(X¯−0)n(X¯−0)\sqrt{n}(\bar{X} - 0)X¯2X¯2\bar{X}^2 我知道这种逻辑是错误的,但是我已经思考了很长时间,无法弄清原因。


1
“计数比例”和“连续比例”有什么区别?
在对另一个问题的评论中,要求澄清所讨论的主题是“计数比例”还是“连续比例”,并且后续调查表明差异是关键信息(逻辑/二项式与beta回归主题)。 两者之间的区别是什么,区别在哪里重要?使用“计数比例”与使用“连续比例”时要记住的重要事项是什么?

1
自举过滤器/粒子过滤器算法(理解)
我对引导过滤器的工作原理确实缺乏了解。我大致了解这些概念,但无法掌握某些细节。这个问题对我来说很清楚。在这里,我将从doucet的参考中使用这种流行的过滤算法(到目前为止,我认为这是最简单的参考)。首先让我告诉你,我的问题是了解哪些分布是已知的,哪些分布是未知的。 这些是我的问题: p(xt|x(i)t−1)p(xt|xt−1(i))p(x_t|x^{(i)}_{t-1})ttt p(yt|x~(i)t)p(yt|x~t(i))p(y_t|\tilde{x}^{(i)}_{t})w(i)t=w~(i)t∑Ni=1w~(i)twt(i)=w~t(i)∑i=1Nw~t(i)w^{(i)}_{t}=\frac{\tilde{w}^{(i)}_{t}}{\sum_{i=1}^{N}\tilde{w}^{(i)}_{t}}xxxwww 如果有人可以使用众所周知的发行版来使用此引导过滤器,给出一个简单的玩具示例,我将不胜感激。引导过滤器的最终目标对我来说并不明确。

3
神经体系结构:数据通知自动设计
神经网络的最新进展总结为一系列新颖的体系结构,这些体系结构的主要特征是其不断增加的设计复杂性。从LeNet5(1994)到AlexNet(2012),到Overfeat(2013)和GoogleLeNet / Inception(2014)等... 是否有任何尝试让机器根据数据决定/设计要使用的体系结构?

1
MCMC; 我们能否确定从后方获得“纯”和“足够大”的样本?如果我们不这样做怎么办?
引用此主题:您将如何向非专业人士解释Markov Chain Monte Carlo(MCMC)?。 我可以看到它是马尔可夫链和蒙特卡洛的组合:创建了一个马尔科夫链,其后部为不变极限分布,然后从极限分布(=我们的后部)中进行了蒙特卡洛绘制(从属)。 可以说(我想在这里简化),经过步后,我们处于极限分布(*)。ΠLLLΠΠ\Pi 马尔可夫链是一个随机变量序列,我得到一个序列,其中是随机变量,是极限'我们希望从中取样的“随机变量”。 X 我 ΠX1个,X2,… ,X大号,Π ,Π ,Π ,… ΠX1,X2,…,XL,Π,Π,Π,…ΠX_1, X_2, \dots , X_L, \Pi, \Pi, \Pi, \dots \PiX一世XiX_iΠΠ\Pi MCMC从初始值开始,即是一个随机变量,所有质量均为该值。如果我将大写字母用于随机变量,将小写字母用于随机变量的实现,那么MCMC会给我一个序列。因此,MCMC链的长度为L + n。X 1 X 1,X 2,X 3,... X 大号,π 1,π 2,π 3,。。。。π ñX1个X1X_1X1个x1x_1x1,x2,x3,…xL,π1,π2,π3,....πnx1,x2,x3,…xL,π1,π2,π3,....πnx_1,x_2,x_3, \dots x_L, \pi_1, \pi_2, \pi_3, ....\pi_n [[* *:大写字母是随机变量(即一堆结果),小是结果,即一个特定值。*]]xxx 显然,只有属于我的“后验”,为了近似“后验”,的值应“足够大”。 ñπiπi\pi_innn 如果我对此进行总结,那么我有一个MCMC链的长度,只有与我的后验近似有关,并且应该足够大。 Ñ …
12 mcmc 

6
是否存在我们无法抽样的单变量分布?
从单变量分布(逆变换,接受拒绝,Metropolis-Hastings等)中,我们有各种各样的随机生成方法,似乎我们可以从任何有效分布中采样-是这样吗? 您能否提供无法随机生成的单变量分布示例?我想这个不可能的例子不存在(?),所以说“不可能”是指计算量非常大的情况,例如,需要蛮力模拟,例如绘制大量样本以仅接受他们很少。 如果不存在这样的示例,我们是否可以实际证明可以从任何有效分布中生成随机抽奖?我只是很好奇是否存在反例。


1
非线性混合模型(NLME)的预测置信区间
我想获得非线性混合nlme模型预测的95%置信区间。由于没有提供任何标准来执行此操作nlme,因此我想知道使用“人口预测间隔”方法是否正确(如Ben Bolker的书章所述,该模型基于最大似然的模型)根据拟合模型的方差-协方差矩阵对固定效应参数进行重采样,基于此模拟进行预测,然后取这些预测的95%百分数得到95%的置信区间? 执行此操作的代码如下:(我在这里使用nlme帮助文件中的“ Loblolly”数据) library(effects) library(nlme) library(MASS) fm1 <- nlme(height ~ SSasymp(age, Asym, R0, lrc), data = Loblolly, fixed = Asym + R0 + lrc ~ 1, random = Asym ~ 1, start = c(Asym = 103, R0 = -8.5, lrc = -3.3)) xvals=seq(min(Loblolly$age),max(Loblolly$age),length.out=100) nresamp=1000 pars.picked = mvrnorm(nresamp, mu = …

1
如何在预测中考虑假期的影响
我有一个相当可预测的每日时间序列和每周季节性。在没有假期的情况下,我能够提出看起来很准确的预测(通过交叉验证确认)。但是,当有假期时,我会遇到以下问题: 尽管所有历史假期均为0,但我在预测中得到的假期非零数字。但这实际上不是主要问题。问题是... 由于假期中不进行的处理会“溢出”到假期后的几天,因此,由于这些异常值似乎是短期的创新,因此无法使用简单的虚拟变量进行削减。如果没有每周的季节性变化,我可能会得出一个估计值,用于在假期后的五天左右的时间内分配假期中未处理的数据(如您如何创建反映假期的超前和滞后影响的变量中建议的/时序分析中的日历效果?)。但是,“溢出”的分布取决于假期发生的星期几,以及假期是否是圣诞节或感恩节,那里的订单订购率低于一年中的其余时间。 以下是我的交叉验证的一些快照,这些快照显示了在一周的不同日期出现的假期的预测(蓝色)与实际(红色)结果: 我还担心圣诞节的影响取决于它落在一周中的哪一天,而我只有六年左右的历史数据。 对于在预测的背景下如何应对这些类型的创新异常值,是否有人有任何建议?(很遗憾,我无法共享任何数据)

3
中度回归:为什么我们要计算预测变量之间的*乘积*项?
在社会科学中,经常使用适度的回归分析来评估两个或多个预测变量/协变量之间的相互作用。 通常,使用两个预测变量,将应用以下模型: ÿ= β0+ β1个* X+ β2* M+ β3* X中号+ eY=β0+β1∗X+β2∗M+β3∗XM+eY = β_0 + β_1*X + β_2*M + β_3*XM + e 请注意,适度性测试通过乘积项(自变量X和缓和变量M的乘积)进行运算。我的根本问题是:为什么我们实际上要计算X和M之间的乘积项?心动不如行动,例如,绝对差| M − X | 还是X 和M的总和?X中号XMXMXXX中号MMXXX中号MM| 中号- X||M−X||M-X|X+ MX+MX + M 有趣的是,肯尼(Kenny)在这里http://davidakenny.net/cm/moderation.htm暗示了这个问题,他说:“正如所看到的那样,对适度的测试并不总是通过产品术语XM来进行”,但是没有给出进一步的解释。 。我猜/希望有一个正式的例证或证明是有启发性的。

2
使用lm进行2样本比例测试
我一直在使用线性模型执行2样本比例测试,但是已经意识到这可能并不完全正确。看来,使用具有二项式族+身份链接的广义线性模型可以准确给出未汇集的2样本比例测试结果。但是,使用线性模型(或带有高斯族的glm)得出的结果略有不同。我认为这可能是由于R如何解决二项式和高斯族的glm,但是还有其他原因吗? ## prop.test gives pooled 2-sample proportion result ## glm w/ binomial family gives unpooled 2-sample proportion result ## lm and glm w/ gaussian family give unknown result library(dplyr) library(broom) set.seed(12345) ## set up dataframe ------------------------- n_A <- 5000 n_B <- 5000 outcome <- rbinom( n = n_A + n_B, …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.