统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
具有完全成功的分类变量的二项式glmm
我正在运行带有二项式响应变量和分类预测变量的glmm。随机效果由用于数据收集的嵌套设计给出。数据如下所示: m.gen1$treatment [1] sucrose control protein control no_injection ..... Levels: no_injection control sucrose protein m.gen1$emergence [1] 1 0 0 1 0 1 1 1 1 1 1 0 0.... > m.gen1$nest [1] 1 1 1 2 2 3 3 3 3 4 4 4 ..... Levels: 1 2 3 4 …

1
假设检验和科学方法
阅读该主题的答案,我开始怀疑假设检验与科学方法之间的关系。虽然我对两者都有很好的了解,但我很难绘制它们之间的精确联系。 从高层次上讲,科学方法可以归结为: 做出猜想和假设(理论) 根据这一理论做出预测 进行实验和观察 测试并接受新理论,如果 数据比其他理论更准确地符合预测 新理论并不比其他可能的替代方案复杂 从高层次上看,我认为科学方法遵循的是“假设是否合格”方法,这与统计假设检验中的“如果不合适则拒绝”方法形成对比。这个对吗?如果是这样,为什么会这样呢?他们不是从根本上追求同一目标吗?推断最能解释观察结果的理论或模型?

2
在这里加1的技巧是什么?
我一直在寻找在此页面上Lillefors测试的蒙特卡洛实现。我不明白这句话: 模拟中的计算中存在随机误差。但是,由于在计算P值时将分子和分母加1的技巧,可以在不考虑随机性的情况下直接使用。 将分子和分母加1的技巧是什么意思? 相关的代码在这里: n <- length(x) nsim <- 4999 d.star <- double(nsim) for (i in 1:nsim) { x.star <- rnorm(n) d.star[i] <- fred(x.star) } hist(d.star) abline(v = d.hat, lty = 2) ## simulation-derived P-value pval <- (sum(d.star > d.hat) + 1) / (nsim + 1)


3
单位球N个样本的最接近原点的中值最近点的公式的解释
在《统计学习的元素》中,引入了一个问题以突出高维空间中k-nn的问题。有NNN被均匀地分布在一个数据点ppp维单位球。 从原点到最近的数据点的中值距离由以下表达式给出: d(p,N)=(1−(12)1N)1pd(p,N)=(1−(12)1N)1pd(p,N) = \left(1-\left(\frac{1}{2}\right)^\frac{1}{N}\right)^\frac{1}{p} 当N=1N=1N=1,公式分解为球半径的一半,我可以看到最近的点如何以方式接近边界p→∞p→∞p \rightarrow \infty,从而使knn后面的直觉在高维度上分解。但是我无法理解为什么公式依赖于N。有人可以澄清一下吗? 该书还指出:“……在训练样本的边缘附近进行预测要困难得多。必须从邻近的样本点推断而不是在它们之间进行内插”。这似乎是一个深刻的陈述,但我似乎无法理解它的含义。有人可以改写吗?


1
如何得出吉布斯采样?
我实际上是在犹豫地提出这个问题,因为恐怕我会被其他问题或维基百科上有关Gibbs抽样的问题提及,但是我不觉得它们描述了即将发生的事情。 给定条件概率: p(x|y)p(x|y)p(x|y)p(x|y)x=x0x=x1y=y01434y=y12646p(x|y)y=y0y=y1x=x01426x=x13446 \begin{array}{c|c|c} p(x|y) & y = y_0 & y = y_1 \\ \hline x = x_0 & \tfrac{1}{4} & \tfrac{2}{6} \\ \hline x = x_1 & \tfrac{3}{4} & \tfrac{4}{6} \\ \end{array} 还有一个条件概率: p(y|x)p(y|x)p(y|x)p(y|x)x=x0x=x1y=y01337y=y12347p(y|x)y=y0y=y1x=x01323x=x13747 \begin{array}{c|c|c} p(y|x) & y = y_0 & y = y_1 \\ \hline x = x_0 …
11 sampling  mcmc  gibbs 

3
在美国,电话民意调查是否存在偏见?
我当时在看《华盛顿时报》 / ABC的一项民意调查,结果细分,尤其是按年龄划分,这对我来说似乎很令人惊讶。所以我去寻找偏见。 它说:“民意调查是于2014年12月11日至14日通过电话进行的,随机抽样了1000名成年人。通过座机和手机用英语和西班牙语进行了采访。” 这项民意调查并未提供每个年龄段的受访者人数,我首先想到的是在家接电话的年龄在18-29岁?好的,它们包括蜂窝电话,这使它更加公平。但是,仍然有什么样的18-29岁年龄段的人接听他们的手机,询问他们是否要进行调查,并说“是的,确定”。 (我并不是说这是一个反问,我的直觉是某些群体更有可能,例如,自尊心低的人可能会喜欢一个陌生人通过电话征求意见的过程。) 那么,对此主题有研究吗?如果有特定偏见,有意操纵民意的组织会选择电话民意调查,在线民意调查或在街上进行采访吗?
11 polling  politics 

2
如果我的直方图显示出钟形曲线,我可以说我的数据呈正态分布吗?
我为“受访者年龄”创建了一个直方图,并设法获得了一个非常漂亮的钟形曲线,由此得出的结论是正态分布。 然后,我在n = 169的SPSS中运行正态性检验。Kolmogorov-Smirnov检验的p值(Sig。)小于0.05,因此数据违反了正态性假设。 为什么测试表明年龄分布不正常,但直方图显示出钟形曲线,据我所知这是正常的?我应该遵循哪个结果?

2
p值的微妙之处:更大等于更大
当我阅读Wassermann的《所有统计》一书时,我注意到p值的定义有些微妙,我无法理解。Wassermann非正式地将p值定义为 [..] 观察测试统计值等于或大于实际观察值的概率(在下)。H0H0H_0 重点已添加。正式上也一样(定理10.12): 假设大小测试的形式为αα\alpha 仅当T(X ^ n)\ ge c_ \ alpha时拒绝H_0。H0H0H_0T(Xn)≥cαT(Xn)≥cαT(X^n) \ge c_\alpha 然后, p-value=supθ∈Θ0Pθ0[T(Xn)≥T(xn)]p-value=supθ∈Θ0Pθ0[T(Xn)≥T(xn)]\text{$p$-value} = \sup_{\theta\in\Theta_0} P_{\theta_0}[T(X^n) \ge T (x^n)] 其中xnxnx^n是X ^ n的观测值XnXnX^n。如果Θ0={θ0}Θ0={θ0}\Theta_0=\{\theta_0\}则 p-value=Pθ0[T(Xn)≥T(xn)]p-value=Pθ0[T(Xn)≥T(xn)]\text{$p$-value} = P_{\theta_0}[T(X^n) \ge T (x^n)] 此外,Wassermann将Pearson的χ2χ2\chi^2检验(和其他类似的检验)的p值定义为: p-value=P[χ2k−1>T].p-value=P[χk−12>T].\text{$p$-value} = P[\chi^2_{k-1} > T]. 我想澄清的部分是第一个定义中的大等号(≥≥\ge)和第二个定义中的大号(>>>)。我们为什么不写≥T≥T\ge T,它会匹配“ 等于或大于极限” 的第一引号? 这是绝对的方便,以便我们将p值计算为吗?我注意到R也使用带有符号的定义,例如in 。1−F(T)1−F(T)1-F(T)>>>chisq.test

1
我的ACF图告诉我有关数据的什么信息?
我有两个数据集: 我的第一个数据集是相对于时间的投资价值(十亿美元),每个单位时间是自1947年第一季度以来的四分之一。时间一直延伸到2002年第三季度。 我的第二个数据集是“将[第一个数据集]中的投资值转换为近似平稳过程的结果”。 第一组数据和第二组数据 相应的ACF图: 我知道这些情节是正确的,因此请我“对其进行评论”。我对自动相关功能还比较陌生,我也不完全确定它能告诉我有关我的数据的信息。 如果有人可以花时间简短地解释一下,将不胜感激。

2
贝叶斯事件研究方法的计量经济学
事件研究在经济学和金融学中很普遍,可以确定事件对股票价格的影响,但是它们几乎总是基于常识性推理。OLS回归-在与事件窗口不同的参考期间内-通常用于确定对资产的正常收益进行建模所需的参数。然后,在从到的指定事件窗口内的事件之后,确定资产上累积的异常收益()的统计显着性。假设检验用于确定这些收益是否显着并因此确实异常。从而:i T 1 T 2汽车CAR\text{CAR}一世iiŤ1个T1T_1Ť2T2T_2 H0:汽车一世= 0H0:CARi=0H_0 : \text{CAR}_i = 0,其中 汽车一世= ∑Ť2t = T1个增强现实我,Ť= ∑Ť2t = T1个([R我,Ť- è [ [R我,Ť] )CARi=∑t=T1T2ARi,t=∑t=T1T2(ri,t−E[ri,t])\text{CAR}_i = \sum_{t=T_1}^{T_2} \text{AR}_{i,t} = \sum_{t=T_1}^{T_2} \left( r_{i,t} -\mathbb{E}[r_{i,t}] \right)和 è [ [R我,Ť]E[ri,t]\mathbb{E}[r_{i,t}]是模型预测的资产收益。 如果我们的观察数量足够大,我们可以假定资产收益率分布的渐近正态性,但是对于较小的样本量可能无法验证。 可以说,因此,单企业,单事件的研究(例如在诉讼中要求的)应遵循贝叶斯方法,因为无限多次重复的假设比在这种情况下“更难以验证”多家公司。然而,频频主义者的做法仍然是惯例。 鉴于有关该主题的文献稀少,我的问题是如何使用贝叶斯方法最好地进行事件研究(类似​​于上面概述的方法,并在MacKinlay,1997年进行了总结)。 尽管这个问题是在公司财务实证研究的背景下提出的,但实际上是关于贝叶斯回归和推论的计量经济学,以及常识和贝叶斯方法背后的推理差异。特别: 我应该如何最好地使用贝叶斯方法来估计模型参数(假设对贝叶斯统计量有理论了解,但几乎没有经验)。 一旦计算出累积的异常收益(使用模型的正常收益),如何测试统计显着性? 如何在Matlab中实现呢?

1
R中的蒙特卡洛模拟
我正在尝试解决以下练习,但实际上我不知道如何开始执行此操作。我在书中找到了一些看起来像这样的代码,但这是完全不同的练习,我不知道如何将它们彼此关联。如何开始模拟到达,如何知道到达的时间?我知道如何存储它们,并据此计算a,b,c,d。但我不知道我实际需要如何模拟蒙特卡洛模拟。有人可以帮我开始吗?我知道这不是一个可以为您解答所有问题的地方,而是可以解决的。但是问题是我不知道如何开始。 一个IT支持服务台代表一个排队系统,由五名助手接听客户的电话。这些呼叫根据Poisson进程进行,平均每45秒发出一次呼叫。第1个,第2个,第3个,第4个和第5个助手的服务时间分别是参数为λ1= 0.1,λ2= 0.2,λ3= 0.3,λ4= 0.4和λ5= 0.5 min-1的指数随机变量(第j个服务台助理的λk= k / 10 min-1)。除了受帮助的客户外,最多可以保留十个其他客户。在达到此容量时,新的呼叫者会收到忙音。使用蒙特卡洛方法估算以下性能特征, (a)收到繁忙信号的客户比例; (b)预期的响应时间; (c)平均轮候时间; (d)每个服务台助理服务的客户部分; 编辑:我到目前为止(不是很多): pa = 1/45sec-1 jobs = rep(1,5); onHold = rep(1,10); jobsIndex = 0; onHoldIndex = 0; u = runif(1) for (i in 1:1000) { if(u <= pa){ # new arrival if(jobsIndex < 5) # …


1
在左侧删节的数据上使用标准的机器学习工具
我正在开发一个预测应用程序,其目的是允许进口商预测其分销商客户网络对其产品的需求。只要有足够的库存来满足需求,销售数字就可以很好地满足需求。但是,当库存减少到零时(我们正在努力帮助客户避免这种情况),我们对错过目标的了解并不多。如果客户有足够的供应量,他们将进行多少次销售?使用Sales作为简单目标变量的基于标准回归的ML方法将对时间,我的描述性变量和需求之间的关系产生不一致的估计。 Tobit建模是解决该问题的最明显方法:http : //en.wikipedia.org/wiki/Tobit_model。我想知道随机森林,GBMS,SVM和神经网络的ML适应性也占数据的左手检查结构的原因。 简而言之,如何将机器学习工具应用于左删失的回归数据,以获得对因变量和自变量之间关系的一致估计?首先是R中可用的解决方案,其次是Python。 干杯, 亚伦

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.