统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
使用每个选民的准确性和相关不确定性的投票系统
假设我们有一个简单的“是/否”问题,我们想知道答案。有N个人“投票”以获取正确答案。每个投票者都有一个历史记录-1和0的列表,显示他们过去对此类问题是对还是错。如果我们将历史假设为二项式分布,我们可以发现选民在此类问题,他们的变异,CI和任何其他种类的置信度指标上的平均表现。 基本上,我的问题是:如何将信任度信息纳入投票系统? 例如,如果我们仅考虑每个投票者的平均表现,则可以构建简单的加权投票系统: result=sign(∑v∈votersμv×(−1)1−vote)result=sign(∑v∈votersμv×(−1)1−vote)result = sign(\sum_{v \in voters}\mu_v \times (-1)^{1-vote}) 也就是说,我们可以将选民的权重总和乘以(代表“是”)或(代表“否”)。这是有道理的:如果选民1的平均正确答案等于,而选民2的平均答案只有,那么应该比第一人的投票更重要。另一方面,如果第一人称仅回答了10个此类问题,而第二人回答了1000个此类问题,则我们对第二人的技能水平比对第一人的技能更有信心-第一人可能很幸运,并且在获得10个相对成功的答案后,他将继续获得更差的结果。- 1 0.9 0.8+1+1+1−1−1-1.9.9.9.8.8.8 因此,更精确的问题听起来可能是这样的:是否存在兼具强度和置信度的统计指标?

1
连续和分类预测变量之间相互作用的混合模型多重比较
我想lme4用来拟合混合效果回归并multcomp计算成对比较。我有一个包含多个连续和类别预测变量的复杂数据集,但是可以使用内置ChickWeight数据集作为示例来说明我的问题: m <- lmer(weight ~ Time * Diet + (1 | Chick), data=ChickWeight, REML=F) Time是连续的并且Diet是绝对的(4个级别),每个饮食中有多个小鸡。所有的雏鸡都以相同的体重开始,但是它们的饮食(可能)会影响它们的生长速度,因此Diet截距应该(或多或少)相同,但斜率可能会有所不同。我可以得到Diet像这样的拦截效果的成对比较: summary(glht(m, linfct=mcp(Diet = "Tukey"))) 并且确实没有显着差异,但是如何进行类似的测试Time:Diet?仅将交互作用项放入mcp会产生错误: summary(glht(m, linfct=mcp('Time:Diet' = "Tukey"))) Error in summary(glht(m, linfct = mcp(`Time:Diet` = "Tukey"))) : error in evaluating the argument 'object' in selecting a method for function 'summary': Error in mcp2matrix(model, linfct …

2
我得出的这种离散分布(递归差分方程)叫什么名字?
我在电脑游戏中遇到了这个发行版,并想进一步了解它的行为。这取决于在给定数量的玩家动作之后是否应该发生某个事件。除此之外的细节无关紧要。它似乎也适用于其他情况,我发现它很有趣,因为它很容易计算并产生一条长尾巴。 每一步nnn,游戏产生均匀的随机数0≤X&lt;10≤X&lt;10 \leq X < 1。如果X&lt;p(n)X&lt;p(n)X < p(n),则触发事件。事件一旦发生,游戏将重置n=0n=0n = 0 并再次运行该序列。我只对发生此问题的事件感兴趣,因为这代表了游戏使用的分布。(此外,有关多个事件的任何问题都可以通过一个事件模型来回答。) 这里的主要“异常”是此分布中的概率参数随时间增加,或者换句话说,阈值随时间增加。在示例中,它线性变化,但我想其他规则也可以适用。经过nnn步或用户的操作后, p(n)=knp(n)=kn p(n) = kn 对于一些常数0&lt;k&lt;10&lt;k&lt;10 < k < 1。在某个特定点nmaxnmaxn_{\max} ,我们得到p(nmax)≥1p(nmax)≥1p(n_{\max}) \geq 1 。仅保证在该步骤发生该事件。 我能够确定 f(n)=p(n)[1−F(n−1)]f(n)=p(n)[1−F(n−1)] f(n) = p(n)\left[1 - F(n - 1)\right] 和 表示PMF和CDF。简而言之,事件在第步将发生的概率等于概率减去事件在任何先前步骤中已经发生的概率。F(n)=p(n)+F(n−1)[1−p(n)]F(n)=p(n)+F(n−1)[1−p(n)] F(n) = p(n) + F(n-1)\left[1 - p(n)\right] f(n)f(n)f(n)F(n)F(n)F(n)nnnp(n)p(n)p(n) 这是我们的朋友蒙特卡洛(Monte Carlo)的情节,很有趣,。中位数为21,平均为22。 k≈0.003k≈0.003k \approx 0.003 这大致相当于数字信号处理的一阶差分方程,这就是我的背景,因此我发现它相当新颖。我也对可以根据任意公式变化的想法感到好奇。p(n)p(n)p(n) …

1
Dirichlet后
我对Dirichlet后验分布有疑问。给定一个多项式似然函数,已知后验是,其中是我们见过观察的次数。Dir(αi+Ni)Dir(αi+Ni)Dir({\alpha_i + N_i})NiNiN_iithithi^{th} 如果我们开始减少给定的固定数据 s 会发生什么?从后部的形式看来,在某个点之后根本不会停止影响后部。但是,当我们使变得非常小时,质量移动到单纯形拐角和后验概率必须受到更大程度的影响,这不是正确的说法吗?哪种说法是正确的?αα\alphaDDDαα\alphaαα\alpha

3
因子分析的假设是什么?
我想检查我是否真的了解[经典,线性] 因子分析(FA),尤其是在FA之前(以及之后)所做的假设。 某些数据应首先进行关联,并且它们之间可能存在线性关系。在进行因子分析之后,数据是正态分布的(每对的双变量分布),并且因子之间(通用变量和特异性变量之间)没有相关性,一个因子的变量与其他因子的变量之间也没有相关性。 这是正确的吗?


3
直觉和变异系数的用途
我目前正在Coursera.org上参加“ 运营管理入门”课程。在课程的某个时候,教授开始处理手术时间的变化。 他使用的度量是变异系数,即标准偏差和平均值之间的比率: Cv= σμCv=σμc_v = \frac{\sigma}{\mu} 为什么要使用此度量?除了使用标准偏差外,使用CV还有哪些优缺点?这种测量背后的直觉是什么?

2
泊松回归假设以及如何在R中对其进行检验
我想测试哪种回归最适合我的数据。我的因变量是一个计数,并且有很多零。 而且,我需要一些帮助来确定使用哪种模型和家庭(泊松或准泊松,或零膨胀泊松回归),以及如何检验这些假设。 泊松回归:据我了解,一个强有力的假设是因变量均值=方差。您如何测试呢?他们必须有多近?是否为此使用了无条件或有条件的均值和方差?如果这个假设不成立怎么办? 我读到,如果方差大于均值,则说明我们存在过度分散,解决这一问题的潜在方法是包括更多自变量,或称family = quasipoisson。此分布是否还有其他要求或假设?我该使用哪种测试来查看(1)或(2)是否更合适-简单anova(m1,m2)? 我还读到,当出现过度分散时,可以使用负二项分布。如何在R中执行此操作?与拟泊松有什么区别? 零膨胀泊松回归:我读到使用vuong检验可以检查哪种模型更合适。 &gt; vuong (model.poisson, model.zero.poisson) 那是对的吗?零膨胀回归有什么假设? 加州大学洛杉矶分校的学术技术服务,统计咨询集团拥有部分约zeroinflated泊松回归,并测试与标准泊松模型(二)zeroinflated模型(一): &gt; m.a &lt;- zeroinfl(count ~ child + camper | persons, data = zinb) &gt; m.b &lt;- glm(count ~ child + camper, family = poisson, data = zinb) &gt; vuong(m.a, m.b) 我不了解| persons第一个模型的功能,以及为什么可以比较这些模型。我曾期望回归是相同的,只是使用不同的家庭。

1
什么是“行李箱图”或“双变量箱图”?
我找到了一篇介绍箱型图的多维(此处为双变量)版本的文章-风箱图。那是什么风筝呢?我可以看到一系列基于顶点的嵌套多边形,其中一个多边形被声明为风标图。嵌套多边形构建的想法是什么?风标图是哪个多边形(中心或保持平均点数)?Bagplot的边缘是否具有一些有用的属性(例如专门划分点集)?

2
为什么在引导假设检验中应在零假设下对数据进行重新采样?
引导程序方法在假设检验中的直接应用是通过对自举样本进行重复计算来估计测试统计信息的置信区间 (将从引导程序采样的统计信息称为)。如果假设参数(通常等于0)位于的置信区间之外,则我们拒绝。θ^θ^\hat{\theta}θ^θ^\hat{\theta}θ∗^θ∗^\hat{\theta^*}H0H0H_0θ0θ0\theta_0θ∗^θ∗^\hat{\theta^*} 我读过,这种方法缺乏力量。在Hall P.和Wilson SR的文章“引导假设检验的两个准则”(1992年)中,它被写为第一条准则,即应该对重新采样,而不是在。这是我不了解的部分。θ∗^- θ^θ∗^-θ^\hat{\theta^*} - \hat{\theta}θ∗^- θ0θ∗^-θ0\hat{\theta^*} - \theta_0 这不就是措施的估计只是偏置?对于无偏估计量,此表达式的置信区间应始终小于,但是我看不到与测试什么关系?我在哪里都看不到我们放置有关。θ∗^- θ^θ∗^-θ^\hat{\theta^*} - \hat{\theta}θ∗^θ∗^\hat{\theta^*}θ∗^- θ0θ∗^-θ0\hat{\theta^*} - \theta_0θ^= θ0θ^=θ0\hat{\theta}=\theta_0θ0θ0\theta_0 对于那些无法访问本文的人,本文引用紧随其后的相关段落: 要理解为什么这很重要,请注意如果在中,测试将涉及拒绝 是“太大”。如果与真实值很远 (即,如果严重错误),则差异 与的非参数引导分布相比,它看起来永远不会太大。比较有意义的是的分布 。事实上,如果真值 ISH0H0H_0∣∣θ^- θ0∣∣|θ^-θ0|\left| \hat{\theta} - \theta_0\right|θ0θ0\theta_0θθ\thetaH0H0H_0∣∣θ^- θ0∣∣|θ^-θ0|\left|\hat{\theta} - \theta_0 \right|∣∣θ^- θ0∣∣|θ^-θ0|\left| \hat{\theta} - \theta_0\right|∣∣θ∗^- θ^∣∣|θ∗^-θ^|\left| \hat{\theta^*} - \hat{\theta}\right|θθ\thetaθ1个θ1个\theta_1那么自举测试的功效将增加为1,原因是增加,前提是测试基于重采样 | ^ θ * - θ | 上,但是电源至多降低至显着性水平(如| …

2
欧米茄与Alpha可靠性
我想知道是否有人可以解释Ω和alpha可靠性之间的主要区别是什么? 我了解欧米茄的可靠性基于下图所示的层次因子模型,而alpha使用平均项目间相关性。 我不了解的是,在什么情况下,欧米茄的可靠性系数会高于阿尔法系数,反之亦然? 我是否可以假设子因子和变量之间的相关性更高,则欧米伽系数也会更高(如上图所示)? 任何建议表示赞赏!

3
使用计算机模拟以更好地理解研究生级别的统计概念
您好,我正在修读统计学的研究生课程,并且我们涵盖了测试统计和其他概念。 但是,我通常能够运用公式并就事物的工作原理形成某种直觉,但我常常感到,如果我通过模拟实验来支持研究,那么我将对眼前的问题有更好的直觉。 因此,我一直在考虑编写简单的模拟,以更好地理解我们在课堂上讨论的一些概念。现在我可以用说Java来: 产生具有正常均值和标准差的随机总体。 然后取一个小样本,尝试尝试凭经验计算Type-I和Type-II错误。 现在我的问题是: 这是发展直觉的合法方法吗? 是否有执行此操作的软件(SAS?,R?) 统计学是一门处理此类编程的学科吗:实验统计?,计算统计?模拟?

1
使用ggplot或ellipse软件包绘制95%CI椭圆时获得不同的结果
我想protoclust{protoclust}通过为用于对我的数据进行分类的每对变量创建散点图,按类着色以及为每个类的95%置信区间重叠椭圆来可视化聚类的结果(用生成),以对每个类进行重叠(以检查椭圆类在每对变量下重叠)。 我已经以两种不同的方式实现了椭圆的绘制,并且生成的椭圆也不同!(第一个实现使用更大的椭圆!)先验的只是它们的大小不同(有些不同的缩放比例?),因为轴的中心和角度在两者上似乎是相似的。我想我一定是通过使用其中之一(不要同时使用两者!)或参数来做错事。 谁能告诉我我在做什么错? 这里是两个实现的代码;两者均基于“ 如何将数据椭圆叠加到ggplot2散点图上”的答案? ### 1st implementation ### using ellipse{ellipse} library(ellipse) library(ggplot2) library(RColorBrewer) colorpal &lt;- brewer.pal(10, "Paired") x &lt;- data$x y &lt;- data$y group &lt;- data$group df &lt;- data.frame(x=x, y=y, group=factor(group)) df_ell &lt;- data.frame() for(g in levels(df$group)){df_ell &lt;- rbind(df_ell, cbind(as.data.frame(with(df[df$group==g,], ellipse(cor(x, y),scale=c(sd(x),sd(y)),centre=c(mean(x),mean(y))))),group=g))} p1 &lt;- ggplot(data=df, aes(x=x, y=y,colour=group)) + geom_point() …

2
建立一个时间序列,其中包含每个日期的多个观测值
我正在尝试将时间序列应用于10年期间的季度采样数据(动物生物质),每季度3次。因此有40个日期,但总共有120个观测值。 我已经阅读过Shumway和Stoffer的时间序列分析及其应用中的SARIMA'a以及略过的Woodward等。等人的《应用时间序列分析》,我的理解是,每个模型都基于时间序列中每个点的一次观察。 问题:如何在模型的每个观测值中包括变化?我可以在均值的基础上建立一个序列,但我会放宽每次观察的差异,我认为这对于我了解正在发生的事情至关重要。
11 r  time-series 

2
出于回归的目的,减少预测变量的维数有什么优势?
与传统的回归技术(不进行任何降维处理)相比,降维回归(DRR)或监督降维(SDR)技术有哪些应用或优势?这些技术类别可为回归问题找到特征集的低维表示。此类技术的示例包括切片逆回归,主Hessian方向,切片平均方差估计,内核切片逆回归,主成分回归等。 就交叉验证的RMSE而言,如果在没有任何降维的情况下算法在回归任务上表现更好,那么降维用于回归的真正用途是什么?我不了解这些技术。 这些技术是否有机会用于减少回归所需的时间和空间?如果这是主要优点,那么使用此技术后,一些有关降低高维数据集复杂性的资源将很有帮助。我以运行DRR或SDR技术本身需要一些时间和空间这一事实来对此进行辩论。低调数据集上的此SDR / DRR +回归是否比高调数据集上的仅回归快? 是否仅出于抽象兴趣对这种设置进行了研究,并且没有很好的实际应用? 顺带一提:有时会假设特征和响应的联合分布在流形上。在这种情况下,从观察到的样本中学习流形对于解决回归问题是有意义的。ÿXXXÿYY

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.