统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
重新加权美国社区调查多样性数据将如何影响其误差范围?
背景:我的组织目前根据美国社区调查(美国人口普查局的一项调查项目),将其劳动力多样性统计数据(例如,残疾人百分比,妇女百分比,退伍军人百分比)与这些群体的劳动力总数进行比较。这是一个不准确的基准,因为我们有一组非常具体的工作,这些工作的人口统计学与整体劳动力不同。例如,假设我的组织主要是工程师。在我所在的州,工程学只有大约20%的女性。如果我们将自己与总劳动力基准进行比较(该基准更像是50%的女性),则会引起恐慌:“我们只有20%的女性,这是一场灾难!” 实际上,我们应该期望达到20%,因为这就是劳动力状况。 我的目标:我想做的是获取《美国社区调查》的职业数据(按多样性类别),然后根据我的工作岗位构成对其进行加权。这是社会和社区服务工作者的样本数据集。我想将这些工作代码加在一起(因为我们的人行横道是工作组,而不是特定的工作代码),然后我要根据该类别中的人数(例如我们的3,000个社交网络和社区服务工作者),那么我想对所有其他工作组执行相同的操作,将这些数字加在一起,然后除以我们的工作者总数。这将为我提供一种新的重新加权的多样性衡量指标(例如,从6%的残疾人到2%的残疾人)。 我的问题:如何使误差范围适合此最终汇总基准?我没有原始的人口普查数据集(显然),但是您可以通过将表格顶部的“估计”字段切换为“误差范围”,在我提供的链接中查看每个数字的误差范围。我与这些数据一起工作的其他同事完全打算忽略误差范围,但我担心我们正在为自己创建一个无统计学意义的基准。经过上述操作后,该数据是否仍然仍然可用?

2
在纵向研究中,我是否应该为在随访中迷失的个体估算在时间2处得出的结果Y?
我在一个人样本中有2次重复测量。在第1时刻有18,000人,在第2时刻有13,000人(失去了5,000人的随访机会)。 我想对在时间1测量的一组预测变量X回归在时间2测量的结果Y(并且在时间1无法测量结果)。所有变量都缺少一些数据。大部分看起来相对随机,或者所观察到的数据似乎很好地描述了缺失。但是,结果Y中的绝大多数缺失是由于后续损失所致。我将使用多个插补(R :: mice),并将使用完整的数据集为X插补值,但是我收到了关于Y插补的2条相互矛盾的建议: 1)在18k的完整样本中从X和V(V =有用的辅助变量)估算Y。 2)不要将Y归因于因追踪而丢失的个体(因此将其从任何后续回归模型中删除)。 前者是有道理的,因为信息就是信息,所以为什么不全部使用它呢?但是后者以更直观的方式也很有意义-根据Y〜X + V估算5000人的结果,然后转回并估算Y〜X似乎是错误的。 哪个(更)正确? 前一个问题很有用,但并不能直接解决由于失去后续行动而造成的失踪(尽管答案可能是相同的;我不知道)。 结果变量的多重插补

2
找出最小协方差矩阵的适当方法
在我读的教科书中,他们使用正定性(半正定性)来比较两个协方差矩阵。这个想法是,如果是Pd然后小于。但是我很难理解这种关系吗?A − BA−BA-B乙BB一个AA 这里有一个类似的线程: /math/239166/what-is-the-intuition-for-using-definiteness-to-compare-matrices 使用确定性比较矩阵的直觉是什么? 尽管答案很好,但它们并不能真正解决直觉。 这是一个令人困惑的示例: [ 1612129] - [ 1224][1612129]−[1224]\begin{equation} \begin{bmatrix} 16 & 12 \\ 12 & 9 \end{bmatrix} - \begin{bmatrix} 1 & 2 \\ 2 & 4 \end{bmatrix} \end{equation} 现在这里的差异的决定因素是-25,因此该关系不是pd甚至psd,因此第一个矩阵不大于第一个矩阵? 我只想比较两个3 * 3协方差矩阵,看看哪个最小?在我看来,使用欧几里得范数之类的东西进行比较会更直观吗?但是,这将意味着上面的第一个矩阵大于第二个矩阵。而且,我只见过用于比较协方差矩阵的pd / psd准则。 有人可以解释为什么pd / psd比使用其他方法(例如欧几里得范数)更好吗? 我也已经在数学论坛上发布了这个问题(不确定什么是最好的),希望这不违反任何规则。 /math/628135/comparing-two-covariance-matrices

4
混合模型思想与贝叶斯方法
在混合模型中,我们假设随机效应(参数)是遵循正态分布的随机变量。它看起来与贝叶斯方法非常相似,在贝叶斯方法中,所有参数均假定为随机参数。 那么随机效应模型是贝叶斯方法的特例吗?

2
绘制平均值,标准差,最小值和最大值的汇总统计信息?
我来自经济学背景,通常在该学科中,变量的摘要统计信息记录在表格中。但是,我希望将它们绘制出来。 我可以修改箱形图以使其显示均值,标准差,最小值和最大值,但我不希望这样做,因为箱形图传统上用于显示中位数以及Q1和Q3。 我所有的变量都有不同的标度。如果有人可以提出一种有意义的方式来汇总这些摘要统计信息,那将是很好的。我可以使用R或Stata。

2
稳健的回归推断和Sandwich估计量
您能否举一个使用三明治估计器来执行可靠回归推断的示例? 我可以在中看到示例?sandwich,但是我不太理解如何使用函数返回的方差-协方差矩阵从lm(a ~ b, data)(r编码)到估计值和p值,该值是由回归模型得出的sandwich。
10 r  regression  lm  sandwich 

3
当大时比较嵌套的二进制logistic回归模型
为了更好地问我的问题,我已经提供了一些来自一个16级模型(输出fit)和17变量模型(fit2)以下(在这些模型中的所有预测变量是连续的,在这些模型之间的唯一区别在于fit不包含变量17(var17)): fit Model Likelihood Discrimination Rank Discrim. Ratio Test Indexes Indexes Obs 102849 LR chi2 13602.84 R2 0.173 C 0.703 0 69833 d.f. 17 g 1.150 Dxy 0.407 1 33016 Pr(> chi2) <0.0001 gr 3.160 gamma 0.416 max |deriv| 3e-05 gp 0.180 tau-a 0.177 Brier 0.190 fit2 Model Likelihood Discrimination …

2
测试人们在反复输球后是否退出比赛或降低赌注
我有关于每轮比赛后5轮消耗减少的一系列获胜和失败投注数据。我正在使用如下所示的决策树来显示数据。 往树顶的节点是那些有下注的节点,而往树底的那些节点是有下注的节点。我想看看(a)每个节点的损耗(b)每个节点的平均赌注大小变化。我正在查看前一个节点上每个节点的损耗率和存活率(如果概率为50%,则使用每个节点上的预期人数)。例如,如果每个节点的概率为50%,则在开始的1000个节点中,第二个节点W和L中应该有大约500个人。假设是(a)损失之后损耗率更高赌注(b)表示输家后减少赌注大小,赢家后增加赌注。 我只想首先在一个非常简单的单变量设置中执行此操作。如果有50个人退出,我如何执行t检验以显示从节点WW到节点WWW的平均下注大小的变化在统计上是显着的?我不确定这是正确的方法:每个后续下注都是独立的,但是人们在输家之后都退出比赛,因此样本不匹配。如果只是同一班同学一次又一次地参加一系列考试而又没有一个人辍学的情况,我会理解如何进行适当的t检验,但是我认为这有点不同。 我怎样才能做到这一点?此外,如果结果受到少数客户的歪曲,我该如何计算出前5%和后5%的收入?只是从下注1-3中删除累积赌注最高的客户? 我有从中生成该图的数据,所以在每个节点上都有平均值,std,std错误等。

1
在R中快速与eCDF集成
我有一个形式为的积分方程, 其中是经验cdf,是一个函数。我有一个压缩映射,所以我尝试使用Banach不动点定理序列来求解积分方程。˚F Ñ克Ť1个(x )= ∫X0G(T1个(y))d F^ñ(y)Ť1个(X)=∫0XG(Ť1个(ÿ)) dF^ñ(ÿ) T_1(x) = \int_0^x g(T_1(y)) \ d\hat{F}_n(y) F^ñF^ñ\hat{F}_nGGg 但是,这在R中运行非常缓慢,我想这是因为我一次又一次地对使用sum()函数进行积分。X ∈ ˚F^ñX∈F^ñx \in \hat{F}_n 有没有一种更快的方法可以将经验分布与诸如Integrated()之类的函数结合使用?

1
统计模型符号是否有“标准”?
例如,在BUGS手册或Lee和Wagenmakers即将出版的书(pdf)中,以及在许多其他地方,都使用了一种表示法,在我看来,它非常灵活,因为它可以用于简洁地描述大多数统计模型。这种表示法的示例如下: ÿ一世〜二项式(p一世,n一世)日志(p一世1 − p一世)= b一世b一世〜正常(μp,σp)yi∼Binomial(pi,ni)log⁡(pi1−pi)=bibi∼Normal(μp,σp) y_i \sim \text{Binomial}(p_i,n_i) \\ \log(\frac{p_i}{1 - p_i}) = b_i \\ b_i \sim \text{Normal}(\mu_p,\sigma_p) 它将描述一个没有预测变量但组的分层逻辑模型。描述模型的这种方式似乎工作同样适用于描述频率论者和贝叶斯模型,例如,使这个模型描述完全贝叶斯你只需要添加对先验和。μ p σ pi = 1 … ni=1…ni = 1\dots n μpμp\mu_pσpσp\sigma_p 在某些文章或书中是否详细描述了这种类型的模型符号/形式主义? 如果要使用此符号来编写模型,则有许多不同的处理方式,这对于结合和参考他人的全面指南非常有用。我发现人们在使用这种表示法方面存在一些差异: 您如何称呼分配?例如,我看过等。ñ,N ,范数,正常N,N,Norm,Normal\mathcal{N},\text{N},\text{Norm},\text{Normal} 您如何处理索引?例如,我看过,y_ {i [j]},y_ {j | i}等。 y i [ j ] y j | 一世ÿ我Ĵyijy_{ij}ÿ我[ j …

2
如何比较其数据符合指数分布的两个样本的平均值
我有两个数据样本,一个基线样本和一个治疗样本。 假设是治疗样本的平均值高于基线样本。 两个样品的形状都是指数的。由于数据相当大,因此在运行测试时,我只具有每个样本的均值和元素数。 我如何检验该假设?我猜想这很容易,我遇到了使用F-Test的一些参考,但是我不确定参数如何映射。

4
我想显示
令为概率空间上的随机变量。证明X:Ω→NX:Ω→NX:\Omega \to \mathbb N(Ω,B,P)(Ω,B,P)(\Omega,\mathcal B,P)E(X)=∑n=1∞P(X≥n).E(X)=∑n=1∞P(X≥n).E(X)=\sum_{n=1}^\infty P(X\ge n). 我对定义等于 E(X)E(X)E(X)E(X)=∫ΩXdP.E(X)=∫ΩXdP.E(X)=\int_\Omega X \, dP. 谢谢。

4
当前辩论对统计意义的影响
在过去的几年中,各种各样的学者提出了一个有害的科学假设检验问题,称为“研究者自由度”,这意味着科学家在分析过程中有很多选择偏向于p值<5%的发现。例如,这些模棱两可的选择包括要包含的情况,被归类为异常的情况,运行大量的模型规范,直到出现某种情况,不发布无效结果,等等。(引发心理学争论的论文在这里,看到一个受欢迎的石板条和后续辩论安德鲁·盖尔曼在这里,和时代杂志还谈到了这个话题在这里。) 首先,一个澄清问题: 《时代》杂志写道, “ 0.8的幂表示经过检验的十个真实假设中,只有两个被排除在外,因为其影响未在数据中得到体现。” 我不确定这是否适合我在教科书中找到的幂函数的定义,这是拒绝空值作为参数的函数的可能性。使用不同的我们具有不同的功能,因此我不太理解上面的引用。θθθ\thetaθθ\theta 其次,一些研究意义: 在我的政治科学/经济学领域,学者只是用尽了所有可用的国家/地区年度数据。因此,我们不应该在这里摆弄样品吗? 是否可以仅通过学科中的其他人将重新测试您的论文并由于没有可靠结果而立即将您击倒这一事实来解决运行多个测试但仅报告一个模型的问题?预见到这一点,我这一领域的学者更有可能包括一robustness check节,他们表明多个模型规范不会改变结果。这够了吗? 安德鲁·盖尔曼(Andrew Gelman)和其他人指出,无论数据如何,总是有可能找到并发布一些并非真正存在的“模式”。但是,考虑到任何经验的“模式”都必须得到理论的支持,并且学科内的竞争理论只会进行辩论/竞赛,以找出哪个阵营能够找到更多的“模式”,因此这不必担心。在各个地方。如果某个模式确实是虚假的,那么当其他样本/设置中没有类似的模式时,后面的理论将很快被推翻。这不是科学的进步吗? 假设当前期刊对无效结果的趋势实际上将会蓬勃发展,是否有办法让我们将所有无效结果和肯定结果汇总在一起,并推断它们都试图检验的理论?

2
了解功能哈希
Wikipedia在描述特征哈希时提供了以下示例;但映射似乎与定义的字典不一致 例如,to应3根据字典进行转换,但是将其编码为1。 描述中有错误吗?功能哈希如何工作? 文本: John likes to watch movies. Mary likes too. John also likes to watch football games. 可以使用字典进行转换 {"John": 1, "likes": 2, "to": 3, "watch": 4, "movies": 5, "also": 6, "football": 7, "games": 8, "Mary": 9, "too": 10} 到矩阵 [[1 2 1 1 1 0 0 0 1 …


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.