统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
使用文本挖掘/自然语言处理工具进行计量经济学
我不确定这个问题在这里是否完全合适,否则请删除。 我是经济学研究生。对于一个调查社会保险问题的项目,我可以访问大量涉及资格评估的行政案例报告(> 200k)。这些报告可以链接到单个管理信息。我想从这些报告中提取可用于定量分析的信息,最好是使用grep/ awk等进行简单的关键字/正则表达式搜索。 自然语言处理对此有多有用?还有哪些其他有用的文本挖掘方法?据我了解,这是一个很大的领域,很可能某些报告必须进行转换才能用作语料库。是否值得花一些时间来熟悉文献和方法?会有所帮助吗,以前做过类似的事情吗?就回报而言,是否值得?也就是说,我是否可以使用NLP进行潜在的有用信息来进行经济学实证研究? 可能会有资金雇用某人来阅读和准备一些报告。这是一个较大的项目,有可能申请更多的资金。如果绝对必要,我可以提供有关该主题的更多详细信息。一种潜在的并发症是该语言是德语,而不是英语。 关于资格,我主要接受计量经济学方面的培训,并且在Hastie等人的水平上对计算统计有所了解。书。我知道Python,R,Stata,并且可能很快就会熟悉Matlab。给定这些库,我认为Python是为此选择的工具。如果相关的话,根本就不需要定性方法方面的培训,但是我知道我可以联系一些人。 我很高兴为此提供任何输入,即,如果这可能有用,那么,从哪里开始阅读,以及特别关注哪些工具。


2
稳健的边际可能性MCMC估计器?
我正在尝试通过蒙特卡洛方法来计算统计模型的边际可能性: f(x)=∫f(x∣θ)π(θ)dθf(x)=∫f(x∣θ)π(θ)dθf(x) = \int f(x\mid\theta) \pi(\theta)\, d\theta 可能性表现良好-平滑,对数凹入-但维数高。我已经尝试过重要性抽样,但是结果很奇怪,并且在很大程度上取决于我使用的建议。我简要地考虑了假设哈密顿量在前一个统一的基础上,进行哈密顿量计算θθ\theta并以谐波均值,直到我看到了。经验教训,谐波均值可以具有无限方差。是否存在替代MCMC估算器,该估算器几乎一样简单,但具有良好的方差?

2
具有已知断点的分段线性回归中斜率的标准误差
情况 我有一个具有一个因变量和一个独立变量的数据集。我想用出现在已知/固定断点拟合连续分段线性回归。已知breakpoins没有不确定性,所以我不想估计它们。然后,我拟合以下形式的回归(OLS): 这是ÿÿyXXxķķk(一个1个,一个2,… ,一个ķ)(一个1个,一个2,…,一个ķ)(a_{1}, a_{2}, \ldots, a_{k})ÿ一世=β0+β1个X一世+β2最高(X一世-一个1个,0 )+β3最高(X一世-一个2,0 )+ … +βk + 1最高(X一世-一个ķ,0)+ϵ一世ÿ一世=β0+β1个X一世+β2最高⁡(X一世-一个1个,0)+β3最高⁡(X一世-一个2,0)+…+βķ+1个最高⁡(X一世-一个ķ,0)+ϵ一世 y_{i} = \beta_{0} + \beta_{1}x_{i} + \beta_{2}\operatorname{max}(x_{i}-a_{1},0) + \beta_{3}\operatorname{max}(x_{i}-a_{2},0) +\ldots+ \beta_{k+1}\operatorname{max}(x_{i}-a_{k},0) +\epsilon_{i} R set.seed(123) x <- c(1:10, 13:22) y <- numeric(20) y[1:10] <- 20:11 + rnorm(10, 0, 1.5) y[11:20] <- seq(11, 15, len=10) + rnorm(10, 0, 2) …

4
(交互)MCMC用于多模式后路
我正在尝试使用MCMC从具有多种模式的后验样本中进行采样,这些模式之间的距离特别远。看起来在大多数情况下,这些模式中只有一种包含我要寻找的95%hpd。我试图实现基于回火模拟的解决方案,但这不能提供令人满意的结果,因为在实践中,从一种“捕获范围”到另一种“捕获范围”是昂贵的。 因此,在我看来,更有效的解决方案是从不同的起点运行许多简单的MCMC,并通过使MCMC相互交互而进入主导解决方案。您知道是否有实施此想法的适当方法? 注意:我发现http://lccc.eecs.berkeley.edu/Papers/dmcmc_short.pdf(分布式马尔可夫链Monte Carlo,Lawrence Murray)看上去很接近我在寻找的东西,但我真的不理解设计的函数。[R一世[R一世R_i [编辑]:缺少答案似乎表明我的最初问题没有明显的解决方案(使从不同起点从相同目标分布进行采样的多个MCMC相互交互)。真的吗 ?为什么这么复杂?谢谢

1
带有荟萃分析的频率论方法和贝叶斯方法之间有什么区别?
假设我正在执行一项针对特定健康措施的分析。我对患者和对照组之间在该指标上的差异以及差异是否与0感兴趣。过去有研究针对我相同的研究问题和健康指标,但对患者的样本不同。 在贝叶斯分析中,我将基于先前的研究(包括均值差和标准误差)建立先验分布。 如果这是一个新手问题,请原谅我,因为我正在学习贝叶斯统计数据,但是贝叶斯分析的结果与使用反向方差加权荟萃分析结合了来自贝叶斯统计的均值差异估计的结果在哪些方面有所不同?使用我当前的数据进行的先前研究?

1
在Dirichlet过程中将先验值放在浓度参数上
其中大部分是背景知识,如果您已经对Dirichlet过程混合物有足够的了解,请跳到最后。假设我正在建模来自Dirichlet进程混合的某些数据,即让并以条件假定F∼D(αH)F∼D(αH)F \sim \mathcal D(\alpha H)FFFYi∼iid∫f(y|θ)F(dθ).Yi∼iid∫f(y|θ)F(dθ).Y_i \stackrel {iid}{\sim} \int f(y | \theta) F(d\theta). 这里和是现有基础量度。事实证明,如果对于每个观测,如果我知道相关的潜伏,则此模型中的可能性为,其中是的不同值的数量(随机度量几乎肯定是离散的)。Escobar和West开发了以下使用Gamma优先级对进行采样的方案;首先,他们写α>0α>0\alpha > 0αHαH\alpha HYiYiY_iθiθi\theta_iαα\alphaL(α|t)∝αtΓ(α)Γ(α+n)L(α|t)∝αtΓ(α)Γ(α+n)L(\alpha | t) \propto \frac{\alpha^t\Gamma(\alpha)}{\Gamma(\alpha + n)}tttθiθi\theta_iFFFαα\alphaπ(α|t)∝π(α)αtΓ(α)Γ(α+n)∝π(α)αt−1(α+n)B(α+1,n)=π(α)αt−1(α+n)∫10xα(1−x)n−1 dx,π(α|t)∝π(α)αtΓ(α)Γ(α+n)∝π(α)αt−1(α+n)B(α+1,n)=π(α)αt−1(α+n)∫01xα(1−x)n−1 dx, \pi(\alpha | t) \propto \pi(\alpha) \frac{\alpha^t\Gamma(\alpha)}{\Gamma(\alpha + n)} \propto \pi(\alpha)\alpha^{t - 1}(\alpha + n){B(\alpha + 1, n)} \\= \pi(\alpha)\alpha^{t - 1} (\alpha + n) \int_0^1 x^\alpha(1 …

2
帮助我拟合此非线性多元回归方法,该回归方法已经克服了之前的所有努力
编辑:自从发布此帖子以来,我在这里还跟了一个额外的帖子。 以下是本文的摘要:我正在研究一个模型,并尝试了线性回归,Box Cox变换和GAM,但并没有取得太大进展 R目前,我正在使用模型来预测大联盟(MLB)级别的小联盟棒球运动员的成功。因变量,进攻职业生涯胜过替补球员(oWAR),是美国职业棒球大联盟(MLB)级别成功的代名词,用球员在其职业生涯中参与的每场比赛的进攻贡献总和来衡量(详细信息此处-http ://www.fangraphs.com/library/misc/war/)。自变量是z得分的小联盟进攻变量,用于统计数据,被认为是在大联盟级别取得成功的重要预测指标,包括年龄(年轻球员的成功率更高,他们的前景更好),淘汰率[SOPct ],步行率[BBrate]和调整后的产量(进攻性产品的全球量度)。另外,由于次要联赛有多个级别,因此我为次要联赛的比赛水平提供了虚拟变量(双A,高A,低A,新秀和短赛季,三A [主要联赛之前的最高水平]作为参考变量])。注意:我已经将WAR重新缩放为一个从0到1的变量。 变量散点图如下: 作为参考,因变量oWAR具有以下图表: 我从线性回归开始,oWAR = B1zAge + B2zSOPct + B3zBBPct + B4zAdjProd + B5DoubleA + B6HighA + B7LowA + B8Rookie + B9ShortSeason获得了以下诊断图: 存在明显的问题,即缺乏残差的无偏性和缺乏随机变化。此外,残差不正常。回归结果如下所示: 遵循上一个线程中的建议,我尝试了Box-Cox转换,但没有成功。接下来,我尝试了带有日志链接的GAM,并收到了以下图表: 原版的 新的诊断图 样条曲线似乎有助于拟合数据,但诊断图仍显示拟合差。编辑:我以为我原来是在看残差与拟合值,但我不正确。最初显示的图被标记为“原始”(上方),我后来上传的图被标记为“新诊断图”(也在上方) 的 [R2[R2R^2 模型的数量增加了 但是该命令产生的结果gam.check(myregression, k.rep = 1000)并不令人满意。 谁能建议该模型的下一步?我很高兴提供您认为可能对理解我到目前为止所取得的进步有用的任何其他信息。感谢您的任何帮助,您可以提供。


1
可视化来自多个潜在类模型的结果
我正在使用潜在类分析来基于一组二进制变量对观察样本进行聚类。我正在使用R和软件包poLCA。在LCA中,您必须指定要查找的群集数。实际上,人们通常运行几个模型,每个模型指定不同数量的类,然后使用各种标准来确定哪个是对数据的“最佳”解释。 我经常发现查看各种模型非常有用,以试图了解分类为(i + 1)的模型如何分布在分类为(i)的模型中的观察结果。至少,有时您会发现存在非常健壮的集群,而与模型中的类数无关。 我希望有一种方法来绘制这些关系的图表,以便更轻松地在论文中以及与非统计方向的同事交流这些复杂的结果。我想使用某种简单的网络图形包在R中很容易做到这一点,但我根本不知道如何做。 谁能给我指出正确的方向。下面是重现示例数据集的代码。每个向量xi在具有i个可能类别的模型中代表100个观测值的分类。我想画出观察(行)如何跨列在类之间移动。 x1 <- sample(1:1, 100, replace=T) x2 <- sample(1:2, 100, replace=T) x3 <- sample(1:3, 100, replace=T) x4 <- sample(1:4, 100, replace=T) x5 <- sample(1:5, 100, replace=T) results <- cbind (x1, x2, x3, x4, x5) 我想有一种方法可以生成图,其中节点是分类,并且边缘反映(按权重或颜色)(从权重或颜色可能)从一个模型转移到另一个模型的观察值的百分比。例如 更新:igraph软件包取得了一些进展。从上面的代码开始... poLCA结果循环使用相同的数字来描述类成员身份,因此您需要做一些重新编码。 N<-ncol(results) n<-0 for(i in 2:N) { results[,i]<- (results[,i])+((i-1)+n) …



3
如何解释R中lm公式中的相互作用项?
在R中,如果我lm()以以下方式调用该函数: lm.1 = lm(response ~ var1 + var2 + var1 * var2) summary(lm.1) 这给了我一个带有的响应变量的线性模型var1,var2以及它们之间的相互作用。但是,我们如何精确地数字化解释交互作用项? 该文档说这是var1和之间的“交叉” var2,但没有给出“交叉”的确切含义。 知道R正在计算什么确切数字以合并两个变量之间的相互作用,这对我很有帮助。
9 r  regression 

2
高斯-马尔可夫定理:BLUE和OLS
我正在阅读Wikipedia上的Guass-Markov定理,并且希望有人可以帮助我确定该定理的要点。 我们假设矩阵形式的线性模型由下式给出: 并且我们正在寻找BLUE,。y=Xβ+ηy=Xβ+η y = X\beta +\eta βˆβ^ \widehat\beta 按照此,我会标注 “残余”和 “错误”。(即与高斯-马尔可夫页面上用法相反)。η=y−Xβη=y−Xβ\eta = y - X\betaε=βˆ−βε=β^−β\varepsilon = \widehat\beta - \beta 可以将OLS(普通最小二乘)估计器导出为。||residual||22=||η||22||residual||22=||η||22||\text{residual}||_2^2 = ||\eta||_2^2 现在,让表示期望运算符。据我了解,高斯-马尔可夫定理告诉我们的是,如果且,则argmin线性,无偏估计量由与OLS估算器。EE\mathbb{E}E(η)=0E(η)=0\mathbb{E}(\eta) = 0Var(η)=σ2IVar(η)=σ2I\text{Var}(\eta) = \sigma^2 I E(||error||22)=E(||ε||22)E(||error||22)=E(||ε||22)\mathbb{E}(||\text{error}||_2^2) = \mathbb{E} (||\varepsilon||_2^2) 即 argminβˆ(y)||η||22=(X′X)−1X′y=argminlinear, unbiased βˆ(y)E(||ε||22)argminβ^(y)||η||22=(X′X)−1X′y=argminlinear, unbiased β^(y)E(||ε||22) \text{argmin}_{\text{} \widehat\beta(y)} \, ||\eta||_2^2 \;=\; (X'X)^{-1}X'y \;=\; \text{argmin}_{\text{linear, unbiased } \widehat\beta(y)} …

3
Fisher精确检验中的检验统计量是多少?
对于2 x 2列联表,某些Fisher精确测试使用表(1,1)单元格中的计数作为测试统计量,在零假设下,将具有超几何分布。X1 ,1X1个,1个X_{1,1}X1 ,1X1个,1个X_{1,1} 有人说它的测试统计量是 其中是null下超几何分布的平均值(如上所述)。它还说,p值是根据高计量分布的表格确定的。我想知道是否有一些原因减去均值然后取绝对值?在null下没有超几何分布,是吗?|X1 ,1- μ ||X1个,1个-μ| |X_{1,1} - \mu| μμ\mu|X1 ,1- μ ||X1个,1个-μ||X_{1,1} - \mu|

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.