统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
一个人如何主观排名的结果?
我正在寻找一种可视化主观排名的方法,与我的非参数测试分开。 我已经请12名参与者根据不同的主观标准对8个不同的项目进行排名(每个项目分别进行排名)。对于任何单独的排名,我都在寻找一种可视化排名高级趋势的好方法。 我已经在平均排名上尝试了条形图和雷达图,而且我看到另一个人在每个排名的响应数上使用了散点图/气球图,但是我不确定是什么传达了最好的概观。我可以使用8个平均排名,也可以使用每个项目的每个排名的8个计数。 编辑: 例如:每列是一个项目,每行是一个人对八个项目中每个项目的排名。在此示例中,并不是一个特别强的协议,但总的来说,我们希望了解传达总体趋势的最佳方法。 Item: A B C D E F G H Rater: 1 6 8 1 7 3 4 2 5 2 1 3 8 7 6 5 2 4 3 5 8 7 6 1 4 2 3 4 5 8 7 6 4 2 1 …

3
实现岭回归:选择用于智能电网
我正在Python / C模块中实现Ridge回归,并且遇到了这个“小”问题。我的想法是,我想或多或少地等距采样有效自由度(例如“统计学习的要素”上第65页的图),即样本: df(λ)=∑i=1pd2id2i+λ,df(λ)=∑i=1pdi2di2+λ,\mathrm{df}(\lambda)=\sum_{i=1}^{p}\frac{d_i^2}{d_i^2+\lambda},d2idi2d_i^2XTXXTXX^TXdf(λmax)≈0df(λmax)≈0\mathrm{df}(\lambda_{\max})\approx 0df(λmin)=pdf(λmin)=p\mathrm{df}(\lambda_{\min})=pλmax=∑pid2i/cλmax=∑ipdi2/c\lambda_{\max}=\sum_i^p d_i^2/cλmax≫d2iλmax≫di2\lambda_{\max} \gg d_i^2cccc=0.1c=0.1c=0.1λmin=0λmin=0\lambda_{\min}=0 如标题所示,那么,我需要以一定比例从到采样,以便(大概)对进行采样,例如从到间隔为 ...有没有简单的方法可以做到这一点?我曾想过使用牛顿-拉夫森方法为每个解方程,但这会增加过多的迭代,特别是当大时。有什么建议么?λλ\lambdaλminλmin\lambda_{\min}λmaxλmax\lambda_{\max}df(λ)df(λ)\mathrm{df}(\lambda)0.10.10.1cccpppdf(λ)df(λ)\mathrm{df}(\lambda)λλ\lambdappp

2
列联表:要执行什么测试以及何时执行?
我希望看到有关古老的chi-sq与Fisher的确切测试辩论的讨论的扩展,从而扩大了范围。列联表中有许多用于交互的测试,足以使我旋转。我希望对我应该使用哪种测试以及何时使用进行解释,当然也可以解释为什么一个测试比另一个测试更受欢迎。 我目前的问题是经典的情况,但是至少在不确定的情况下,欢迎提供有关更高维度的答案,以及在R中实现各种解决方案的技巧。n×mn×mn \times m 下面列出了我知道的所有测试;我希望通过公开我的错误可以纠正它们。 χ2χ2\chi^2。旧的备用。这里有三个主要选项: R对2x2表内置的校正:“从所有差中减去一半。” 我应该一直这样做吗?|O−E||O−E||O-E| “ ”测试,不确定如何在R中执行此操作。χ 2N−1N−1N-1χ2χ2\chi^2 蒙特卡洛模拟。这总是最好的吗?为什么我这样做时R不给我df? 费舍尔的精确检验。 传统上建议何时应将任何单元格小于4,但显然有些人对此建议提出异议。 (通常是错误的)边际固定的假设真的是这个测试的最大问题吗? 巴纳德的精确测试 另一个确切的测试,只是我从未听说过。 泊松回归 关于glms总是让我感到困惑的一件事就是如何进行这种重要性测试,因此在此方面的帮助将不胜感激。最好进行嵌套模型比较吗?对于特定预测变量的Wald检验呢? 我真的应该一直在进行泊松回归吗?这是什么和之间的实际差别测试?χ2χ2\chi^2


2
如何用一阶差分变量解释回归?
我有两个时间序列: 代表市场风险溢价(ERP;红线) 由政府债券代理的无风险利率(蓝线) 我想测试无风险利率能否解释ERP。在此,我基本上遵循了Tsay(2010,第3版,第96页)的建议:Financial Time Series: 拟合线性回归模型并检查残差的序列相关性。 如果残差序列是单位根非平稳性,则将因变量和解释变量的第一个差值作为第一个差。 第一步,我得到以下结果: Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 6.77019 0.25103 26.97 <2e-16 *** Risk_Free_Rate -0.65320 0.04123 -15.84 <2e-16 *** --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1 如该图所示,该关系是负的并且是重要的。但是,残差是序列相关的: 因此,我首先要区分因变量和解释变量。这是我得到的: Coefficients: Estimate Std. Error t …

2
简化具有相同n和k的所有可能值的组合的总和
有没有办法简化这个方程式? ( 81个) +( 82) +( 83) +( 84) +( 85) +( 86) +( 87) +( 88)(81个)+(82)+(83)+(84)+(85)+(86)+(87)+(88)\dbinom{8}{1} + \dbinom{8}{2} + \dbinom{8}{3} + \dbinom{8}{4} + \dbinom{8}{5} + \dbinom{8}{6} + \dbinom{8}{7} + \dbinom{8}{8} 或更笼统地说, ∑k = 1ñ( nķ)∑ķ=1个ñ(ñķ)\sum_{k=1}^{n}\dbinom{n}{k}

2
如何在R中创建具有多个因变量的广义线性模型?
我有六个因变量(计数数据)和几个自变量,我看到在MMR中,脚本如下所示: my.model <- lm(cbind(DV1,DV2,DV3,DV4,DV5,DV6) ~ IV1 + IV2 + ... + IVn) 但是,由于我的数据是计数,因此我想使用广义线性模型,并尝试了以下方法: my.model <- glm(cbind(DV1,DV2,DV3,DV4,DV5,DV6) ~ IV1 + IV2 + ... + IVn, family="poisson") 并显示此错误消息: Error in glm.fit(x = c(1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, : (subscript) logical subscript …

3
使用t检验比较两个分类器准确性结果的统计显着性
我想比较两个分类器在统计上的准确性。两个分类器都在同一数据集上运行。这使我相信我应该使用我一直在阅读的样本进行t检验。 例如: Classifier 1: 51% accuracy Classifier 2: 64% accuracy Dataset size: 78,000 这是要使用的正确测试吗?如果是这样,我如何计算分类器之间的准确性差异是否显着? 还是我应该使用其他测试?


4
移动平均模型误差项
这是Box-Jenkins MA模型的基本问题。据我了解,MA模型基本上是时间序列值对先前误差项的线性回归。也就是说,观测值首先针对其先前值回归,然后将一个或多个值用作MA的误差项模型。YYYet,...,et−net,...,et−ne_t,..., e_{t-n}YYYYt−1,...,Yt−nYt−1,...,Yt−nY_{t-1}, ..., Y_{t-n}Y−Y^Y−Y^Y - \hat{Y} 但是,如何在ARIMA(0,0,2)模型中计算误差项?如果使用MA模型时没有自回归部分,因此没有估计值,那么我怎么可能有一个误差项?

4
在线性回归中确认残差的分布
假设我们进行了简单的线性回归y=β0+β1x+uy=β0+β1x+uy=\beta_0+\beta_1x+u,保存残差ui^ui^\hat{u_i}和绘制残差分布的直方图。如果我们得到的东西看起来像是熟悉的分布,是否可以假定我们的误差项具有该分布?说,如果我们发现残差类似于正态分布,那么假设总体中误差项的正态性是否有意义?我认为这是明智的,但是如何证明其合理性呢?

5
查找SVM最佳元参数的快速方法(比网格搜索更快)
我正在使用SVM模型对空气污染物进行短期预测。要训​​练新模型,我需要为SVM模型找到合适的元参数(我的意思是C,γ等)。 Libsvm文档(以及我已阅读的许多其他书籍)建议使用网格搜索来找到这些参数-因此,我基本上从特定集中为这些参数的每种组合训练模型,然后选择最佳模型。 有没有找到最佳(或接近最佳)元参数的更好方法?对我来说,这主要是计算时间的问题-对这个问题进行一次网格搜索大约需要两个小时(在我做了一些优化之后)。 网格搜索的优点: 它可以很容易地并行化-如果您有20个CPU,它将运行快20倍,并行化其他方法则更加困难 您检查了元参数空间的大部分,因此,如果有一个好的解决方案,您将找到它。

1
基于自举的置信区间
在研究基于引导的置信区间时,我曾经阅读以下语句: 如果引导程序分布向右偏斜,则基于引导程序的置信区间会进行校正,以将端点进一步移至右侧;这似乎违反直觉,但这是正确的操作。 我正在尝试理解上述陈述的逻辑基础。

3
R中随时间变化的系数-怎么做?
更新:很抱歉要进行其他更新,但是我发现了一些需要解决的小数多项式和竞争性风险组合的解决方案。 问题 我在R中找不到一种简单的方法来进行时变系数分析。我希望能够将变量系数转换为时变系数(而不是变量),然后绘制随时间变化的图: β米ÿ_ v a r a a b l e= β0+ β1个* t + β2* Ť2。。。β米ÿ_v一种[R一世一种b升Ë=β0+β1个∗Ť+β2∗Ť2。。。\beta_{my\_variable}=\beta_0+\beta_1*t+\beta_2*t^2... 可能的解决方案 1)分割数据集 我看了这个示例(实验课程的第2部分),但是创建一个单独的数据集似乎很复杂,计算量大,而且不是很直观... 2)降级模型-coxvc软件包 该coxvc包提供了处理问题的一种优雅的方式-这里有一个手动。问题在于作者不再开发该软件包(最新版本是自2007年5月23日以来),经过一些电子邮件对话,我已经使该软件包起作用,但是我的数据集运行了5个小时(140 000项),并在此期间结束时给出极端估算。您可以在这里找到稍微更新的软件包 -我基本上只是更新了plot函数。 这可能只是一个调整问题,但是由于该软件无法轻松提供置信区间,并且该过程非常耗时,因此我现在正在寻找其他解决方案。 3)timereg包 令人印象深刻的timereg软件包也解决了这个问题,但是我不确定如何使用它,也无法给我一个顺利的过程。 4)分数多项式时间(FPT)模型 我发现Anika Buchholz在“评估随时间变化的疗法和预后因素的长期效果 ”方面的出色论文,在涵盖不同模型方面做得很好。她的结论是,Sauerbrei等人提出的FPT似乎最适合于时间相关系数: FPT非常擅长检测时变效应,而“降低秩次”方法会导致模型过于复杂,因为它不包括时变效应的选择。 研究似乎很完整,但对我来说却有点遥不可及。自从她碰巧与Sauerbrei合作以来,我还有些纳闷。听起来似乎不错,但我想可以使用mfp软件包进行分析,但是我不确定如何做。 5)cmprsk软件包 我一直在考虑进行竞争性风险分析,但是计算非常耗时,因此我改用常规的Cox回归。该CRR有thoug时间依赖性协变量的选项: .... cov2 matrix of covariates that will be multiplied by functions of time; if …


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.