统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


5
用图形方式表示大量成对数据点的一种好方法是什么?
在我的领域中,绘制配对数据的常用方法是将一系列倾斜的细线段重叠起来,并用两组的中值和中值CI进行覆盖: 但是,由于数据点的数量变得非常大(在我的情况下,我的数量大约为10000对),这种图变得更加难以阅读: 降低alpha值会有所帮助,但这仍然不是很好。在寻找解决方案时,我遇到了本文,并决定尝试实现“平行线图”。同样,它对于少量数据点也非常有效: ññN 我想我可以分别显示两组的分布,例如使用箱形图或小提琴,并在顶部绘制一条带有误差线的线以显示两个中位数/ CI,但是我真的不喜欢这个想法,因为它无法传达数据的配对性质。 我也不太热衷于2D散点图的概念:我希望使用更紧凑的表示形式,理想情况下是将两组值沿同一轴绘制的表示形式。为了完整起见,以下是二维散点图的数据: 有谁知道一种更好的方法来表示具有很大样本量的配对数据?您能否将我链接到一些示例? 编辑 对不起,我显然在解释我要寻找的东西方面做得不够好。是的,二维散点图确实有效,并且可以通过多种方式进行改进以更好地传达点的密度-我可以根据核密度估计对点进行颜色编码,也可以制作二维直方图,我可以在点等上方绘制轮廓,等等。 但是,对于我要传达的信息,我认为这太过分了。我实际上并不关心显示点本身的2D密度-我需要做的就是以尽可能简单明了的方式显示“条”的值通常大于“点”的值。 ,并且不会丢失数据的基本配对性质。理想情况下,我想沿同一轴而不是正交轴绘制两组的配对值,因为这样可以更直观地进行比较。 也许没有比散点图更好的选择了,但是我想知道是否有其他可行的选择。

1
驯服偏斜…为什么偏斜功能这么多?
我希望对该社区的四种偏斜类型有更多的了解。 我所指的类型在http://www.inside-r.org/packages/cran/e1071/docs/skewness帮助页面中有所提及。 帮助页面中未提及旧方法,但尽管如此,我还是将其包括在内。 require(moments) require(e1071) x=rnorm(100) n=length(x) hist(x) ###############type=1 e1071::skewness(x,type=1) sqrt(n) * sum((x-mean(x))^3)/(sum((x - mean(x))^2)^(3/2)) #from e1071::skewness source m_r=function(x,r) {n=length(x); sum((x - mean(x))^r/n);} ##from e1071::skewness help g_1=function(x) m_r(x,3)/m_r(x,2)^(3/2) g_1(x) ##from e1071::skewness help moments::skewness(x) ##from e1071::skewness help (sum((x - mean(x))^3)/n)/(sum((x - mean(x))^2)/n)^(3/2) ##from moments::skewness code, exactly as skewness help page ###############type=2 …
9 skewness 

7
如果不是所有1000名受试患者都可以通过药物治愈,我们是否可以说我们接受无效假设?
在许多地方,我读到我们永远不能说我们“接受”原假设。相反,我们必须说我们“未能拒绝”原假设。 但是我不认为这与这个简单的例子如何相吻合:假设我们正在测试一种应该在24小时内完全治愈糖尿病的药物。我们对1000名患者进行了尝试,所有患者在服药后仍然患有糖尿病。 这种药物不能治愈糖尿病不是很明显吗?即,我们接受原假设吗? 我当然不会相信这种药物。 无假设:该药对患者无影响。 替代假设:该药物可治疗糖尿病


1
估计多级Logistic回归模型
以下多级逻辑模型,其中一个解释变量在级别1(个人级别),一个解释变量在级别2(组级别): π 0 Ĵ = γ 00 + γ 01 ż Ĵ + ü 0 Ĵ ... (2 )logit(pij)=π0j+π1jxij…(1)logit(pij)=π0j+π1jxij…(1)\text{logit}(p_{ij})=\pi_{0j}+\pi_{1j}x_{ij}\ldots (1) π0 Ĵ= γ00+ γ01žĴ+ 你0 Ĵ… (2 )π0j=γ00+γ01zj+u0j…(2)\pi_{0j}=\gamma_{00}+\gamma_{01}z_j+u_{0j}\ldots (2) π1 Ĵ= γ10+ γ11žĴ+ 你1 Ĵ… (3 )π1j=γ10+γ11zj+u1j…(3)\pi_{1j}=\gamma_{10}+\gamma_{11}z_j+u_{1j}\ldots (3) 其中,假定组级别残差ü0 Ĵu0ju_{0j}和ü1 Ĵu1ju_{1j}具有期望值为零的多元正态分布。残留误差 u_ {0j}的方差ü0 Ĵu0ju_{0j}指定为σ20σ02\sigma^2_0,残留误差u_ {1j}的方差 ü1 Ĵu1ju_{1j}指定为σ21个σ12\sigma^2_1。 我想估算模型的参数,并且喜欢使用 Rcommand glmmPQL。 …

1
如何对主成分应用回归来预测输出变量?
我从tutorial1,link1和link2了解了主成分分析的基础知识。 我有100个变量的数据集(包括输出变量Y),我想通过PCA将变量减少到40个,然后使用这40个变量预测变量Y。 问题1:在获取主成分并选择前40个成分之后,如果对其应用回归,则会得到一些适合数据的函数。但是如何根据原始数据预测变量Y?要预测变量YI的输入有(100-1)个变量,我如何知道要从原始的100-1变量中选择哪个40个变量? 问题2:我将PCA反转了,并从那40个主要组件中获取了数据。但是数据发生了变化,因为我只选择了前40个组件。将回归应用于这些数据是否有意义? 我使用Matlab /八度。
9 regression  pca 

1
Metafor软件包:偏差和灵敏度诊断
我正在进行多层次的荟萃分析,其中包括一些具有多种结果的文章。因此,我正在使用该rma.mv()功能。示例代码: test.main = rma.mv(yi,vi,random = ~1|ID, data = data) 我有两个问题: 我在上一个查询中了解到,使用时rma.mv(),ranktest()它不是漏斗图不对称性的可靠测试。但是,如果将样本方差作为主持人添加到原始模型中,则此模型将类似于Egger的检验: test.egger = rma.mv(yi,vi, mod = vi, random = ~1|ID, data = data) 该代码对该指南是否正确解释?另外,漏斗图作为rma.mv()模型的工具也(或多或少)无用吗? 既不评估模型结果的敏感性leave1out()也无法trimfill()与之rma.mv()合作。当前是否可将其他敏感性分析工具用于rma.mv()不精通R的模型?

2
混合效应模型中的“方差成分参数”是什么?
在贝茨关于混合效果模型的书的第12页上,他对模型进行了如下描述: 在屏幕快照的结尾处,他提到了 相对协方差因子 ,这取决于方差分量参数,θΛθΛθ\Lambda_{\theta}θθ\theta 没有解释到底是什么关系。假设我们给出,我们如何获得Λ θ从它?θθ\thetaΛθΛθ\Lambda_{\theta} 与此相关的是,这是我发现贝茨的论述缺乏细节的众多例子之一。是否有更好的文字实际经过参数估计的优化过程和测试统计量分布的证明?

2
随机效应荟萃分析的替代加权方案:遗漏标准偏差
我正在进行一项随机效应的荟萃分析,涉及许多未报告标准差的研究。所有研究均报告样本量。我认为无法估算或估算SD缺失数据。当无法为所有研究提供标准差时,如何使用原始(未标准化)均值差异作为效应量的荟萃分析进行加权?当然,我仍然可以估计tau平方,并希望将研究之间方差的度量合并到我用来留在随机效应框架内的任何加权方案中。 以下包含更多信息: 为什么原始均值差异可能仍然有用:数据以本质上有意义的比例报告:每单位美元。因此,均值差异的荟萃分析将立即得到解释。 为什么我不能近似或估算SD数据:缺少标准差数据的研究没有包含足够的数据来近似标准差(即,文献中从未报道中位数和范围)。估算丢失的数据似乎是不可取的,因为大部分研究都缺少标准差,并且因为研究在覆盖的地理区域和调查协议方面存在很大差异。 在荟萃分析中通常使用原始均值差来完成:研究权重基于均值差的标准误差(通常使用样本量项和合并方差来计算)。我没有这个 在随机效应荟萃分析中,研究权重还包括研究之间差异的术语。我有这个。 在这种情况下,可以使用简单的样本大小逆加权吗?我如何将我对tau平方的估计(或研究间差异的其他某种度量方法)纳入权重?

2
使用SVM时,为什么需要缩放功能?
根据scikit-learn中StandardScaler对象的文档: 例如,学习算法的目标函数中使用的许多元素(例如支持向量机的RBF内核或线性模型的L1和L2正则化器)都假定所有特征都围绕0居中并且具有相同顺序的方差。如果某个特征的方差比其他特征大几个数量级,则它可能会支配目标函数,并使估计器无法按预期从其他特征中正确学习。 分类前应先缩放特征。有什么简单的方法可以说明为什么我应该这样做?引用科学文章会更好。我已经找到了,但可能还有很多。


1
如何使用方差分析进行两个模型的比较?
anova比较两个模型时应如何理解结果? 例: Res.Df RSS Df Sum of Sq F Pr(>F) 1 9 54.032 2 7 4.632 2 49.4 37.329 0.0001844 *** 该手册页指出:“为一个或多个拟合模型对象计算方差(或偏差)表的分析”。但是,一位教授提到,可以将其用于模型比较-这就是我打算做的。 因此,我假设我可以使用anova(model1, model2)并获得一个p值,该值告诉我是否应该拒绝原假设:“模型相同”。 我是否可以说,如果p值小于(比如说)0.05,则模型存在显着差异?
9 r  regression  anova 

1
协调增强的回归树(BRT),广义增强的模型(GBM)和梯度增强的机器(GBM)
问题: 增强回归树(BRT)和广义增强模型(GBM)有什么区别?它们可以互换使用吗?一种是另一种的特定形式吗? 为什么里奇韦(Ridgeway)为什么使用短语“广义增强回归模型”(GBM)来描述弗里德曼以前提出的“梯度增强机”(GBM)?这两个首字母缩略词是相同的,描述相同的事物,但是源自不同的短语。 背景: 我无法确定术语BRT和GBM有何不同。据我所知,这两个术语都是用来描述分类树和回归树的,这些树通过某种增强(例如装袋,自举,交叉验证)而具有随机性。另外,据我所知,GBM是由Friedman(2001)在他的论文“ Greedy函数逼近:梯度提升机”中首次提出的。然后,Ridgeway实施了Friedman在2006年的软件包“广义增强回归模型”(GBM)中描述的过程。在我的领域(生态学)中,Elith等人。(2008)是第一个证明Ridgeway gbm进行物种分布建模的软件包。但是,Elith等的作者。使用术语“增强的回归树”(BRT)来描述Friedman和Ridgeway' 我对这些术语是否可以互换使用感到困惑?令人困惑的是,一个作者使用相同的首字母缩写词(来自不同的短语)来描述先前作者提出的相同理论。同样令人困惑的是,第三作者在用生态学术语描述这一理论时使用了一个完全不同的术语。 我能想到的最好的是BRT是GBM的一种特定形式,其中的分布是二项式的,但是我不确定。 Elith等。像这样定义增强的回归树…“增强的回归树结合了两种算法的优势:回归树(通过递归二进制分裂将响应与其预测变量联系起来的模型)和增强(将多种简单模型组合在一起以提供改进的预测性能的自适应方法)最终的BRT模型可以理解为加性回归模型,其中单个术语是简单的树,以向前,逐步的方式拟合”(Elith等,2008)。

1
给定两条吸收性马尔可夫链,一个先于另一个终止的概率是多少?
我有两个不同的马尔可夫链,每个链都有一个吸收状态和一个已知的起始位置。我想确定链1以比链2更少的步骤达到吸收状态的可能性。 我认为我可以计算出n步后在特定链中达到吸收状态的概率:给定过渡矩阵,步后被吸收的概率为P ^ n_ {ij},其中i是起始状态,j是吸收状态。PPPnnnPnijPijnP^n_{ij}iiijjj 我不确定从这里到哪里。我见过的类似问题涉及骰子(例如,将7的总和之前滚动为8),但这更容易解决,因为滚动特定总和的概率是恒定的,并且与到目前为止所采取的步骤数无关。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.