统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
从混合效应模型(lme4)中提取案例的斜率
我想在混合效果模型中提取每个人的斜率,如下段所述 混合效应模型被用来表征认知摘要测度中各个变化路径的特征,包括年龄,性别和受教育年限等术语作为固定效应(Laird and Ware,1982; Wilson et al。,2000,2002c)。在对年龄,性别和教育程度的影响进行调整后,从混合模型中提取了残差的个体认知下降斜率项。然后将特定于人的调整后的残留斜率用作遗传关联分析的定量结果表型。这些估计值等于个人的斜率与相同年龄,性别和受教育程度的个人的预测斜率之差。 De Jager,PL,Shulman,JM,Chibnik,LB,Keenan,BT,Raj,T.,Wilson,RS等。(2012)。全基因组扫描,寻找影响年龄相关的认知衰退率的常见变异。衰老的神经生物学,33(5),1017.e1-1017.e15。 我已经看过使用该coef函数提取每个人的系数,但是我不确定这是否是正确的方法。 谁能提供一些有关如何执行此操作的建议? #example R code library(lme4) attach(sleepstudy) fml <- lmer(Reaction ~ Days + (Days|Subject), sleepstudy) beta <- coef(fml)$Subject colnames(beta) <- c("Intercept", "Slope") beta summary(beta) summary(fm1)
13 r  mixed-model 

2
使用Nakagawa&Schielzeth(2013)R2glmm方法在混合模型中计算
我一直在阅读有关在混合模型中计算值的信息,在阅读了R-sig常见问题解答之后,该论坛上的其他帖子(我会链接一些但我没有足够的声誉)以及其他一些参考资料,我知道使用在混合模型的上下文中,值很复杂。R2R2R^2R2R2R^2 但是,我最近在下面看到了这两篇论文。尽管这些方法对我来说确实很有希望,但我不是统计学家,因此我想知道其他人是否会对他们提出的方法以及与其他提出的方法进行比较有任何见解。 Nakagawa,Shinichi和Holger Schielzeth。“从广义线性混合效应模型获得R2的通用且简单的方法。” 《生态与进化中的方法》 4.2(2013):133-142。 约翰逊,保罗CD。“将Nakagawa&Schielzeth的R2GLMM扩展到随机斜率模型。” 《生态与进化中的方法》(2014年)。 也可以使用MuMIn包中的r.squaredGLMM函数来实现is方法,该方法提供了对该方法的以下描述。 对于混合效应模型,可以分为两种类型。边际代表用固定因子解释的方差,并定义为: 条件R ^ 2被解释为由固定和随机因素(即整个模型)解释的方差,并根据以下公式计算: R_ {GLMM}(c)^ 2 = \ frac {(σ_f ^ 2 + \ sum(σ_l^ 2))} {(σ_f^ 2 + \ sum(σ_l^ 2)+σ_e^ 2 +σ_d^ 2} 其中σ_f^ 2是固定效应分量的方差,并且\ sum (σ_l^ 2)是所有方差分量(组,个体等)的总和,σ_l^ 2R2R2R^2R2R2R^2RGLMM(m)2=σ2fσ2f+∑(σ2l)+σ2e+σ2dRGLMM(m)2=σf2σf2+∑(σl2)+σe2+σd2R_{GLMM}(m)^2 = \frac{σ_f^2}{σ_f^2 + \sum(σ_l^2) + σ_e^2 + σ_d^2}R2R2R^2RGLMM(c)2=(σ2f+∑(σ2l))(σ2f+∑(σ2l)+σ2e+σ2dRGLMM(c)2=(σf2+∑(σl2))(σf2+∑(σl2)+σe2+σd2R_{GLMM}(c)^2= \frac{(σ_f^2 …

2
通过多元回归捕获季节性以获取每日数据
我有一个季节性很强的产品的每日销售数据。我想在回归模型中捕获季节性。我已经读到,如果您有季度或每月数据,那么在这种情况下,您可以分别创建3和11个虚拟变量-但是我可以处理每日数据吗? 我有三年的每日数据。自变量是价格点,促销标志(是/否)和温度。因变量是该产品的销售额。我不是在寻找时间序列模型,而是在使用多元回归模型。

3
残差自相关与滞后因变量
当对时间序列建模时,有可能(1)对误差项的相关结构进行建模,例如AR(1)过程(2)包括滞后因变量作为解释变量(在右侧) 我了解他们有时是选择(2)的重要理由。 但是,进行(1)或(2)或什至两者都进行的方法学原因是什么?


1
整合经验CDF
我有一个经验分布。我如下计算G(x)G(x)G(x) x <- seq(0, 1000, 0.1) g <- ecdf(var1) G <- g(x) 我表示,即h是pdf,而G是cdf。h(x)=dG/dxh(x)=dG/dxh(x) = dG/dxhhhGGG 我现在想求解一个积分上限的方程(例如),以使x的期望值为k。aaaxxxkkk 即,从积分至b,我应该有∫ X ħ (X )d X = ķ。我想解决b。000bbb∫xh(x)dx=k∫xh(x)dx=k\int xh(x)dx = kbbb 通过部分积分,我可以将等式重写为 ,其中积分是从 0到 b -------(1)bG(b)−∫b0G(x)dx=kbG(b)−∫0bG(x)dx=kbG(b) - \int_0^b G(x)dx = k000bbb 我想我可以如下计算积分 intgrl <- function(b) { z <- seq(0, b, 0.01) G <- g(z) …
13 r  integral  ecdf 

1
了解卡方检验和卡方分布
我试图理解卡方检验背后的逻辑。 卡方测试是。χ2然后比较卡方分布,找出一个p.value以拒绝或不零假设。H0:观测值来自我们用来创建期望值的分布。例如,我们可以测试获得概率是否如我们预期的那样由p给出。所以我们翻转100次,发现ñ^ h和1-ñ^ h。我们希望我们的发现比较预期是什么(100⋅p)。我们也可以使用二项式分布,但这不是问题的重点……问题是:χ2=∑(obs−exp)2expχ2=∑(obs−exp)2exp\chi ^2 = \sum \frac{(obs-exp)^2}{exp}χ2χ2\chi ^2H0H0H_0headpppnHnHn_H Heads1−nH1−nH1-n_H tails100⋅p100⋅p100 \cdot p 您能否解释一下为什么在零假设下遵循卡方分布吗?∑(obs−exp)2exp∑(obs−exp)2exp\sum \frac{(obs-exp)^2}{exp} 关于卡方分布,我所知道的是,度的卡方分布是k平方标准正态分布的总和。kkkkkk

2
在线估计四分位数而不存储观测值
我需要在不存储观测值的情况下,根据大量数据实时计算四分位数(Q1,中位数和Q3)。我首先尝试了P平方算法(Jain / Chlamtac),但对它却不满意(CPU使用量过多,至少对于我的数据集的精度没有把握)。 我现在使用FAME算法(Feldman / Shavitt)动态估算中值,然后尝试推导该算法以计算Q1和Q3: M = Q1 = Q3 = first data value step =step_Q1 = step_Q3 = a small value for each new data : # update median M if M > data: M = M - step elif M < data: M = M + step …

1
如何解释自相关
我已经根据鱼的位置:X(x.ts)和Y(y.ts)在时间序列数据上计算了鱼的运动模式的自相关。 通过使用R,我运行了以下函数并生成了以下图: acf(x.ts,100) acf(y.ts,100) 我的问题是,如何解释这些图?报告任何类型的模式都需要什么信息?我一直在浏览互联网,还没有找到一种有效的解释方式的简洁方法。 另外,您如何确定要使用的正确滞后量?我用了100,但我不确定这是否太多。

4
回归模型,其响应变量是通常发生年度事件的一年中的一天
在这种情况下,我指的是湖泊结冰的那一天。该“冰上”日期每年仅发生一次,但有时根本不发生(如果冬天温暖的话)。因此,在一年中,湖泊可能在第20天(1月20日)结冰,而在另一年,它可能根本不会结冰。 目的是找出冰冻日期的驱动因素。 预测因素将是每年的秋季/冬季气温。年份可能是长期线性趋势的预测指标。 1)整数“一年中的一天”是否是合理的响应变量(如果不是,则是什么?)? 2)如何处理湖泊永不结冰的年份? 编辑: 我不知道这里的礼节是什么,但我认为我会张贴收到的建议的结果。这是论文,开放获取。感谢@pedrofigueira和@cboettig,我对使用的方法获得了很好的反馈。当然,错误是我自己的。

2
您观察到n次投掷k个头。硬币公平吗?
在一次采访中我被问到。有没有“正确”的答案?(n,k)=(400,220)(n,k)=(400,220)(n, k) = (400, 220) 假设抛掷是同性的,正面的概率为。那么,在400次抛掷中头部的分布应该接近于法线(200,10 ^ 2),这样220头部的平均值就会偏离平均值2个标准差。观察到这种结果的可能性(即,在任一方向上均距平均值多2个SD)略小于5%。p=0.5p=0.5p=0.5 面试官告诉我,基本上,“如果我观察到均值> = 2 SD,就会得出结论,其他事情还在继续。我敢打赌这枚硬币是公平的。” 这是合理的-毕竟,这就是大多数假设检验所做的。但这就是故事的结局吗?对于面试官来说,这似乎是“正确”的答案。我要问的是,有些细微差别是否合理。 我忍不住指出,在这种抛硬币的情况下,判定硬币不公平是一个奇怪的结论。我说对吗?我会在下面解释。 首先,我-我也会假设大多数人-对硬币有很深的了解:它们很可能是公平的。当然,这取决于我们所说的公平-一种可能性是将“公平”定义为“具有接近0.5(例如介于0.49和0.51之间)的可能性”。 (你也可以定义“公平”为指的正面的概率正好是0.50,在这种情况下,有一个完全公平的硬币现在似乎相当取消可能。) 您的先验可能不仅取决于您对硬币的一般看法,还取决于上下文。如果您从自己的口袋里掏出硬币,那么您几乎可以肯定这是公平的。如果您的魔术师朋友从他的钱包中拿出硬币,那么您以前的朋友可能会加大双头硬币的重量。 无论如何,要想出一个合理的先验就很容易了:(i)使硬币很可能是公平的;(ii)即使观察了220个头,也使后验非常相似。然后,您会得出结论,尽管观察到结果均值2 SD,但该代币很可能是公平的。 实际上,您还可以构建一些示例,其中在400次抛掷中观察220个头,这会使您的后方对硬币保持更大的重量,例如,如果所有不公平的硬币的正面概率都为。{0,1}{0,1}\{0, 1\} 谁能为我阐明一下? 在写完这个问题之后,我想起了我以前听说过这种大局的情况,这不是林德利的“悖论”吗? Whuber在评论中加入了一个非常有趣的链接:您可以装模,但不能偏向硬币。从第3页: 不能说硬币的正面概率为p,因为硬币可以完全由抛掷的方式确定,除非将硬币抛向空中并快速旋转并抛向空中。无弹跳,在这种情况下,p = 1/2。 太酷了!这以一种有趣的方式与我的问题联系在一起:假设我们知道硬币被“迅速旋转抛向空中,并被弹跳而没有跳动”。那么我们绝对不应该拒绝硬币是公平的假设(这里的“公平”现在意味着“以上述方式抛硬币时,p = 1/2”),因为我们有效地拥有了将所有概率置于硬币是公平的。也许在某种程度上可以证明为什么在观察到220个头之后我不愿意拒绝null。


2
使用BIC估算KMEANS中的k个数
我目前正在尝试为我的玩具数据集(ofc iris(:))计算BIC。我想重现如图所示的结果(图5)。该论文也是我BIC公式的来源。 我对此有2个问题: 符号: ninin_i我 =群集的元素数iii CiCiC_i我 =群集中心坐标iii xjxjx_j我 =分配给群集数据点iii mmm =簇数 1)方程式中定义的方差 (2): ∑i=1ni−m∑j=1ni∥xj−Ci∥2∑i=1ni−m∑j=1ni‖xj−Ci‖2 \sum_i = \frac{1}{n_i-m}\sum_{j=1}^{n_i}\Vert x_j - C_i \Vert^2 据我所知,这是有问题的,并且当簇mmm大于簇中的元素时,方差可能为负。它是否正确? 2)我只是无法使我的代码能够计算出正确的BIC。希望没有错误,但是如果有人可以检查,将不胜感激。整个方程可以在等式中找到。(5)在论文中。我现在正在使用scikit学习所有内容(以证明关键字:P合理)。 from sklearn import cluster from scipy.spatial import distance import sklearn.datasets from sklearn.preprocessing import StandardScaler import matplotlib.pyplot as plt import numpy as np def compute_bic(kmeans,X): """ Computes …

1
寻求对生育逻辑回归的理论理解
我试图理解Firth逻辑回归(在逻辑回归中处理完全/完全或准完全分离的方法),所以我可以用简化的方式向他人解释。有人对Firth估计对MLE所做的修改有模糊的解释吗? 我已尽力阅读Firth(1993),并且我了解到对分数函数进行了更正。我对修正的起源和合理性以及分数函数在MLE中所起的作用不甚了解。 抱歉,这是基本知识。我所阅读的文献似乎需要比我拥有的对MLE的更深刻的理解。

1
使用互信息估计连续变量和分类变量之间的相关性
至于标题,其思想是在MI前后使用互信息来估计连续变量和分类变量之间的“相关性”(定义为“当我知道B时我对A有多少了解”)。稍后,我会告诉您我的想法,但在我建议您阅读CrossValidated上的其他问题/答案之前,因为它包含一些有用的信息。 现在,由于我们无法对分类变量进行积分,因此需要离散化连续变量。在R(这是我进行大多数分析时所用的语言)中,可以很容易地做到这一点。我更喜欢使用该cut函数,因为它也为值取别名,但也可以使用其他选项。问题的关键是,人们必须决定先验可以做任何离散化之前“箱”(离散状态)的数量。 但是,主要问题是另一个问题:MI的范围是0到∞,因为它是未标准化的度量,单位是位。这使得很难将其用作相关系数。这可以通过全局相关系数部分地解决,在这里和之后的GCC是MI的标准版本。GCC定义如下: 参考:该公式摘自AndreiaDionísio,Rui Menezes和Diana Mendes,2010年,《互助信息作为分析股市全球化的非线性工具》。 GCC的范围是0到1,因此可以轻松地用来估计两个变量之间的相关性。问题解决了吧?好吧,有点。因为所有这些过程在很大程度上取决于我们决定在离散化过程中使用的“箱”的数量。这是我的实验结果: 在y轴上有GCC,在x轴上有我决定用于离散化的“ bin”数。这两行指的是我对两个不同(尽管非常相似)的数据集进行的两个不同的分析。 在我看来,一般而言,尤其是GCC的MI用法仍存在争议。但是,这种混乱可能是我一方错误的结果。无论哪种情况,我都很想听听您对此事的看法(此外,您是否可以使用其他方法来估计分类变量和连续变量之间的相关性?)。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.