统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


2
使用负二项式回归时,R等于聚类选项
我正在尝试复制同事的工作,并将分析从Stata转移到R。她使用的模型调用nbreg函数中的“ cluster”选项来聚类标准错误。 有关此选项的内容和原因的完整说明,请参见http://repec.org/usug2007/crse.pdf。 我的问题是如何在R中为负二项式回归调用相同的选项? 我们在Stata中指定了本文的主要模型,如下所示 xi: nbreg cntpd09 logpop08 pcbnkthft07 pccrunion07 urbanpop pov00 pov002 edu4yr /// black04 hispanic04 respop i.pdpolicy i.maxloan rollover i.region if isser4 != 1, cluster(state) 我已经用 pday<-glm.nb(cntpd09~logpop08+pcbnkthft07+pccrunion07+urbanpop+pov00+pov002+edu4yr+ black04+hispanic04+respop+as.factor(pdpolicy)+as.factor(maxloan)+rollover+ as.factor(region),data=data[which(data$isser4 != 1),]) 这显然缺少聚集错误部分。 是否可以进行精确复制?如果可以,怎么办?如果没有,有什么合理的选择? 谢谢 [编辑]正如评论中所指出的那样,我希望找到一种不会将我带入多级模型领域的解决方案。尽管我的培训使我看到了这些事情应该相关,但是这比我自己独自承担更多的飞跃。因此,我一直在挖掘并找到以下链接:http : //landroni.wordpress.com/2012/06/02/fama-macbeth-and-cluster-robust-by-firm-and-time-standard-errors-in- r / 指向一些相当简单的代码来执行我想要的操作: library(lmtest) pday<-glm.nb(cntpd09~logpop08+pcbnkthft07+pccrunion07+urbanpop+pov00+pov002+edu4yr+ black04+hispanic04+respop+as.factor(pdpolicy)+as.factor(maxloan)+rollover+ as.factor(region),data=data[which(data$isser4 != 1),]) summary(pday) …

1
是否有Pillai迹线和Hotelling-Lawley迹线的推广?
在多元多元回归(向量回归和回归)的设置中,一般假设的四个主要检验(Wilk's Lambda,Pillai-Bartlett,Hotelling-Lawley和Roy's最大根)都取决于矩阵的特征值。,其中和是“解释”和“总计”变异矩阵。高EHË− 1HE−1H E^{-1}HHHËEE 我注意到Pillai和Hotelling-Lawley统计信息都可以表示为 分别表示。我正在寻找一个应用,其中情况下,对于和的总体类似物定义的该迹线的分布是有意义的。(我的工作中存在模错误。)我很好奇,如果通用的样本统计信息存在某种已知的统一性,或者捕获了四个经典测试中的两个或多个的其他通用性。我意识到不等于或κ = 1 ,0 ħ ë κ = 2 κ κ 0 1ψκ= Tr (高[ κ ħ+ E]− 1),ψκ=Tr(H[κH+E]−1),\psi_{\kappa} = \mbox{Tr}\left(H\left[\kappa H + E\right]^{-1}\right),κ = 1 , 0κ=1,0\kappa = 1, 0HHHËEEκ = 2κ=2\kappa = 2κκ\kappaκκ\kappa0001个11,分子在零下不再看起来像卡方,因此中心F逼近似乎值得怀疑,所以也许这是一个死胡同。 我希望对零下(即回归系数的真矩阵全为零)下和替代下的的分布进行一些研究。我对情况特别感兴趣,但是,如果在一般κ情况下有工作,我当然可以使用。ψκψκ\psi_{\kappa}κ = 2κ=2\kappa = 2κκ\kappa

1
样条和非样条项的相互作用是什么意思?
如果我使用lm(y~a*b)R语法将数据拟合为,其中R a是二进制变量且b是数字变量,则a:b交互项是y~bat a= 0和at a= 1的斜率之差。 现在,假设y和之间的关系b是曲线的。如果我现在适合lm(y~a*poly(b,2)),则a:poly(b,2)1是y~b条件的变化在上述水平上的变化a,并且a:poly(b,2)2是y~b^2条件的变化在上水平a。这需要花费一些时间,但是如果这些相互作用系数中的任何一个都明显不同于零,那么我可以说这意味着a不仅影响y峰的垂直位移,而且影响峰的位置以及接近y~b+b^2曲线峰的陡度。 如果我合适lm(y~a*bs(b,df=3))怎么办?我该如何解释a:bs(b,df=3)1,a:bs(b,df=3)2和a:bs(b,df=3)3条件?这些y来自样条线的垂直位移是否可归因于a三个部分的每一个?

3
统计和信息学之间有什么区别?
我们总是说统计只是在处理数据。但是我们也知道,信息学也在从数据分析中获取知识。例如,生物信息学的人们可以完全不用生物统计学。我想知道统计学和信息学之间的本质区别是什么。

1
鼠标(或键盘)点击的模式并预测计算机用户的活动
仅基于鼠标单击的时间模式(单击时间),可以预测计算机用户的活动吗?[ Ť1个,Ť2,Ť3,… ][Ť1个,Ť2,Ť3,…][t_1,t_2,t_3,\ldots] 例如,工作:在Facebook上花费时间,在照片上观看照片,在电脑上玩游戏。 如果他们有更详尽的预测(例如玩《星际争霸》,《反恐精英》和《模拟城市》),那么我也很感兴趣。 虽然(可以说)有人听到有人在玩(由于快速而突然的点击)或正在观看照片(等间隔的点击),但我对此是否还有客观的发现(出版物,博客研究等)感兴趣, 。 编辑: 我同样对键盘单击(不区分正在敲击哪个键)或组合方法(鼠标+键盘)感兴趣。

6
如何评估二元结果分类预测变量集的预测能力?计算概率还是逻辑回归?
我试图确定简单概率是否可以解决我的问题,或者使用(学习)逻辑回归等更复杂的方法是否更好。 此问题中的响应变量是二进制响应(0,1)。我有许多都是分类无序的预测变量。我正在尝试确定预测变量的哪些组合产生最高的1。我需要逻辑回归吗?仅针对分类预测变量的每种组合计算样本集中的比例会有什么好处?

2
正则化
执行正则化的方法有很多- 例如基于,L 1和L 2范数的正则化。根据Friedman Hastie和Tibsharani的说法,最佳正则化器取决于问题:即真正目标函数的性质,所使用的特定基础,信噪比和样本大小。大号0L0L_0大号1个L1L_1大号2L2L_2 是否有任何比较方法和各种正则化方法性能的实证研究?

2
串行相关和具有单位根之间有什么区别?
我可能会混淆时间序列概念和非时间序列概念,但是显示序列相关性的回归模型与显示单位根的模型之间有什么区别? 另外,为什么可以使用Durbin-Watson测试来测试串行相关性,却必须对单元根使用Dickey-Fuller测试呢?(我的教科书说这是因为Durbun Watson检验不能用于包含自变量滞后的模型。)

2
对于三向重复测量方差分析,什么是有效的事后分析?
我已经执行了三向重复测量方差分析;事后分析有效吗? 这是一个完全平衡的设计(2x2x2),其中一个因素具有重复进行内部测量的功能。我知道R中重复测量ANOVA的多变量方法,但是我的第一个直觉是继续进行ANOVA的简单aov()风格: aov.repeated <- aov(DV ~ IV1 * IV2 * Time + Error(Subject/Time), data=data) DV =响应变量 IV1 =自变量1(2个级别,A或B) IV2 =自变量2(2个级别,是或否) IV3 =时间(2级,之前或之后) 主题=主题ID(总共40个主题,每个IV1级别20个:nA = 20,nB = 20) summary(aov.repeated) Error: Subject Df Sum Sq Mean Sq F value Pr(>F) IV1 1 5969 5968.5 4.1302 0.049553 * IV2 1 3445 3445.3 2.3842 …

1
为什么我们不能凭直觉相信自己的直觉?
如果有的话,蒙蒂·霍尔(Monty Hall)问题会变得很明显。甚至伟大的保罗·埃多斯(Paul Erdos)也被这个问题所迷惑。我可能很难回答的问题是,我们对一个答案如此自信而又凭直觉争论却​​又如此错误的可能性是什么?本福德的第一位数字定律和等待时间悖论是其他类似的著名例子。

3
如何使用统计显着性比较两个不同模型的准确性
我正在研究时间序列预测。我有两个数据集和。我有三个预测模型:。使用数据集样本训练所有这些模型,并使用数据集的样本测量其性能。假设性能指标是MSE(或其他任何指标)。在针对数据集进行测量时,这些模型的MSE为和。如何测试一种模型相对于另一种模型的改进具有统计学意义。D1={x1,x2,....xn}D1={x1,x2,....xn}D1=\{x_1, x_2,....x_n\}D2={xn+1,xn+2,xn+3,....,xn+k}D2={xn+1,xn+2,xn+3,....,xn+k}D2=\{x_n+1, x_n+2, x_n+3,...., x_n+k\}M1,M2,M3M1,M2,M3M1, M2, M3D1D1D1D2D2D2D2D2D2MSE1,MSE2,MSE1,MSE2,MSE_1, MSE_2, MSE3MSE3MSE_3 例如,假设,,,并且基于数据集计算这些MSE 的样本总数为2000。如何测试,和有显着差异。如果有人可以帮助我解决这个问题,我将不胜感激。MSE1=200MSE1=200MSE_1=200MSE2=205MSE2=205MSE_2=205MSE3=210MSE3=210MSE_3=210D2D2D2MSE1MSE1MSE_1MSE2MSE2MSE_2MSE3MSE3MSE_3

3
推销先验……用钱!
假设我有 “专家”,我想从中得出一些变量的先验分布。我想用真钱激励他们。这个想法是要得出先验,观察随机变量实现,然后根据他们的先验与证据的匹配程度在专家之间划分一些预定的“钱包”。在最后一部分中,将先验和证据映射到支付向量上有什么建议的方法?X Ñ XķķkXXXññnXXX
10 bayesian  prior 

6
Excel中的四分位数
我对基本统计中通常使用的四分位数的定义感兴趣。我有一本Stat 101类型的书,它只是给出了一个直观的定义。“大约四分之一的数据落在第一个四分位数上或以下...”但是,它给出了一个示例,其中该示例计算了该组数据的Q1,Q2和Q3 5, 7, 9, 10, 11, 13, 14, 15, 16, 17, 18, 18, 20, 21, 37 由于有15条数据,因此选择15作为中位数Q2。然后,它将剩余的数据分为两半,分别为5至14和16至37。它们每个包含7个数据,它们分别将这些集合10和18的中位数分别作为Q1和Q3。这就是我自己计算的方式。 我看了维基百科的文章,它提供了两种方法。一个人同意上述观点,有人说您还可以在两个集合中都包含15个中位数(但是,如果数据点为偶数,则如果中位数是两个中间数的平均值,则不包括在内)。这对我来说很有意义。 但是,然后我检查了Excel以查看Excel如何计算它。我正在使用Excel 2010,它具有3种不同的功能。四分位数在2007年及以前的版本中可用。似乎他们希望您在2010年停止使用此功能,但仍然可用。Quartile.Inc是新的,但据我所知,它与Quartile完全一致。并且,还有Quartile.Exc。我认为最后两个都是2010年的新功能。这次,我只是尝试使用整数1、2、3,...,10。我期望Excel给出5.5的中位数,3的Q1和8的Q3。因为Wikipedia上的两种方法都会给出这些答案,因为中位数是中间两个数字的平均值。Excel给 quartile number, Quartile.Inc, Quartile.Exc 1, 3.25, 2.75 2, 5.5, 5.5 3, 7.75, 8.25 这些都不符合我之前所说的。 Excel帮助文件中的描述为: Quartile.Inc-基于0..1(含0)的百分位值返回数据集的四分位数。 Quartile.Exc-基于0..1(不包括)的百分位值返回数据集的四分位数。 谁能帮助我了解Excel正在使用的此定义?
10 excel  quantiles 

1
具有学生t错误的回归没有用吗?
请参阅编辑。 当您的数据尾巴很重时,进行带有Student-t错误的回归似乎是一件直观的事情。在探索这种可能性时,我遇到了这篇论文: TS的Breusch,JC的Robertson和AH的威尔士(1997年11月1日)。皇帝的新装:对多元t回归模型的评论。Statistica Neerlandica,51,3.)(link,pdf) 该论据认为,在某种意义上,比例参数和自由度参数是无法相互识别的,因此,进行带有t误差的回归不会做超出标准线性回归的任何事情。 Zellner(1976)提出了一种回归模型,其中数据向量(或误差向量)表示为来自多元Student t分布的实现。该模型引起了相当大的关注,因为它似乎扩大了通常的高斯假设,以允许更严重的误差分布。文献中的许多结果表明,在较宽的分布假设下,高斯模型的标准推理程序仍然适用,从而导致了标准方法的鲁棒性。我们证明,尽管从数学上讲这两个模型是不同的,但出于统计推断的目的,它们是无法区分的。多元t模型的经验含义与高斯模型的经验含义完全相同。因此,建议采用更广泛的数据分布表示形式是虚假的,而健壮性的主张则具有误导性。这些结论是从频繁主义者和贝叶斯主义者的角度得出的。 这让我感到惊讶。 我没有数学上的技巧来很好地评估他们的论点,所以我有两个问题:确实,用t误差进行回归通常没有用吗?如果它们有时有用,是我误解了本文还是引起误解?如果它们没有用,这是众所周知的事实吗?还有其他方法可以处理大量拖尾的数据吗? 编辑:仔细阅读第3段和第4节,似乎下面的文章并没有在谈论我作为学生t回归的想法(错误是独立的单变量t分布)。错误是从单一分布中得出的,并且不是独立的。如果我理解正确,那么这种缺乏独立性正是解释为什么您无法独立估计自由度和自由度的原因。 我猜这篇文章提供了一份避免阅读的论文清单。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.