统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
如何获得具有可靠标准误差的ANOVA表?
我正在使用R中的plm包运行汇总的OLS回归。尽管,我的问题更多是关于基本统计信息,所以我尝试首先将其发布在这里;) 由于我的回归结果会产生异方差残差,因此我想尝试使用异方差稳健的标准误差。作为结果,coeftest(mod, vcov.=vcovHC(mod, type="HC0"))我得到了一个表格,其中包含每个独立变量的估计值,标准误差,t值和p值,这些基本上就是我的“稳健”回归结果。 为了讨论不同变量的重要性,我想绘制每个独立变量解释的方差份额,因此我需要相应的平方和。但是,使用function aov(),我不知道如何告诉R使用可靠的标准错误。 现在我的问题是:如何获得表示稳健标准误差的ANOVA表/平方和?是否可以基于具有正常标准误差的回归,基于ANOVA表进行计算? 编辑: 换句话说,无视我的R发行: 如果使用稳健的标准误差不影响R,那么不同解释变量对解释方差的各自贡献也将保持不变吗?22^2 编辑: 在R中,aov(mod)实际上是否为panelmodel(plm)提供了正确的ANOVA表?

2
ARIMA过程的Box-Jenkins方法到底是什么?
在维基百科页面称,箱詹金斯是拟合的ARIMA模型对于时间序列的方法。现在,如果我想将ARIMA模型拟合到一个时间序列,我将打开SAS,调用proc ARIMA,提供参数,SAS会给我AR和MA系数。现在,我可以尝试使用和SAS的不同组合,每种情况下给我一组系数。我选择Akaike信息准则最低的集合。p,d,qp,d,qp,d,qp,d,qp,d,qp,d,q 我的问题是:在上述过程中,我在哪里使用Box-Jenkins?我是否应该使用Box-Jenkins得出初始估计?还是SAS内部使用了它?p,d,qp,d,qp,d,q

1
用mgcv gam进行随机效应预测
我对使用mgcv中的gam来模拟单个船的简单随机效应(在渔业中随时间反复旅行)建模总的鱼获量感兴趣。我有98个科目,所以我想我会使用gam而不是gamm来模拟随机效果。我的模型是: modelGOM <- gam(TotalFish ~ factor(SetYear) + factor(SetMonth) + factor(TimePeriod) + s(SST) + s(VesselID, bs = "re", by = dum) + s(Distance, by = TimePeriod) + offset(log(HooksSet)), data = GOM, family = tw(), method = "REML") 我已经用bs =“ re”和by = dum编码了随机效应(我读到这将使我能够将血管效应预测为其预测值或零)。“ dum”是1的向量。 该模型可以运行,但是我在预测时遇到问题。我选择了其中一个用于预测的容器(Vessel21),并选择了除预测感兴趣的预测变量(距离)以外的所有其他事物的平均值。 data.frame("Distance"=seq(min(GOM$Distance),max(GOM$Distance),length = 100), "SetYear" = '2006', "SetMonth" …

3
统计模型中非线性的标准和决策是什么?
我希望以下一般性问题有意义。请记住,出于特定问题的目的,我对引入非线性的理论(主题领域)原因不感兴趣。因此,我将提出完整的问题如下: 除了理论(学科领域)以外,出于某种原因将非线性引入统计模型的逻辑框架(标准和可能的决策过程)是什么? 与往常一样,也欢迎相关资源和参考。

2
如何可视化百分比以及条目数。
我正在尝试找出可视化下表的最佳方法,并强调与尝试该治疗的患者人数相对应的治疗效果。这是实际页面的链接:http : //curetogether.com/cluster-headaches/treatments/ 在强调疗效的同时,仍然可以轻松比较治疗方案并查看每例有多少患者的最佳方法是什么?我的想法是将有效性显示为百分比,但是我不确定如何使它们易于比较并显示尝试每种方法的患者人数。 谢谢!


1
固有的空间平稳性:它仅适用于小滞后吗?
根据固有平稳性的定义: Ë[ Z(x )− Z(x − h )] = 0E[Z(x)−Z(x−h)]=0E[Z(x)-Z(x-h)] = 0 例如,该假设用于普通克里金法,而不是假设整个空间的均值是恒定的,而是假设均值在局部是恒定的。 如果该平均值在附近是恒定的,则逻辑上我们期望彼此接近的两个度量之间的差异为零。但是随着均值随空间的变化而变化,我们不期望彼此相距遥远的值之差为零吗? 因此,固有平稳性的假设不应该是: Ë[ Z(x )− Z(x− h )] = 0E[Z(x)−Z(x−h)]=0E[Z(x)-Z(x-h)] = 0对于h → 0h→0h \to 0
10 spatial 

1
数据处理错误是否已经“纳入”统计分析?
好的,合理的警告-这是一个不涉及数字的哲学问题。我一直在思考错误将如何随着时间逐渐潜入数据集中,以及分析人员应如何处理这些错误,或者它是否真的很重要? 就背景而言,我正在一项长期研究中进行分析,该研究涉及大约7-8年内可能由25个人收集的许多数据集-没有人将所有数据整合到一个一致的结构中(这是我的职责)。我一直在进行大量数据输入(从旧实验室笔记本的影印本抄录),并且不断发现其他人犯的小抄录错误,并且发现难以或无法读取的数据条目-主要是因为墨水随着时间的流逝而消失。我正在使用上下文对数据的含义做出“最佳猜测”,如果我不太确定,则将数据完全指出。但是我一直在考虑这样一个事实,每次复制数据时,错误的频率不可避免地会增加,直到原始数据完全丢失为止。 因此,这使我想到:除了仪器/测量错误和记录错误之外,还有一个基本的“数据处理错误”组件会随着时间的推移以及对数据的更多处理而增加(注意:这可能是由于这只是说明热力学第二定律的另一种方式,对吗?数据熵将一直增加)。因此,我想知道是否应该引入某种“校正”来说明数据集的寿命历史(类似于Bonferroni校正)?换句话说,我们是否应该假设较旧或复制较多的数据集的准确性较低;如果是,则应相应地调整发现结果吗? 但是,我的另一种想法是错误是数据收集和数据处理的固有部分,并且既然所有统计测试都是使用真实数据开发的,那么这些错误源可能已经被分析所“价”了吗? 另外,值得一提的另一点是,由于数据错误是随机的,因此降低发现强度的可能性远大于改善发现的强度-换句话说,数据处理错误将导致类型2错误,而不是类型1错误。 。因此,在许多情况下,如果您使用的是旧的/有问题的数据并且仍然发现了一种影响,则可以增加您对这种影响是真实存在的信心(因为它足够强大,可以承受向数据集添加随机误差的影响)。因此,出于这个原因,也许“校正”应该采取另一种方式(增加“查找”所需的Alpha水平),还是不给我们带来麻烦? 无论如何,很抱歉如此冗长和晦涩,我不确定如何更简洁地提出这个问题。感谢您的支持。
10 dataset  error 

3
时间序列分析与机器学习?
只是一个普遍的问题。如果您有时间序列数据,那么什么时候使用时间序列技术(aka,ARCH,GARCH等)优于机器/统计学习技术(KNN,回归)呢?如果交叉验证中存在类似的问题,请向我指出-已查找且找不到。

3
R中的glm-哪个pvalue表示整个模型的拟合优度?
我正在R(通用线性模型)中运行glms。我以为我知道pvalues-直到我看到调用glm的摘要不会为您提供代表整个模型的压倒性pvalue-至少不是在线性模型可以做到的地方。 我想知道这是否作为系数表顶部的Intercept的p值给出。因此,在下面的示例中,尽管Wind.speed..knots和canopy_density对模型可能很重要,但是我们如何知道模型本身是否很重要?我如何知道是否信任这些价值观?我是否想知道(Intercept)的Pr(> | z |)代表模型的重要性?这个模特重要吗?谢谢! 我应该注意,运行F检验不会给出pvalue,因为我收到一条错误消息,指出在二项式族上运行F检验是不合适的。 Call: glm(formula = Empetrum_bin ~ Wind.speed..knots. + canopy_density, family = binomial, data = CAIRNGORM) Deviance Residuals: Min 1Q Median 3Q Max -1.2327 -0.7167 -0.4302 -0.1855 2.3194 Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 1.8226 1.2030 1.515 0.1298 Wind.speed..knots. -0.5791 0.2628 -2.203 0.0276 * …

2
创建增长图表的最佳方法
我必须为非负数,连续数和非负数的健康变量创建5至15岁(仅5,6,7等;没有2.6年这样的分数)的图表(类似于生长图表)。 50-150的范围(只有少数几个值不在此范围内)。我必须创建第90、95和99个百分位曲线,并为这些百分位创建表。样本大小约为8000。 我检查并发现以下可能的方法: 找到分位数,然后使用黄土法从这些分位数中获得平滑曲线。可以通过“ span”参数调整平滑度。 使用LMS(Lambda-Mu-Sigma)方法(例如,在R中使用gamlss或VGAM软件包)。 使用分位数回归。 使用每个年龄组的平均值和SD来估算该年龄段的百分位数,并创建百分位数曲线。 最好的方法是什么?“最好”是指理想的方法,它是创建此类增长曲线的标准方法,并且将为所有人所接受。或者是一种更容易实现的方法,它可能会有一些限制,但是是可以接受的,更快的方法。(例如,对百分比值使用黄土比使用gamlss软件包的LMS快得多)。 同样,该方法的基本R代码将是什么。 谢谢你的帮助。

2
为什么因变量中的测量误差不会使结果偏倚?
当自变量存在测量误差时,我知道结果将偏向于0。当因变量测量有误差时,他们说这只会影响标准误差,但这对我来说没有多大意义,因为我们估计的影响不是对原始变量的影响,而是对其他一些加上误差的影响。那么这如何不影响估计呢?在这种情况下,我还可以使用工具变量来消除此问题吗?XXXYYYYYY

4
为什么不对数转换所有不重要的变量呢?
书籍和讨论经常指出,当遇到预测变量的问题(其中有几个)时,有可能对数转换。现在,我知道这取决于预测变量的分布和正态性,并不是回归的假设;但是对数转换确实会使数据更加统一,不受异常值的影响等。 我考虑过对数转换所有不是主要变量的连续变量,即我仅调整的变量。 错了吗 好?无用?



By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.