统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
高斯效率是什么意思?
如果有可靠的估计量,高斯效率意味着什么?例如,高斯效率为82%,击穿点为50%。问ñ问ñQ_{_n} 参考文献是:Rousseeuw PJ和Croux,C.(1993)。“中位数绝对偏差的替代方法。” J. American Statistics Assoc。,88,1273-1283

2
如何在线性模型中说明空间协方差?
背景 我有一项实地研究的数据,在该研究中,两个模块中的每个模块有四个处理级别和六个重复项。(4x6x2 = 48个观察值) 街区相距约1英里,街区内有42个2m x 4m地块的网格和1m宽的人行道。我的研究在每个区块中仅使用了24个地块。 我想评估评估空间协方差。 这是一个使用单个块中的数据进行分析的示例,其中不考虑空间协方差。在数据集中,plot图的id是图的ID,图1的中心位于0,0的每个图x的x位置和yy位置。level是处理级别,并且response是响应变量。 layout <- structure(list(plot = c(1L, 3L, 5L, 7L, 8L, 11L, 12L, 15L, 16L, 17L, 18L, 22L, 23L, 26L, 28L, 30L, 31L, 32L, 35L, 36L, 37L, 39L, 40L, 42L), level = c(0L, 10L, 1L, 4L, 10L, 0L, 4L, 10L, 0L, 4L, 0L, …

2
如何总结和比较非线性关系?
我有大约25个湖泊的湖泊沉积物中有机物百分比从0厘米(即沉积物-水界面)下降到9厘米的数据。在每个湖泊中,从每个位置取了2个岩心,所以我对每个湖泊的每个沉积深度进行了2次有机质百分比的重复测量。 我有兴趣比较湖泊在有机质百分比与沉积物深度(即坡度)之间的关系上有何不同。在某些湖泊中,有机质百分比与沉积物深度之间的关系呈线性关系,但在其他情况下,该关系更为复杂(请参见以下示例)。 我最初的想法是将线性关系适当地适合于整个曲线或曲线的子集(如果“主要”是线性的),并且仅比较那些发现显着线性关系的湖泊。但是,我对这种方法不满意,因为它要求消除数据的唯一原因是它们不符合线性模型,并且它忽略了有关有机物百分比与沉积物深度之间关系的潜在有趣信息。 总结和比较不同湖泊的曲线的最佳方法是什么? 谢谢 曲线示例:在所有情况下,y轴是沉积物中有机物的百分比,x轴是沉积物的深度,其中0 =沉积物-水的界面。 一个很好的线性示例: 2个非线性示例: 一个没有明显关系的示例:

3
虚拟变量陷阱问题
我正在运行一个大型OLS回归,其中所有自变量(大约400)都是虚拟变量。如果包括所有变量,则存在完美的多重共线性(虚拟变量陷阱),因此在运行回归之前,我必须忽略其中一个变量。 我的第一个问题是,应该忽略哪个变量?我已经读到,最好忽略许多观测值中存在的变量,而不是仅少数观测值中存在的变量(例如,如果几乎所有观测值都是“男性”或“女性”,而只有少数是“未知” ”,则省略“男性”或“女性”)。这合理吗? 在使用省略的变量进行回归之后,我能够估算出省略的变量的系数值,因为我知道我所有自变量的总体均值应为0。因此,我使用这一事实来移动所有变量的系数值。包含变量,并获得省略变量的估计值。我的下一个问题是,是否可以使用某种类似的技术来估算被忽略变量的系数值的标准误差。因为这样,我必须重新运行回归,省略其他变量(并包括我在第一次回归中省略的变量),以获取最初省略的变量的系数的标准误差估计。 最后,我注意到,我得到的系数估计值(在重新定零附近之后)根据省略的变量而略有不同。从理论上讲,最好进行多个回归,每个回归都忽略一个不同的变量,然后对所有回归的系数估计值求平均?

4
如何获取mgcv中plot.gam中使用的值?
我想找出在mgcv软件包(x, y)中绘图所使用的值。有谁知道我如何提取或计算这些值?plot(b, seWithMean=TRUE) 这是一个例子: library(mgcv) set.seed(0) dat <- gamSim(1, n=400, dist="normal", scale=2) b <- gam(y~s(x0), data=dat) plot(b, seWithMean=TRUE)


6
通过分段线性函数查找数据中的变化点
问候, 我正在进行研究,这将有助于确定观察到的空间的大小以及自从发生大爆炸以来经过的时间。希望您能提供帮助! 我有符合分段线性函数的数据,我要在该函数上执行两个线性回归。斜率和截距在某个点发生变化,我需要(编写一个程序)找到该点。 有什么想法吗?

1
如何应对具有多重回答的调查问题?
我有一个数据集,询问人们是否去过某些地方(例如A,B,C,D),他们可以做出多种选择,然后从他们的鼻子上取一个标本,看他们是否感染了某些疾病。 我需要找出去某个地方被感染的相对风险,我现在只能想到逻辑回归,还有其他建议吗? 谢谢。
10 logistic 

4
给定10D MCMC链,如何确定R中的后验模式?
问题:假设有10维MCMC链,我准备将抽奖矩阵交给您:10个参数(列)的100,000次迭代(行),我如何才能最好地识别后验模式?我特别关注多种模式。 背景:我认为自己是一位精通计算的统计学家,但是当一位同事问我这个问题时,我为自己无法给出一个合理的答案而感到ham愧。主要关注的是可能会出现多种模式,但前提是必须考虑十个维度中的至少八个左右。我的第一个想法是使用核密度估计,但是对R的搜索没有发现对大于3维问题的希望。同事已经提出了十个维度的临时分箱策略并寻求最大值,但我担心的是带宽可能会导致严重的稀疏性问题或缺乏分辨多种模式的分辨率。就是说,我很乐意接受有关自动带宽建议的建议,与10个内核密度估算器的链接或您所知道的其他任何信息。 顾虑: 我们认为该分布可能会偏斜;因此,我们希望确定后验模式,而不是后验方法。 我们担心可能存在几种后验模式。 如果可能的话,我们希望使用基于R的建议。但是,只要不难以实现,任何算法都可以。我想我不希望通过从头开始自动带宽选择来实现Nd内核密度估计器。

5
Ω平方表示R中的作用?
我正在阅读的统计书建议使用Ω平方来衡量实验的效果。我已经使用分割图设计(对象内部和对象间设计的混合)证明了我的对象内部因子具有统计学显着性,p <0.001,F = 17。 现在,我希望看到两者之间的区别有多大...针对R(或python?)的某个地方是否实现了omega平方的实现?痛苦*,我不知道如何用C寻找东西。 谢谢!

1
R中逻辑模型的输出
我正在尝试解释以下类型的物流模型: mdl <- glm(c(suc,fail) ~ fac1 + fac2, data=df, family=binomial) predict(mdl)每个数据点的预期成功几率是否输出?是否有一种简单的方法可以为模型的每个因子级别(而不是所有数据点)列表几率?





By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.