统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
需要算法来计算数据是从正态分布还是对数正态分布采样的相对可能性
假设您有一组值,并且想知道是从高斯(正态)分布中抽样还是从对数正态分布中抽样? 当然,理想情况下,您应该对总体或实验误差的来源有所了解,因此会有更多有用的信息来回答问题。但是在这里,假设我们只有一组数字而没有其他信息。哪个更有可能:是从高斯抽样还是从对数正态分布抽样?可能性更高?我希望的是在两个模型之间进行选择的算法,并希望量化每个模型的相对可能性。

4
人口的任何数量特性是“参数”吗?
我对术语统计和参数之间的区别比较熟悉。我认为统计量是通过将函数应用于样本数据而获得的值。但是,参数的大多数示例都与定义参数分布有关。一个常见的例子是均值和标准差,以参数化正态分布;系数和误差方差,以参数化线性回归。 但是,还有许多其他的人口分布值不是典型值(例如,最小回归,最大值,多元回归中的r平方,0.25分位数,中位数,系数非零的预测变量数量,偏度,数量大于0.3的相关性矩阵中的相关性等)。 因此,我的问题是: 人口的任何数量特性是否应标记为“参数”? 如果是,那为什么呢? 如果否,哪些特征不应标记为参数?它们应贴上什么标签?又为什么呢? 阐述混乱 维基百科有关估算器的文章指出: “估计器”或“点估计”是用于推断统计模型中未知参数值的统计信息(即数据的函数)。 但是我可以将未知值定义为.25分位数,并且可以为该未知数开发一个估算器。即,并非所有种群的定量特性都是以均值和sd为正态分布参数的相同方式作为参数,但是试图估算任何定量种群特性是合理的。

1
通过k倍交叉验证,您是否可以对所有
当执行k倍交叉验证时,我了解到,您可以通过将除一个以外的所有折点都指向该折点并进行预测来获得准确性指标,然后重复此过程次。然后,您可以在所有实例上运行准确度指标(准确度,召回率,正确分类的百分比),这应该与您每次计算它们然后对结果取平均值一样(如果我错了,请纠正我)。ķkk 您想要的最终结果是最终模型。 您是否对获得的模型进行平均以进行预测,最后得出具有通过上述方法获得的准确性指标的模型?ķkk

1
计算随机效应逻辑回归的ICC
我正在以以下形式运行逻辑回归模型: lmer(response~1+(1|site), family=binomial, REML = FALSE) 通常,我会根据截距和残差方差来计算ICC,但是模型摘要不包括残差方差。我该如何计算?

4
与重尾分布相对应的Boxplot吗?
对于近似正态分布的数据,箱形图是快速可视化数据的中值和散布以及任何异常值的好方法。 但是,对于更重尾的分布,很多点显示为离群值,因为离群被定义为不在IQR的固定因子范围内,而对于重尾分布,这种情况当然会更频繁地发生。 那么人们使用什么可视化此类数据呢?还有更适应的东西吗?如果重要的话,我在R上使用ggplot。

3
Fisher的z转换何时合适?
我想使用p值测试样本相关性的显着性,即[Rrr H0:ρ = 0 ,H1个:ρ ≠ 0。H0:ρ=0,H1:ρ≠0.H_0: \rho = 0, \; H_1: \rho \neq 0. 我了解我可以使用Fisher的z变换来计算 žÒ b 小号= n - 3-----√2ln(1 + r1 − r)zobs=n−32ln⁡(1+r1−r)z_{obs}= \displaystyle\frac{\sqrt{n-3}}{2}\ln\left(\displaystyle\frac{1+r}{1-r}\right) 然后通过找到p值 p = 2 P(Z> zÒ b 小号)p=2P(Z>zobs)p = 2P\left(Z>z_{obs}\right) 使用标准正态分布。 我的问题是:要使它适合转换,应将设为多少?显然,ñ必须大于3,我的教科书没有提到任何限制,但对幻灯片29 本演示它说,ň必须大于10.我会考虑数据较大,我会像5 ≤ ñ ≤ 10。ñnnñnnñnn5 ≤ Ñ ≤ 105≤n≤105 \leq n …

2
线性与非线性回归
我有一组值和,它们在理论上呈指数相关:Xxxÿyy ÿ= 一个Xby=axby = ax^b 一种获取系数的方法是在两侧应用自然对数并拟合线性模型: > fit <- lm(log(y)~log(x)) > a <- exp(fit$coefficients[1]) > b <- fit$coefficients[2] 获得此结果的另一种方法是使用非线性回归,给定一组理论上的起始值: > fit <- nls(y~a*x^b, start=c(a=50, b=1.3)) 如果应用第二种算法,我的测试将显示出更好且与理论相关的结果。但是,我想知道每种方法的统计意义和含义。 他们哪个更好?

1
当使用单独的建模/验证集构建回归模型时,“重新分发”验证数据是否合适?
假设我在建模/验证观察之间划分为80/20。我已经将模型拟合到建模数据集,并且对在验证数据集上看到的错误感到满意。在推出模型以对未来观察进行评分之前,是否将验证与建模数据结合起来以获取100%数据的更新参数估计值是否合适?我听说过两种观点: 我执行的验证是对模型结构的验证,即我已应用的一组预测变量和转换。当我可以使用它来更新估算值时,将20%的数据留在表上是没有意义的。 我执行的验证部分是对我在建模数据集上计算出的参数估计值的验证。如果我更新模型拟合度,那么我已经更改了估计值,并且不再具有测试更新模型性能的客观方法。 我一直遵循#1的论点,但最近我听到几个人争论#2。我想看看其他人对此有何看法。您是否在文献中或其他地方看到过有关该主题的精彩讨论?

3
根据另一个结果(例如正态性)选择统计检验
因此,我听说它说,根据另一个统计检验的结果选择一个统计检验不是一个好主意。这对我来说似乎很奇怪。例如,当其他一些测试表明残差不是正态分布时,人们经常选择使用非参数测试。这种方法似乎已被广泛接受,但似乎与本段的第一句话不一致。我只是希望对这个问题进行澄清。

4
倾向得分与面板数据匹配
我有个人的纵向数据集,其中一些人接受了治疗,而其他人则没有。从出生到18岁的所有个体都在样本中,并且治疗发生在该范围内的某个年龄。治疗的年龄可能因病例而异。使用倾向得分匹配,我想将治疗的和对照组的配对成对地匹配到出生年份,这样我就可以追踪从出生到18岁的每一对。总共有大约150个治疗和4000个未治疗的个体。匹配后,想法是使用差异策略来估计治疗效果。 我目前面临的问题是与面板数据进行匹配。我正在使用Stata的psmatch2命令,并且使用倾向得分匹配来匹配家庭和个人特征。通常,面板数据在每个年龄段都会有不同的最佳匹配。例如:如果治疗A,B和C是对照,并且他们都出生于1980年,那么A和B可能在1980年匹配到0岁,而A和C则在1981年匹配到1岁,依此类推。 。另外,A可能与其前几年的自身预处理值匹配。 为了解决这个问题,我取了所有随时间变化的变量的平均值,以便匹配可以识别在样本期间平均而言最相似的个人,并且我针对0至18岁的每个年龄段分别进行匹配。不幸的是,这仍然将不同的控制单元与每个年龄组的每个治疗单元匹配。 如果有人可以指导我找到一种与Stata中的面板数据进行成对匹配的方法,将不胜感激。

1
结构方程式:如何在R lavaan包中指定相互作用效果
我正在使用R lavaan软件包来估计结构方程模型。假设模型由1个具有1个潜伏的内生清单变量和2个清单解释性变量组成: group = {0,1} attitude1 = latent,scale age = respondent's age 然后,所需的lavaan模型不起作用: model <- ' attitude1 =~ att1 + att2 + att3 outcome ~ age*group + attitude1*group' 我的目标是按照线性回归的方法,确定每个变量和组之间的主要作用和相互作用作用。能做到吗?
13 r  interaction  sem  lavaan 

1
面板数据模型中一组内的标准化因变量?
在识别组中对因变量进行标准化是否有意义? 以下工作文件(法律亚马逊地区的森林砍伐放缓;价格或政策?,pdf)使用标准化的因变量来分析巴西总体政策变化对森林砍伐的影响。 标准化按如下方式完成: Ynewit=Yit−Yi¯¯¯¯¯sd(Yit)Yitnew=Yit−Yi¯sd(Yit) Y^{new}_{it} = \frac{Y_{it} - \overline{Y_i}}{sd(Y_{it})} 作者认为,这是为了“考虑市政当局内森林砍伐增量的相对变化”。作者特此使用面板数据的有限元估计(第12页)。新法律出台后的每一年都应包括一个后政策假人。 如果以这种方式标准化因变量,应该如何解释系数? 标准化不是非正统的吗,因为它为群体/市镇随时间变化较小的观测值提供了更高的价值?


3
如何计算R中的varimax旋转主成分?
我对25个变量运行PCA,并使用选择了前7台PC prcomp。 prc <- prcomp(pollutions, center=T, scale=T, retx=T) 然后,我对这些组件进行了varimax旋转。 varimax7 <- varimax(prc$rotation[,1:7]) 现在,我希望使用varimax旋转PCA旋转的数据(因为它不是varimax对象的一部分-仅包含加载矩阵和旋转矩阵)。我读到要做到这一点,您需要将旋转矩阵的转置乘以数据的转置,所以我会这样做: newData <- t(varimax7$rotmat) %*% t(prc$x[,1:7]) 但这没有意义,因为上面转置的矩阵的尺寸分别是和7 × 16933,所以我将只剩下7行矩阵,而不是16933行...有人知道吗?在这里做错了还是我的最后一行应该是什么?之后是否只需要移调回位?7 × 77×77\times 77 × 169337×169337 \times 16933777169331693316933
13 r  pca  factor-rotation 

1
大样本渐近/理论-为什么要关心?
我希望这个问题不会被标记为“过于笼统”,并希望开始进行有益于所有人的讨论。 在统计中,我们花费大量时间来学习大型样本理论。我们对评估我们的估计量的渐近性质非常感兴趣,包括它们是否渐近无偏,渐近有效,它们的渐近分布等。渐近这个词与的假设紧密相关。n→∞n→∞n \rightarrow \infty 但是,实际上,我们总是处理有限的。我的问题是:nnn 1)大样本是什么意思?我们如何区分大样本? 2)当我们说,我们的字面意思是应该去吗?ñ ∞n→∞n→∞n \rightarrow \inftynnn∞∞\infty 例如对于二项分布,大约需要n = 30才能收敛到CLT下的正态分布。我们应该是还是在这种情况下为,是30或更多? Ñ→交通∞∞X¯X¯\bar{X}n→∞n→∞n \rightarrow \infty∞∞\infty 3)假设我们有一个有限的样本,并假设我们了解估计量的渐近行为的所有知识。所以呢?假设我们的估计量是渐近无偏的,那么我们在有限样本中是否对感兴趣​​的参数有一个无偏的估计,或者这意味着如果我们有,那么我们将有一个无偏的估计?n→∞n→∞n \rightarrow \infty 从上面的问题中可以看到,我试图理解“大样本渐近”背后的哲学,并了解我们为什么在乎?我需要对所学的定理有一些直觉。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.