统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
为什么在嵌套的var-covar模型中进行选择时必须使用REML(而不是ML)?
关于线性混合模型随机效应的模型选择的各种描述指示使用REML。我在某种程度上知道REML和ML之间的区别,但是我不明白为什么要使用REML,因为ML有偏见。例如,使用ML对正态分布模型的方差参数进行LRT是否错误(请参见下面的代码)?我不明白为什么在模型选择中,没有偏见比成为ML更重要。我认为最终的答案必须是“因为REML的模型选择比ML的模型选择更好”,但我想知道的更多。我没有阅读LRT和AIC的派生词(我不足以全面了解它们),但是如果在派生词中明确使用REML,只是知道实际上就足够了(例如, n <- 100 a <- 10 b <- 1 alpha <- 5 beta <- 1 x <- runif(n,0,10) y <- rnorm(n,a+b*x,alpha+beta*x) loglik1 <- function(p,x,y){ a <- p[1] b <- p[2] alpha <- p[3] -sum(dnorm(y,a+b*x,alpha,log=T)) } loglik2 <- function(p,x,y){ a <- p[1] b <- p[2] alpha <- p[3] beta <- …

3
贝叶斯参数估计中如何选择先验
我知道3种进行参数估计的方法,即ML,MAP和贝叶斯方法。对于MAP和Bayes方法,我们需要先验参数,对吗? 假设我有这个模型,其中是参数,为了使用MAP或Bayes进行估计,我在书中读到我们最好选择一个共轭先前的,这是的联合概率,对吧?p(x|α,β)p(x|α,β)p(x|\alpha,\beta)α,βα,β\alpha,\betap(α,β)p(α,β)p(\alpha,\beta)α,βα,β\alpha,\beta 我有两个问题: 除了这个共轭数之外,我们还有其他选择吗? 除了将它们组合在一起,我们是否可以像和一样分别为和选择先验?αα\alphaββ\betap(α)p(α)p(\alpha)p(β)p(β)p(\beta)


1
线性回归的最小点数
用线性回归寻找随时间变化趋势的“合理”最少观察数是什么?拟合二次模型怎么样? 我使用卫生方面的不平等综合指数(SII,RII)进行调查,只有四次调查,因此有4分(1997、2001、2004、2008)。 我不是统计学家,但我有直观的印象4分还不够。您有答案和/或参考资料吗? 非常感谢, 弗朗索瓦
16 regression 

2
有什么技术可以对两个相关的随机变量进行采样?
有什么技术可以对两个相关的随机变量进行采样: 如果其概率分布已参数化(例如,对数正态) 如果它们具有非参数分布。 数据是两个时间序列,可以为它们计算非零相关系数。假设历史相关性和时间序列CDF不变,我们希望将来模拟这些数据。 对于情况(2),一维类似物将用于构建CDF并从中采样。所以我想我可以构造一个二维CDF并做同样的事情。但是,我想知道是否有一种方法可以通过使用单个的一维CDF并以某种方式链接这些选项。 谢谢!

2
如何在R中为逻辑回归模型绘制决策边界?
我在R中使用glm建立了逻辑回归模型。我有两个自变量。如何在两个变量的散点图中绘制模型的决策边界。例如,如何绘制像这样的图:http : //onlinecourses.science.psu.edu/stat557/node/55 谢谢。
16 r  logistic 

3
`predict.randomForest`如何估计类概率?
randomForest使用时,包装如何估计班级概率predict(model, data, type = "prob")? 我当时使用参数来预测概率ranger来训练随机森林probability = T。ranger在文档中说: 与Malley等人一样,种植概率森林。(2012)。 我模拟了一些数据并尝试了两个软件包,并获得了截然不同的结果(请参见下面的代码) 因此,我知道它使用另一种技术(然后是游侠)来估计概率。但是哪一个呢? simulate_data <- function(n){ X <- data.frame(matrix(runif(n*10), ncol = 10)) Y <- data.frame(Y = rbinom(n, size = 1, prob = apply(X, 1, sum) %>% pnorm(mean = 5) ) %>% as.factor() ) dplyr::bind_cols(X, Y) } treino <- simulate_data(10000) teste <- simulate_data(10000) …

1
lmer模型使用哪种多重比较方法:lsmeans或glht?
我正在使用具有一个固定效果(条件)和两个随机效果(由于主题设计和配对而导致的参与者)的混合效果模型分析数据集。该模型是使用lme4包生成的exp.model<-lmer(outcome~condition+(1|participant)+(1|pair),data=exp)。 接下来,我针对没有固定效果(条件)的模型对该模型进行了似然比检验,结果有显着差异。我的数据集中有3个条件,因此我想进行多重比较,但不确定使用哪种方法。我在CrossValidated和其他论坛上发现了许多类似的问题,但我仍然很困惑。 据我所见,人们建议使用 1.该lsmeans包- lsmeans(exp.model,pairwise~condition)这给了我下面的输出: condition lsmean SE df lower.CL upper.CL Condition1 0.6538060 0.03272705 47.98 0.5880030 0.7196089 Condition2 0.7027413 0.03272705 47.98 0.6369384 0.7685443 Condition3 0.7580522 0.03272705 47.98 0.6922493 0.8238552 Confidence level used: 0.95 $contrasts contrast estimate SE df t.ratio p.value Condition1 - Condition2 -0.04893538 0.03813262 62.07 -1.283 0.4099 Condition1 - …

3
statsmodel OLS和scikit线性回归之间的差异
我有一个关于来自不同库的两种不同方法的问题,这些方法似乎做同样的工作。我正在尝试建立线性回归模型。 这是我将statsmodel库与OLS一起使用的代码: X_train, X_test, y_train, y_test = cross_validation.train_test_split(x, y, test_size=0.3, random_state=1) x_train = sm.add_constant(X_train) model = sm.OLS(y_train, x_train) results = model.fit() print "GFT + Wiki / GT R-squared", results.rsquared 打印输出GFT + Wiki / GT R平方0.981434611923 第二个是scikit学习库线性模型方法: model = LinearRegression() model.fit(X_train, y_train) predictions = model.predict(X_test) print 'GFT + Wiki / GT …


3
在混合效果模型中,什么时候我不应该*允许固定效果随随机效果的水平而变化?
给定一个预测变量(P),一个随机效应(R)和一个固定效应(F),就可以拟合两个*混合效应模型(lme4语法): m1 = lmer( P ~ (1|R) + F ) m2 = lmer( P ~ (1+F|R) + F) 据我了解,第二种模型是允许固定效应随随机效应的水平而变化的模型。 在我的研究中,我通常采用混合效应模型来分析来自多个人类参与者的实验数据。我将参与者建模为随机效应,将实验操作建模为固定效应。我认为先验的是让固定效果影响实验性能的程度因参与者而异。但是,我很难想象在什么情况下我不应该也不应该让固定效果随随机效果的水平而变化,所以我的问题是: 一个当应该不是允许固定效应跨越的随机效应水平变化?

2
为什么L2范数损失有唯一的解决方案,而L1范数损失可能有多个解决方案?
http://www.chioka.in/differences-between-l1-and-l2-as-loss-function-and-regularization/ 如果您查看这篇文章的顶部,那么作者会提到L2规范具有唯一的解决方案,而L1规范可能具有很多解决方案。我从正则化的角度理解了这一点,但从在损失函数中使用L1范数或L2范数的角度理解。 如果查看标量x(x ^ 2和| x |)的函数图,则可以很容易地看到两者都有一个唯一的解决方案。

5
Yolo损失函数说明
我试图了解Yolo v2损失函数: λcoord∑i=0S2∑j=0B1objij[(xi−x^i)2+(yi−y^i)2]+λcoord∑i=0S2∑j=0B1objij[(wi−−√−w^i−−√)2+(hi−−√−h^i−−√)2]+∑i=0S2∑j=0B1objij(Ci−C^i)2+λnoobj∑i=0S2∑j=0B1noobjij(Ci−C^i)2+∑i=0S21obji∑c∈classes(pi(c)−p^i(c))2λcoord∑i=0S2∑j=0B1ijobj[(xi−x^i)2+(yi−y^i)2]+λcoord∑i=0S2∑j=0B1ijobj[(wi−w^i)2+(hi−h^i)2]+∑i=0S2∑j=0B1ijobj(Ci−C^i)2+λnoobj∑i=0S2∑j=0B1ijnoobj(Ci−C^i)2+∑i=0S21iobj∑c∈classes(pi(c)−p^i(c))2\begin{align} &\lambda_{coord} \sum_{i=0}^{S^2}\sum_{j=0}^B \mathbb{1}_{ij}^{obj}[(x_i-\hat{x}_i)^2 + (y_i-\hat{y}_i)^2 ] \\&+ \lambda_{coord} \sum_{i=0}^{S^2}\sum_{j=0}^B \mathbb{1}_{ij}^{obj}[(\sqrt{w_i}-\sqrt{\hat{w}_i})^2 +(\sqrt{h_i}-\sqrt{\hat{h}_i})^2 ]\\ &+ \sum_{i=0}^{S^2}\sum_{j=0}^B \mathbb{1}_{ij}^{obj}(C_i - \hat{C}_i)^2 + \lambda_{noobj}\sum_{i=0}^{S^2}\sum_{j=0}^B \mathbb{1}_{ij}^{noobj}(C_i - \hat{C}_i)^2 \\ &+ \sum_{i=0}^{S^2} \mathbb{1}_{i}^{obj}\sum_{c \in classes}(p_i(c) - \hat{p}_i(c))^2 \\ \end{align} 如果有人可以详细说明功能。



By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.