统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
重复测量随时间的小
我获得了用于分析研究的数据,以研究在四个不同时间点(治疗前,治疗结束的当天,治疗后4周和治疗后2-4个月)铁水平的影响。没有对照组。他们正在寻找在三个治疗后时间点的铁水平是否显着增加到治疗前(基线)水平的铁水平。11名患者具有基线水平,但只有8名患者具有所有4个时间点的完整数据(每个时间点 = 11、10、9和8)。不仅测量了铁水平,而且还在每个时间点采取了其他两个实验室测量值以与基线进行比较。ññn 关于如何分析,我有几个问题。我最初认为RM方差分析适用于分析此数据,但我担心样本量小,数据丢失以及数据的非正态分布。然后,我考虑使用Wilcoxon符号秩检验将每个后处理量度与基线进行比较,但随后遇到了多个比较的问题。但是,我读了一些文献,淡化了需要进行多次比较的情况。因此,总的来说,我正在处理小样本量,不完整的数据和多次比较(以及是否必要)。 我希望这一切都是有道理的。我是CrossValidated的新手,它是由同事在这里指导的,可以作为向经验丰富的统计学家学习的地方,因此,我感谢任何建议!谢谢! 编辑以添加来自注释的原始数据: 总共有四个时间点,结果变量是连续的。例如,每个时间点的结果类似于以下内容: Baseline (n=11): [2, 7, 7, 3, 6, 3, 2, 4, 4, 3, 14] 1st Post (n=10): [167, 200, 45, 132, ., 245, 199, 177, 134, 298, 111] 2nd Post (n=9): [75, 43, 23, 98, 87, ., 300, ., 118, 202, 156] 3rd Post …



1
什么时候需要在回归模型中包括因变量的滞后,哪个滞后?
我们要用作因变量的数据如下所示(它是计数数据)。我们担心,由于它具有周期性成分和趋势结构,因此回归会以某种方式出现偏差。 如果有帮助,我们将使用负二项式回归。数据是一个平衡面板,每个人(状态)一个虚拟。所示图像显示了所有状态的因变量之和,但仅大多数状态具有类似的行为。我们正在考虑一种固定效应模型。因变量之间的相关性不是很高,研究的一部分是在这些变量之间找到一个意料之外的关系,因此弱关系实际上是件好事。 不包括因变量的滞后变量的确切风险是什么? 如果需要包括一个,是否有测试可以知道哪个。 正在R中执行。 注意:我确实阅读了这篇文章,但对我们的问题没有帮助。

2
为什么不使用梯度下降优化k均值?
我知道k-均值通常使用优化的期望最大化。但是,我们可以像优化其他任何函数一样优化其损失函数! 我发现一些论文实际上对大型k均值使用随机梯度下降法,但是我的问题无法得到解答。 那么,有人知道为什么吗?是因为期望最大化收敛得更快了吗?是否有任何特别的保证吗?还是历史原因?

1
Beta安装在Scipy中
根据维基百科,β概率分布具有两个形状参数:和β。αα\alphaββ\beta 当我打电话scipy.stats.beta.fit(x)在Python,其中x是在范围内的一串数字,则返回4个值。这让我感到奇怪。[0,1][0,1][0,1] 谷歌搜索后,我发现返回值之一必须是“位置”,因为如果我调用,第三个变量为0 scipy.stats.beta.fit(x, floc=0)。 有谁知道第四个变量是什么,并且前两个变量是和β吗?αα\alphaββ\beta

2
如何将数值数据分组为自然形成的“括号”?(例如收入)
以下内容描述了我要完成的工作,但是有可能使用其他问题说明来描述我的目标: 我想要 将以下数字分为几组,其中每组中数字的方差不会太大,并且各组平均值之间的差异也不会太小 将最终获得的分布与“完美”分布进行比较,并观察其与完美度有何“不同”。 莱曼对目标的解释 我正在尝试计算收入分配,并确定每个人口所在的“收入等级”。收入等级应该根据输入数据进行自我调整。 我的目标是最终衡量或计算收入等级之间的差异。我假设会有很多括号,并希望了解每个层之间的“距离”。 这是一个人口总数为20,总收入为3587的样本集的每小时收入样本: Population= 10 pop=2 population=5 population =3 10, 11,13,14,14,14,14,14,15,20, 40,50 ,90,91,92,93,94 999,999,900 我如何使用数学概念对数据进行分组,分类和分析,这些数据的作用类似于给定人口的收入分配? 在计算的最后,我要确定收入的分层分配,在这种情况下,理想的分配看起来像这样 (each person makes $10 more per hour than the previous; total is 3587) 89, 99, 109, 119, 129, 139, 149, 159, 169, 179, 189, 199, 209, 219, 229, 239, …

1
在指数平滑模型中处理丢失的数据
在指数平滑模型家族的背景下,似乎没有一种标准的方法来处理丢失的数据。特别是,在预测包中称为ets的R实现似乎只占用了最长的子序列,而没有丢失数据,Hyndman等人的《带指数平滑的预测》一书也是如此。似乎根本没有谈论丢失数据。 如果我的用户明确要求我(并且丢失的数据不会出现得太近或出现的时间间隔恰好相隔一个季节),我想做更多的事情。特别要注意的是以下几点。在模拟过程中,每当我会遇到一个丢失值,我将替代当前点预报〜ý吨为ÿ 吨,使得ε 吨 = 0。例如,这将使数据点在参数优化过程中不被考虑。ÿŤÿŤy_tÿ〜Ťÿ〜Ť\tilde y_tÿŤÿŤy_tεŤ= 0εŤ=0\varepsilon_t = 0 一旦我对参数有合理的拟合度,就可以估计误差的标准偏差(假设是平均值为),并验证使用从该分布生成的ϵ t值不会将可能性大幅度降低。我也将这些值用于预测(使用模拟)。000ϵŤϵŤ\epsilon_t 此方法是否存在已知的陷阱?

4
在公共卫生政策研究中哪些案例研究滥用了不可靠/混杂/无效的研究或模型?
我正在起草有关当前混淆数据的当前公共卫生问题的文献综述: 在公共卫生/流行病学教育中使用哪些常见的历史案例研究,而在公共卫生政策和立法中有意或错误地使用了无效或混杂的关系或推论? 1960年代的汽车死亡人数激增以及随后由政府主导的基于证据的研究,该研究确定了安全带并最终要求安全气囊是法律所必需的,这是HOW公共卫生政策应由统计学上有效的推论和模型所驱动的一个很好的例子。 我更多地在寻找相反类型的案例(科学性很差,匆忙制定政策)。但是,如果没有别的什么,我想学习更多类似于先前为成功实现公共卫生利益而进行的有力研究的案例的案例。 我想以这些为例来说明基于证据的统计公共卫生研究对制定政策的重要性。

1
R中的非线性混合效应回归
令人惊讶的是,我无法使用Google找到以下问题的答案: 我有一些个体的生物学数据,这些数据显示了乙状结肠的及时生长行为。因此,我希望使用标准的物流增长对其进行建模 P(t) = k*p0*exp(r*t) / (k+p0*(exp(r*t)-1)) 其中p0是t = 0处的起始值,k是t-> infinity处的渐近极限,r是生长速度。据我所知,我可以使用nls对此模型轻松地建模(我缺乏理解:为什么我不能通过缩放时间和数据来使用标准logit回归建模类似的东西?感谢:Nick,显然人们这样做了,例如比例,但很少见http://www.stata-journal.com/article.html?article=st0147。关于此切线的下一个问题是模型是否可以处理> 1的离群值。 现在,我希望允许对三个参数k,p0和r进行固定(主要是分类)和随机(单个ID,还可能是研究ID)影响。nlme是这样做的最好方法吗?SSlogis模型对于我想做的事情似乎很明智,这是正确的吗?以下任一个是明智的模型吗?我似乎无法正确设置起始值,并且update()仅适用于随机效果,而不适用于固定效果-有任何提示吗? nlme(y ~ k*p0*exp(r*t) / (k+p0*(exp(r*t)-1)), ## not working at all (bad numerical properties?) data = data, fixed = k + p0 + r ~ var1 + var2, random = k + p0 + r ~ 1|UID, start …

1
中位数无偏估计量是否会使平均绝对偏差最小化?
这是一个后续的也是不同的问题,我以前的一个。 我在Wikipedia上读到,“ 拉普拉斯(Laplace)观察到,中值无偏估计器使绝对偏差损失函数的风险最小化。” 但是,我的蒙特卡洛模拟结果不支持该论点。 我假定从对数正常人群中,样品,其中,μ和σ是对数平均和对数标准差,β = EXP (μ )= 50X1,X2,...,XN∼LN(μ,σ2)X1,X2,...,XN∼LN(μ,σ2)X_1,X_2,...,X_N \sim \mbox{LN}(\mu,\sigma^2)μμ\muσσ\sigmaβ=exp(μ)=50β=exp⁡(μ)=50\beta = \exp(\mu)=50 几何平均估计量是总体中值的中值无偏估计量,exp(μ)exp⁡(μ)\exp(\mu) ,其中,μ和σ是对数平均和对数标准差,μ和 σ是极大似然估计μ和σ。β^GM=exp(μ^)=exp(∑log(Xi)N)∼LN(μ,σ2/N)β^GM=exp⁡(μ^)=exp⁡(∑log⁡(Xi)N)∼LN(μ,σ2/N)\hat{\beta}_{\mbox{GM}}= \exp(\hat{\mu})= \exp{(\sum\frac{\log(X_i)}{N})} \sim \mbox{LN}(\mu,\sigma^2/N)μμ\muσσ\sigmaμ^μ^\hat\muσ^σ^\hat\sigmaμμ\muσσ\sigma 校正后的几何平均估计量是总体中位数的均值无偏估计量。 β^CG=exp(μ^−σ^2/2N)β^CG=exp⁡(μ^−σ^2/2N)\hat{\beta}_{\mbox{CG}}= \exp(\hat{\mu}-\hat\sigma^2/2N) 我从LN (log (50 ),√)重复生成大小为5的样本。复制号是10,000。对于几何均值估计器,我得到的平均绝对偏差为25.14,对于校正后的几何均值,则为22.92。为什么?(log(50),log(1+22)−−−−−−−−−√)(log⁡(50),log⁡(1+22))(\log(50),\sqrt{\log(1+2^2)}) 顺便说一句,几何平均值的估计中值绝对偏差为18.18,校正几何平均值估计器为18.58。 我使用的R脚本在这里: #```{r stackexchange} #' Calculate the geomean to estimate the lognormal median. #' #' This function Calculate the geomean to estimate …

3
生成均匀分布和相关的随机数对
我想生成一对具有一定相关性的随机数。但是,使用两个正态变量的线性组合的常用方法在这里无效,因为均匀变量的线性组合不再是均匀分布的变量。我需要两个变量要统一。 关于如何生成具有给定相关性的统一变量对的任何想法?

4
MCMC的实际示例
我正在听一些与MCMC有关的讲座。但是,我找不到如何使用它的好例子。谁能给我一个具体的例子。我所看到的是它们运行着一个马尔可夫链,并说其平稳分布是所需的分布。 我想要一个很好的例子,其中难以从中获取所需的分布。因此,我们创建了一个马尔可夫链。我想知道如何选择过渡矩阵,以便其马尔可夫链的平稳分布成为目标分布

2
优化:统计中所有邪恶的根源?
我之前听过以下表达: “优化是统计中所有邪恶的根源”。 例如,该线程的最高答案是在选择模型时过于激进地进行优化的危险而做出该声明。 我的第一个问题是:这句话是否特别应归于任何人?(例如,在统计资料中) 据我了解,该声明涉及过拟合的风险。传统观点认为适当的交叉验证已经可以解决这个问题,但是看起来这个问题还不止于此。 即使遵循严格的交叉验证协议(例如100个嵌套的10倍CV),统计学家和ML实践者也应该警惕过度优化模型吗?如果是这样,我们如何知道何时停止搜索“最佳”模型?

1
这是分析R中带有lme4的混合效果模型的可接受方法吗?
我有一个不平衡的重复测量数据集来进行分析,并且我已经读到大多数统计软件包使用ANOVA(即III型平方和)处理此问题的方式是错误的。因此,我想使用混合效应模型来分析这些数据。我已经在中阅读了很多有关混合模型的信息R,但是对于R混合效应模型我还是很陌生,对自己做的事情不是很自信。请注意,我还不能完全脱离“传统”方法,仍然需要和事后检验。ppp 我想知道以下方法是否有意义,或者我做错了什么。这是我的代码: # load packages library(lme4) library(languageR) library(LMERConvenienceFunctions) library(coda) library(pbkrtest) # import data my.data <- read.csv("data.csv") # create separate data frames for each DV & remove NAs region.data <- na.omit(data.frame(time=my.data$time, subject=my.data$subject, dv=my.data$dv1)) # output summary of data data.summary <- summary(region.data) # fit model # "time" is a factor with three …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.