统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
如何在GLMM中加快固定效果的计算?
我正在进行仿真研究,需要从广义线性混合模型(实际上,是固定效果的两个估算值的一个乘积,一个是GLMM,另一个是LMM的乘积)的自举估计。要做好这项研究,每次大约需要进行1000次或1500次引导复制的1000次模拟。这需要在我的计算机上花费大量时间(很多天)。 How can I speed up the computation of these fixed effects? 更具体地讲,我对对象进行了三种方式的重复测量,从而产生了变量X,M和Y,其中X和M是连续的,而Y是二进制的。我们有两个回归方程 其中Y用于底层潜连续可变和误差不会IID。 我们要引导的统计信息是。因此,每个引导复制都需要安装LMM和GLMM。我的R代码是(使用lme4)中号=α0+α1个X+ϵ1个中号=α0+α1个X+ϵ1个M=\alpha_0+\alpha_1X+\epsilon_1 ÿ∗=β0+β1个X+β2中号+ϵ2ÿ∗=β0+β1个X+β2中号+ϵ2Y^*=\beta_0+\beta_1X+\beta_2M+\epsilon_2∗∗^*ÿÿYα1β2α1β2\alpha_1\beta_2 stat=function(dat){ a=fixef(lmer(M~X+(X|person),data=dat))["X"] b=fixef(glmer(Y~X+M+(X+M|person),data=dat,family="binomial"))["M"] return(a*b) } 我意识到如果我将拟合为线性模型,我将获得相同的估算值,这样可以节省一些时间,但是对于,相同的技巧不起作用。α1α1\alpha_1β2β2\beta_2 我是否只需要购买速度更快的计算机?:)
9 r  mixed-model 

2
评估相关意义
我有两个变量,可以计算它们之间的皮尔逊相关性,但是我想知道一些类似于t检验会给我的东西(即有关相关性有多重要的一些概念)。 这样的事情存在吗?

1
最小角度回归使相关性单调递减并受束缚?
我正在尝试解决最小角度回归(LAR)问题。这是一个问题3.23页面上97的黑斯蒂等,统计学习的要素,第2位。ed。(第5次打印)。 考虑所有变量和响应均值为零,标准差为1的回归问题。还假设每个变量与响应具有相同的绝对相关性: 1N|⟨xj,y⟩|=λ,j=1,...,p1N|⟨xj,y⟩|=λ,j=1,...,p \frac{1}{N} | \left \langle \bf{x}_j, \bf{y} \right \rangle | = \lambda, j = 1, ..., p 令为上最小二乘系数,并令为。β^β^\hat{\beta}yy\mathbf{y}XX\mathbf{X}u(α)=αXβ^u(α)=αXβ^\mathbf{u}(\alpha)=\alpha \bf{X} \hat{\beta}α∈[0,1]α∈[0,1]\alpha\in[0,1] 要求我显示 ,我对此有疑问。请注意,这基本上可以说,随着我们向前进,每个与残差的相关性在大小上保持相等。1N|⟨xj,y−u(α)⟩|=(1−α)λ,j=1,...,p1N|⟨xj,y−u(α)⟩|=(1−α)λ,j=1,...,p \frac{1}{N} | \left \langle \bf{x}_j, \bf{y}-u(\alpha) \right \rangle | = (1 - \alpha) \lambda, j = 1, ..., p xjxjx_juuu 我也不知道如何显示相关性等于: λ(α)=(1−α)(1−α)2+α(2−α)N⋅RSS√⋅λλ(α)=(1−α)(1−α)2+α(2−α)N⋅RSS⋅λ\lambda(\alpha) = \frac{(1-\alpha)}{\sqrt{(1-\alpha)^2 + \frac{\alpha …

1
我应该重新整理我的数据吗?
我们有一套生物学样品,价格昂贵。我们对这些样本进行了一系列测试,以生成用于构建预测模型的数据。为此,我们将样本分为训练(70%)和测试(30%)组。我们已经成功创建了一个模型,并将其应用于测试集,以发现性能“未达到最佳”。实验人员现在希望改善生物学测试,以创建更好的模型。假设我们无法获得新的样本,您是否建议我们重新整理样本以创建新的训练和验证集或坚持原来的划分。(我们没有任何迹象表明该部门存在问题)。

2
R:动态更新图表
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 8个月前关闭。 这是一个数据可视化问题。我有一个数据库,其中包含一些不断修改的数据(在线更新)。R中每隔5或10秒更新图表的最佳方法是什么?(无需再次绘制所有内容就可以了)? 红


2
将一组数字强制为高斯钟形曲线
(这与我有关堆栈溢出的编程问题有关:贝尔曲线高斯算法(Python和/或C#)。) 在Answers.com上,我找到了以下简单示例: 求算术平均值(平均值)=>集合中所有值的总和,除以集合中元素的数量 查找集合中所有值的平方和 将(2)的输出除以集合中元素的数量 从(3)的输出中减去均值(1)的平方 取(4)的结果的平方根 示例:设置A = {1,3,4,5,7} (1 + 3 + 4 + 5 + 7)/ 5 = 4 (1 * 1 + 3 * 3 + 4 * 4 + 5 * 5 + 7 * 7)= 1 + 9 + 16 + 25 + 49 …

2
权衡评级系统以支持更多人评价较高的项目,而不是更少人评价较高的项目?
在此先感谢您与我保持联系,我不是任何统计学家,也不知道如何描述我的想象,因此Google在这里没有帮助我... 我正在使用一个Web应用程序中包含一个评分系统。每个用户可以对每个项目准确地评分一次。 我正在想象一个带有4个值的标度:“非常不喜欢”,“不喜欢”,“喜欢”和“非常喜欢”,并且我计划分别分配这些值-5,-2,+ 2和+5 。 现在,如果每个项目的评分都相同,那么我将对这种评分系统感到满意,因为它可以区分出最喜欢和最不喜欢的项目。但是,这些项目的评级不会相同,并且不同照片上的投票数之间的差异可能会非常明显。 在那种情况下,比较两个项目的累积得分意味着具有很多中等评级的旧项目的得分将比票数更少的特殊新项目的得分高得多。 因此,我想到的第一件事就是平均得分...但是现在,如果一个项目的评分只有“ +5”,则其平均得分要高于获得99“ +5”评分的项目和1个“ +2”等级。直观地讲,这并不是商品受欢迎程度的准确表示。 我想这个问题很普遍,你们不需要我用更多示例来困扰它,所以我将在这一点上停下来,并在需要时详细说明。 我的问题是: 这种问题叫什么,解决这个问题的技术是否有术语?我想知道这一点,以便我可以继续阅读。 如果您碰巧知道关于该主题的任何非专业资源,我将非常感谢您提供的链接。 最后,对于任何有关如何有效收集和分析此类数据的建议,我将不胜感激。
9 scales  rating 

1
重复测量中比例样本的大小
我正在尝试帮助科学家针对沙门氏菌微生物的发生设计研究。他想将家禽养殖场的实验性抗菌制剂与氯(漂白剂)进行比较。由于沙门氏菌的本底率会随时间而变化,因此他计划在治疗之前和之后测量家禽含沙门氏菌的百分比。因此,测量值将是实验配方奶粉与氯配方奶粉之前/之后的沙门氏菌百分比之差。 谁能建议如何估算必要的样本量?假设背景率为50%;漂白后为20%;并且我们想检测实验配方是否将速率更改了+/- 10%。谢谢 编辑:我正在苦苦挣扎的是如何纳入背景利率。让我们将它们称为p3和p4,分别是漂白样品和实验样品的“沙门氏菌感染率”。因此,要估计的统计量是差异的差异:实验(之前-之后)-漂白(之前-之后)=(p0-p2)-(p3-p1)。为了在样本量计算中充分考虑“之前”比率p2和p3的采样变化---是否像使用p0(1-p0)+ p1(1-p1)+ p2(1-p2)一样简单+ p3(1-p3)在样本大小方程式中哪里有变化项?令所有样本大小相等,n1 = n2 = n。

2
LOESS时间序列模型的增量学习
我目前正在处理一些时间序列数据,我知道我可以使用LOESS / ARIMA模型。 数据被写入长度为1000的向量(它是一个队列),每15分钟更新一次, 因此,当新数据推入向量时,旧数据将弹出。 我可以在调度程序上重新运行整个模型,例如,每15分钟重新训练一次模型,也就是使用整个1000值来训练LOESS模型,但是它效率很低,因为每次只插入一个值,而另一个999个值则被插入仍与上次相同。 那么如何才能获得更好的性能呢? 非常感谢

4
应用Tobit回归模型的假设是什么?
我对Tobit回归模型的(非常基础的)知识不是我喜欢的,而是来自一堂课。取而代之的是,我通过一些Internet搜索在这里和那里获取了一些信息。我对截断回归的假设的最佳猜测是,它们与普通最小二乘(OLS)假设非常相似。我不知道那是否正确。 因此,我的问题是:执行Tobit回归时应检查哪些假设? 注意: 这个问题的原始形式指的是截断回归,这不是我正在使用或询问的模型。我已经纠正了这个问题。

2
计算数据的ROC曲线
因此,我进行了16次试验,试图使用汉明距离从生物特征中鉴定一个人。我的阈值设置为3.5。我的数据如下,只有试验1为“真阳性”: Trial Hamming Distance 1 0.34 2 0.37 3 0.34 4 0.29 5 0.55 6 0.47 7 0.47 8 0.32 9 0.39 10 0.45 11 0.42 12 0.37 13 0.66 14 0.39 15 0.44 16 0.39 我的困惑是,我真的不确定如何根据此数据制作ROC曲线(FPR与TPR或FAR与FRR)。哪一个都不重要,但是我只是对如何进行计算感到困惑。任何帮助,将不胜感激。
9 mathematical-statistics  roc  classification  cross-validation  pac-learning  r  anova  survival  hazard  machine-learning  data-mining  hypothesis-testing  regression  random-variable  non-independent  normal-distribution  approximation  central-limit-theorem  interpolation  splines  distributions  kernel-smoothing  r  data-visualization  ggplot2  distributions  binomial  random-variable  poisson-distribution  simulation  kalman-filter  regression  lasso  regularization  lme4-nlme  model-selection  aic  r  mcmc  dlm  particle-filter  r  panel-data  multilevel-analysis  model-selection  entropy  graphical-model  r  distributions  quantiles  qq-plot  svm  matlab  regression  lasso  regularization  entropy  inference  r  distributions  dataset  algorithms  matrix-decomposition  regression  modeling  interaction  regularization  expected-value  exponential  gamma-distribution  mcmc  gibbs  probability  self-study  normality-assumption  naive-bayes  bayes-optimal-classifier  standard-deviation  classification  optimization  control-chart  engineering-statistics  regression  lasso  regularization  regression  references  lasso  regularization  elastic-net  r  distributions  aggregation  clustering  algorithms  regression  correlation  modeling  distributions  time-series  standard-deviation  goodness-of-fit  hypothesis-testing  statistical-significance  sample  binary-data  estimation  random-variable  interpolation  distributions  probability  chi-squared  predictor  outliers  regression  modeling  interaction 


3
零频率细胞研究的荟萃分析
我熟悉元分析和元回归技术(使用metaforViechtbauer 的R包),但是最近我偶然发现了一个我不容易解决的问题。假设我们患有一种可能从母亲传播到未出生婴儿的疾病,并且已经对此进行了多次研究。母亲和孩子出生后立即进行了病毒检测。由于未出生的孩子可能无法从母亲那里获得该病毒,因此人们希望交叉列表如下: | neg kid | pos kid mother neg | A | C=0 -----------|---------|-------- mother pos | B | D 显然,使用比值比(OR)会产生错误,因为错误将被1除以0。对于相对风险而言,相同: A /(A + B )0 /(0 + D )A/(A+B)0/(0+D)\frac{A/(A+B)}{0/(0+D)} 现在,研究人员想检验(无意义的)假设,即儿童的感染是否与母亲的感染有关(这似乎非常非常明显)。我正在尝试重新提出假设,并提出有意义的东西,但我找不到真正的东西。 使事情变得复杂的是,一些妈妈消极的孩子实际上是积极的,可能是由于第一周的感染。因此,我只有一些研究,其中C = 0。 任何人都想知道如何按照这种模式对不同研究的数据进行统计总结。与科学论文的链接也非常受欢迎。

2
如何测试线性模型中的斜率是否等于固定值?
假设我们有一个简单的线性回归模型并且想针对一般替代性检验零假设。ž= 一个X+ b YZ=aX+bÿZ = aX + bYH0:a = b =1个2H0:一个=b=1个2H_0: a=b=\frac{1}{2} 我认为可以使用和的估计值,并进一步应用检验来获得附近的置信区间。这个可以吗?一个^一个^\hat{a}小号Ë(一个^)小号Ë(一个^)SE(\hat{a})žžZ1个21个2\frac{1}{2} 另一个问题与此密切相关。假设我们有一个样本并且我们计算了统计信息{ (X1个,ÿ1个,ž1个),... ,(Xñ,ÿñ,žñ)}{(X1个,ÿ1个,ž1个),…,(Xñ,ÿñ,žñ)}\{(x_1,y_1,z_1),\ldots ,(x_n,y_n,z_n) \}χ2χ2\chi^2 ∑我= 1ñ(ž一世-X一世+ÿ一世2)2X一世+ÿ一世2。∑一世=1个ñ(ž一世-X一世+ÿ一世2)2X一世+ÿ一世2。\begin{equation} \sum_{i=1}^n \frac{(z_i-\frac{x_i+y_i}{2})^2}{\frac{x_i+y_i}{2}}. \end{equation} 这些统计量可以用于检验相同的原假设吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.