统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
如何模拟功能数据?
我正在尝试测试各种功能数据分析方法。理想情况下,我想测试关于模拟功能数据的方法。我试图使用一种基于求和高斯噪声(以下代码)的方法来生成模拟FD,但与真实物体相比,所得曲线看起来过于坚固。 我想知道是否有人指向函数/思想以生成更逼真的模拟功能数据。特别地,这些应该是平滑的。我是该领域的新手,欢迎任何建议。 library("MASS") library("caTools") VCM<-function(cont,theta=0.99){ Sigma<-matrix(rep(0,length(cont)^2),nrow=length(cont)) for(i in 1:nrow(Sigma)){ for (j in 1:ncol(Sigma)) Sigma[i,j]<-theta^(abs(cont[i]-cont[j])) } return(Sigma) } t1<-1:120 CVC<-runmean(cumsum(rnorm(length(t1))),k=10) VMC<-VCM(cont=t1,theta=0.99) sig<-runif(ncol(VMC)) VMC<-diag(sig)%*%VMC%*%diag(sig) DTA<-mvrnorm(100,rep(0,ncol(VMC)),VMC) DTA<-sweep(DTA,2,CVC) DTA<-apply(DTA,2,runmean,k=5) matplot(t(DTA),type="l",col=1,lty=1)

2
如何使用测量工具处理天花板效应?
我收集了心理生理数据,这些数据测量了受试者(两组)感知振动的能力。振动探针在皮肤上移动的位置越来越小,被摄对象指示他们何时感到振动。不幸的是,在高频率下,探头只能移动很短的距离,有时探头可以移动的最大距离仍然不足以使对象感知。因此,对于某些对象,我具有准确的阈值,但是对于一些从未感觉到振动的对象,我只是拥有一个我知道其阈值大于的值。有什么办法让我仍然包括这些数据吗?最好的分析方法是什么?

2
给定数据集自动确定概率分布
给定一个数据集: x <- c(4.9958942,5.9730174,9.8642732,11.5609671,10.1178216,6.6279774,9.2441754,9.9419299,13.4710469,6.0601435,8.2095239,7.9456672,12.7039825,7.4197810,9.5928275,8.2267352,2.8314614,11.5653497,6.0828073,11.3926117,10.5403929,14.9751607,11.7647580,8.2867261,10.0291522,7.7132033,6.3337642,14.6066222,11.3436587,11.2717791,10.8818323,8.0320657,6.7354041,9.1871676,13.4381778,7.4353197,8.9210043,10.2010750,11.9442048,11.0081195,4.3369520,13.2562675,15.9945674,8.7528248,14.4948086,14.3577443,6.7438382,9.1434984,15.4599419,13.1424011,7.0481925,7.4823108,10.5743730,6.4166006,11.8225244,8.9388744,10.3698150,10.3965596,13.5226492,16.0069239,6.1139247,11.0838351,9.1659242,7.9896031,10.7282936,14.2666492,13.6478802,10.6248561,15.3834373,11.5096033,14.5806570,10.7648690,5.3407430,7.7535042,7.1942866,9.8867927,12.7413156,10.8127809,8.1726772,8.3965665) ..我想通过参数估计来确定最合适的概率分布(伽玛,贝塔,正态,指数,泊松,卡方等)。我已经知道以下链接上的问题,其中使用R提供了解决方案:https : //stackoverflow.com/questions/2661402/given-a-set-of-random-numbers-drawn-from-a-连续单变量分布-f 建议的最佳解决方案如下: > library(MASS) > fitdistr(x, 't')$loglik #$ > fitdistr(x, 'normal')$loglik #$ > fitdistr(x, 'logistic')$loglik #$ > fitdistr(x, 'weibull')$loglik #$ > fitdistr(x, 'gamma')$loglik #$ > fitdistr(x, 'lognormal')$loglik #$ > fitdistr(x, 'exponential')$loglik #$ 并选择具有最小loglik值的分布。但是,其他干扰(例如beta分布)需要在fitdistr()函数中指定一些附加参数: fitdistr(x, 'beta', list(shape1 = some value, shape2= some value)). 鉴于我正在尝试在没有任何先验信息的情况下确定最佳分布,因此我不知道每种分布的参数值可能是多少。是否有另一种解决方案考虑了这一要求?它不必在R中。

1
如何使用Rjags生成预测?
我已经使用rjags在以JAGS语言指定的模型上运行MCMC。是否有一个很好的方法可以提取该模型并对其进行预测(使用我的参数的后验分布)?我可以在R中重新指定模型,并插入参数后代的模式;我只是想知道是否有较少的冗余方法。 我相信http://sourceforge.net/p/mcmc-jags/discussion/610037/thread/0ecab41c在问同样的问题。
12 r  jags 

3
确定繁重的分布式过程是否已显着改善
我观察更改前后的流程处理时间,以了解流程是否因更改而有所改善。如果减少了处理时间,则过程得到了改善。处理时间的分布非常复杂,因此基于平均值进行比较是不明智的。相反,我想知道更改后观察到较短处理时间的可能性是否明显高于50%。 令为更改后处理时间的随机变量,而为更改前的处理时间。如果P(X &lt;Y)显着高于0.5,那么我想说这个过程已经改善了。ÿXXXÿYY0.5P(X&lt; Y)P(X&lt;Y)P(X < Y)0.50.50.5 现在我有ñnn观察X一世xix_i的XXX和米mm观测ÿĴyjy_j的ÿYY。P(X &lt;Y)的观测概率为\ hat p = \ frac {1} {nm} \ sum_i \ sum_j 1_ {x_i &lt;y_j}。P(X&lt;Y)P(X&lt;Y)P(X < Y)p^=1nm∑i∑j1xi&lt;yjp^=1nm∑i∑j1xi&lt;yj\hat p = \frac{1}{n m} \sum_i \sum_j 1_{x_i < y_j} 给定观测值x_i和y_j,我能怎么说P(X &lt;Y)?P(X&lt;Y)P(X&lt;Y)P(X < Y)xixix_iyjyjy_j


2
您如何解释相对风险和绝对风险之间的区别?
前几天,我与流行病学家进行了会诊。她是一名拥有流行病学公共卫生学位的医学博士,并且具有大量的统计知识。她指导她的研究员和居民,并帮助他们解决统计问题。她非常了解假设检验。她有一个比较两组的典型问题,以查看与充血性心力衰竭(CHF)相关的风险是否存在差异。她测试了获得CHF的受试者比例的平均差异。p值为0.08。然后,她还决定查看相对风险,得出p值为0.027。因此她问为什么一个重要,而另一个不重要。通过查看差异的95%双向置信区间和比率,她发现平均差异区间包含0,但比率的置信上限小于1。所以为什么我们得出不一致的结果。在技​​术上正确的情况下,我的回答并不令人满意。我说:“这些是不同的统计数据,可以得出不同的结果。p值都在边际有效范围内。这很容易发生。” 我认为必须有更好的方法以外行的方式回答医师问题,以帮助他们了解测试相对风险与绝对风险之间的区别。在Epi研究中,这个问题出现了很多,因为他们经常关注罕见事件,两组的发生率都非常小,样本量不是很大。我已经考虑了一下,并提出了一些想法。但是首先,我想听听你们中的一些人将如何处理这个问题。我知道你们中许多人在医疗领域工作或咨询,可能已经遇到了这个问题。你会怎么做?

1
PROC Mixed和LME / LMER在R自由度上的区别
注意:这个问题是一个转贴,因为我的上一个问题出于法律原因不得不删除。 在比较SAS的PROC MIXED与R中lme的nlme软件包的功能时,我偶然发现了一些相当混乱的差异。更具体地说,不同测试的自由度在PROC MIXED和之间有所不同lme,我想知道为什么。 从以下数据集(以下给出的R代码)开始: ind:指示进行测量的个人的因子 fac:进行测量的器官 trt:表示治疗的因素 y:一些连续响应变量 这个想法是建立以下简单模型: y ~ trt + (ind):ind作为随机因子 y ~ trt + (fac(ind)):fac嵌套在ind作为随机因子 需要注意的是最后一个模型应引起奇异性,因为只有1的值y对每一个组合ind和fac。 第一模型 在SAS中,我建立以下模型: PROC MIXED data=Data; CLASS ind fac trt; MODEL y = trt /s; RANDOM ind /s; run; 根据教程,R中使用的相同模型nlme应为: &gt; require(nlme) &gt; options(contrasts=c(factor="contr.SAS",ordered="contr.poly")) &gt; m2&lt;-lme(y~trt,random=~1|ind,data=Data) 两种模型对系数及其SE均给出相同的估计,但是在对F的影响进行F检验时trt,它们使用的自由度不同: SAS : Type …
12 r  mixed-model  sas  degrees-of-freedom  pdf  unbiased-estimator  distance-functions  functional-data-analysis  hellinger  time-series  outliers  c++  relative-risk  absolute-risk  rare-events  regression  t-test  multiple-regression  survival  teaching  multiple-regression  regression  self-study  t-distribution  machine-learning  recommender-system  self-study  binomial  standard-deviation  data-visualization  r  predictive-models  pearson-r  spearman-rho  r  regression  modeling  r  categorical-data  data-visualization  ggplot2  many-categories  machine-learning  cross-validation  weka  microarray  variance  sampling  monte-carlo  regression  cross-validation  model-selection  feature-selection  elastic-net  distance-functions  information-theory  r  regression  mixed-model  random-effects-model  fixed-effects-model  dataset  data-mining 


5
3个概率分布的Jensen-Shannon发散计算:这样可以吗?
我想根据以下3个分布来计算他的詹森-香农散度。下面的计算是否正确?(我遵循了维基百科的JSD公式): P1 a:1/2 b:1/2 c:0 P2 a:0 b:1/10 c:9/10 P3 a:1/3 b:1/3 c:1/3 All distributions have equal weights, ie 1/3. JSD(P1, P2, P3) = H[(1/6, 1/6, 0) + (0, 1/30, 9/30) + (1/9,1/9,1/9)] - [1/3*H[(1/2,1/2,0)] + 1/3*H[(0,1/10,9/10)] + 1/3*H[(1/3,1/3,1/3)]] JSD(P1, P2, P3) = H[(1/6, 1/5, 9/30)] - [0 + 1/3*0.693 …

1
非信息先验的意义是什么?
为什么还要提供非信息性先验?他们不提供有关信息。那为什么要使用它们呢?为什么不仅使用信息先验?例如,假设。那么是的非先验信息吗?θθ\thetaθ∈[0,1]θ∈[0,1] \theta \in [0,1]θ∼U(0,1)θ∼U(0,1)\theta \sim \mathcal{U}(0,1)θθ\theta

1
为什么对
这可能是一个基本问题,但我想知道为什么可以简单地对回归模型中的值求平方以给出一个解释方差图?[RRR 我知道系数可以增强关系的强度,但是我不了解如何简单地平方该值即可说明所解释的方差。[RRR 有什么简单的解释吗? 非常感谢您的帮助!

1
如何在回归模型中选择变量?
传统的变量选择方法是找到对预测新响应贡献最大的变量。最近,我得知了一种替代方法。在确定治疗效果的变量建模中(例如在药物的临床试验中),该变量被定性地相互作用如果在其他条件不变的情况下进行治疗,则该变量的更改会导致最有效治疗的更改。这些变量并不总是有效的预测指标,但对于医师决定个体患者的治疗时可能很重要。莱西·甘特(Lacey Gunter)在其博士论文中开发了一种选择这些定性相互作用变量的方法,而这些变量可能会被基于预测的选择算法所遗漏。最近,我与她合作,将这些方法扩展到其他模型,包括逻辑回归和Cox比例风险回归模型。 我有两个问题: 您如何看待这些新方法的价值? 对于传统方法,您更喜欢哪种方法?诸如AIC,BIC,Mallows Cp,F测试之类的条件,用于逐步,向前和向后输入或删除变量... 有关此问题的第一篇论文发表在Gunter,L.,Zhu,J和Murphy,SA(2009)。定性相互作用的变量选择。统计方法论 doi:10,1016 / j.stamet.2009.05.003。 下一篇论文发表在Gunter,L.,Zhu,J.和Murphy,SA(2011)中。 在控制家庭错误率的同时个性化医学中定性相互作用的变量选择。Journal of Biopharmaceutical Statistics 21,1063-1078。 下一个出现在有关变量选择的特刊上,Gunter,L.,Chernick,MR和Sun,J.(2011)。关于治疗选择的回归变量选择的一种简单方法。巴基斯坦统计与运筹学杂志 7:363-380。 您可以在期刊网站上找到这些论文。您可能必须购买该物品。我可能有这些文章的pdf文件。莱西和我刚刚完成了有关此主题的专着,并将于今年晚些时候作为SpringerBrief出版。

3
为过度分散的计数数据选择Poisson回归的替代方法
我目前正在分析来自一系列行为实验的数据,这些实验均使用以下措施。要求此实验的参与者选择其他人可以用来帮助解决一系列10字谜的(虚拟)线索。参与者被认为这些其他人会赚钱或亏钱,这取决于他们在解决七巧板游戏中的表现。线索在帮助方面有多种。例如,对于字母NUNGRIN(运行)的字母,可能有以下三个线索: 快速行动(无益) 您在马拉松比赛中做什么(有帮助) 并非总是健康的爱好(无益) 为了衡量这一指标,我计算了参与者(为10)选择另一个对他人没有帮助的线索的次数。在实验中,我使用各种不同的操作来影响人们选择的线索的有用性。 因为有帮助/无帮助的度量存在明显的正偏斜(大部分人总是选择10条最有用的线索),并且由于该度量是计数变量,所以我一直在使用Poisson广义线性模型来分析这些数据。但是,当我对Poisson回归进行更多阅读时,我发现由于Poisson回归不能独立估计分布的均值和方差,因此它常常低估了一组数据中的方差。我开始研究泊松回归的替代方法,例如拟泊松回归或负二项式回归。但是,我承认我对这类模型还很陌生,所以我来这里寻求建议。 是否有人建议将哪种模型用于此类数据?我还有其他需要注意的考虑因素(例如,一种特定的模型比另一种模型更强大吗?)?我应该查看哪种诊断方法来确定我选择的模型是否正确处理了我的数据?

3
如何最好地传达不确定性?
在向媒体和公众传达统计计算结果时,一个大问题是我们如何传达不确定性。当然,大多数大众媒体似乎都喜欢一个固定的数字,尽管除了少数情况外,数字总是有一定的不确定性。 因此,作为统计学家(或描述统计工作的科学家),我们如何最好地交流我们的结果,同时保持不确定性不变,并使它对我们的受众有意义? 我意识到这实际上不是统计学问题,而是有关统计学的心理学问题,但这当然是大多数统计学家和科学家都会关注的问题。我在想,好的答案可能比统计教科书更多地参考心理学研究... 编辑:根据user568458的建议,此处进行案例研究可能会很有用。如果可能的话,请保持答案可推广到其他领域。 我感兴趣的一个特殊案例就是一个很好的例子:通过大众媒体将气候科学与政治家和公众进行交流。换句话说,作为科学家,您的工作是将新闻传递给新闻记者,使他们毫不费力地将新闻准确地传递给公众-即事实,尽管不一定是全部事实。通常不会被新闻咬住。 一些特别常见的例子可能是在本世纪余下的时间里对变暖程度的估计中不确定性的传达,或者是在特定极端天气事件的可能性增加时的不确定性的传达(即,响应“气候变化是否引起了这场风暴? “类型问题”。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.