统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
如何对纵向变量进行聚类?
我有一堆变量,其中包含从第0天到第7天的纵向数据。我正在寻找一种合适的聚类方法,该方法可以将这些纵向变量(而不是案例)聚类为不同的组。我试图按时间分别分析此数据集,但结果很难合理地解释。 我调查了SAS程序的可用性,PROC SIMILARITY因为它的网站上有一个示例。但是,我认为这不是正确的方法。先前的一些研究在每个时间点都使用了探索性因素分析,但是由于结果不合理,在我的研究中也不是一种选择。 希望可以在此处提供一些想法,并且可以使用已编译的程序(例如SAS或R)进行处理。任何建议表示赞赏! 这是一个简短的示例(很抱歉,数据和变量名之间的位置不一致): id time V1 V2 V3 V4 V5 V6 V7 V8 V9 V10 2 0 8 7 3 7 6 6 0 0 5 2 2 1 3 5 2 6 5 5 1 1 4 2 2 2 2 3 2 4 4 2 0 …
10 clustering 

1
那么,如何将贝叶斯估计包括在荟萃分析中呢?
受此问题启发,尤其是“问题3”: 除非提供频度高的参数化描述,否则后验分布很难纳入荟萃分析。 最近,我一直在考虑将荟萃分析合并到贝叶斯模型中(主要是作为先验信息的来源),但是如何朝另一个方向发展呢?如果贝叶斯分析确实确实变得更流行,并且变得非常容易合并到现有代码中(想到SAS 9.2及更高版本中的BAYES语句),我们应该更频繁地从文献中获得贝叶斯效应的估计。 让我们假设一下,有一位应用研究人员决定进行贝叶斯分析。使用与我在该问题上使用的相同的模拟代码,如果它们与常客框架一起使用,则会得到以下常客估计: log relative risk = 1.1009, standard error = 0.0319, log 95% CI = 1.0384, 1.1633 使用标准的,全缺省且无信息的先验BAYES语句分析,没有理由存在良好的对称置信区间或标准误差。在这种情况下,后验很容易用正态分布来描述,因此人们可以这样描述并“足够接近”,但是如果有人报告贝叶斯效应估计和不对称可信区间会怎样?是否有一种简单的方法可以将其包括在标准的荟萃分析中,还是需要将估计值塞入尽可能接近的参数化分布中?或者是其他东西?

1
如何找到崩溃与系统环境之间的关联?
有空时,我正在一个小型的基于Web的系统上工作,该系统收集从Delphi Windows应用程序发送的崩溃报告(但不收集其他非崩溃的错误报告)。 为了进行故障排除,用户希望使用数据挖掘功能来查找硬件或操作系统版本与特定错误和/或崩溃之间的关系。 例如,这应该如何工作: 对于每个崩溃,数据库中都有一个报告,该报告在崩溃时具有堆栈跟踪(调用堆栈)的指纹/哈希码,以识别重复项 该算法检查错误报告的所有重复项是否还具有其他一些常见属性,例如缺少操作系统的服务包 分析结果列出了错误报告共有的所有属性 假设这些自动错误报告包含所有关键信息,例如当前正在运行的所有进程的名称,文件名,已加载的DLL的版本信息等。 如何找到反复崩溃与环境之间的关联?是否有特定的算法或统计方法会有所帮助?

8
给定过去购买的数据,可以使用哪种算法来预测耗材使用情况?
考虑到一个据说简单但有趣的问题,鉴于我以前的购买历史,我想写一些代码来预测我不久将需要的消耗品。我敢肯定,这类问题的定义更为通用且经过深入研究(有人建议这与ERP系统等中的某些概念有关)。 我拥有的数据是以前购买的完整历史记录。假设我正在查看纸张供应,我的数据看起来像(日期,纸张): 2007-05-10 500 2007-11-11 1000 2007-12-18 1000 2008-03-25 500 2008-05-28 2000 2008-10-31 1500 2009-03-20 1500 2009-06-30 1000 2009-09-29 500 2009-12-16 1500 2010-05-31 500 2010-06-30 500 2010-09-30 1500 2011-05-31 1000 它不会定期进行“采样”,因此我认为它不符合时间序列数据的条件。 我每次都没有实际库存水平的数据。我想使用这种简单且有限的数据来预测在(例如)3、6、12个月中需要多少纸张。 到目前为止,我才知道我在寻找什么叫做外推法,而不是更多:) 在这种情况下可以使用什么算法? 如果与先前算法不同,哪种算法还可以利用更多的数据点来提供当前的供电水平(例如,如果我知道在XI的日期还剩Y张纸)? 如果您知道更好的术语,请随时编辑问题,标题和标签。 编辑:对于它的价值,我将尝试在python中进行编码。我知道有很多库可以实现或多或少的任何算法。在这个问题中,我想探索可以使用的概念和技术,并把实际的实现留给读者练习。

2
如何使用Cox模型在R中进行ROC分析
我创建了一些Cox回归模型,我想看看这些模型的性能如何,我认为类似于本文使用的ROC曲线或c统计量可能有用: JN Armitage och JH van der Meulen,“使用行政数据和皇家外科医学院的查尔森评分来鉴定手术患者的合并症”,《英国外科杂志》,第1卷。97,数字 5,ss。772-781,2010年下半年。 阿米蒂奇采用Logistic回归,但我不知道是否有可能使用来自生存包模式,survivalROC给这个是可能的暗示,但我无法弄清楚如何得到这工作与常规Cox回归。 如果有人向我展示如何在此示例中进行ROC分析,我将不胜感激: library(survival) data(veteran) attach(veteran) surv <- Surv(time, status) fit <- coxph(surv ~ trt + age + prior, data=veteran) summary(fit) 如果可能的话,我将感谢原始的c静态输出和一个漂亮的图表 谢谢! 更新资料 非常感谢您的回答。@Dwin:我只是想确保在选择答案之前我已经理解了。 据我理解,根据DWin的建议进行的计算: library(survival) library(rms) data(veteran) fit.cph <- cph(surv ~ trt + age + prior, data=veteran, x=TRUE, y=TRUE, surv=TRUE) …
10 r  survival  roc 

1
进行时间序列预测时的良好做法
我已经进行了几个月的短期负荷预测,并使用气候/天气数据来提高准确性。我具有计算机科学背景,因此,我尝试使用ARIMA模型之类的统计工具避免犯大错和不公平的比较。我想知道您对以下几点的看法: 我同时使用(S)ARIMA和(S)ARIMAX模型来研究天气数据对天气预报的影响,您认为是否还需要使用指数平滑方法? 从头两个星期开始,我有300个每日样本的时间序列,并使用auto.arima R函数(预测软件包)构建的模型进行了提前5天的预测。然后,将另一个样本添加到我的数据集中,然后再次校准模型,然后再进行5天的预测,依此类推,直到可用数据结束。您认为这种操作方式正确吗? 感谢您的建议,尽管我们的工作目标是发表在工程学期刊上的文章,但从统计的角度来看,我想做的尽可能严格。

2
一本既讲理论又讲数学的好书
在我的学年和大学期间,我有足够的统计学课程。我对概念有一定的了解,例如CI,p值,解释统计显着性,多重检验,相关性,简单线性回归(最小二乘法)(通用线性模型)以及所有假设检验。在早期的大部分时间里,我大多是在数学上被介绍给我的。最近,我相信,借助于《直觉生物统计学》一书,我已经掌握了对实际概念理论的前所未有的理解。 现在,我发现我缺乏对拟合模型(估计模型的参数)等的理解。特别是,诸如最大似然估计,广义线性模型,贝叶斯推断统计方法之类的概念对我而言似乎总是陌生的。没有足够的示例或教程或概念上合理的示例,就像人们在简单的概率模型或互联网上的其他(基本)主题中发现的那样。 我是一名生物信息学家,我从事RNA-Seq数据的研究,该数据处理原始读取计数,以便查找基因表达(或差异基因表达)。从我的背景来看,即使我不熟悉统计模型,我也能够掌握泊松分布假设和负二项式等的原因。但是有些论文涉及广义线性模型和估计MLE等。我相信我有必要了解的背景。 我想我要的是你们中的一些专家认为有用的方法,这是一本书,可以帮助我以更直观的方式掌握这些概念(不仅是严格的数学,而且有数学支持的理论)。由于我将主要应用它们,因此(目前)我对了解什么是满意的,以后,我可以返回严格的数学证明...有人有什么建议吗?如果我要求的主题确实分散在一本书中,则我不介意购买多于一本书。 非常感谢你!

2
假设检验和总变异距离与Kullback-Leibler散度的关系
在我的研究中,我遇到了以下一般性问题:在同一个域中有两个分布和,以及来自这些分布的大量(但有限)样本。样本是从这两个分布之一独立且相同地分布的(尽管分布可能是相关的:例如,可能是和其他分布的混合。)零假设是样本来自,替代假设是样本来自。Q Q P P QPPPQQQQQQPPPPPPQQQ 我试图表征I型和测试样品,了解发行第二类错误和。特别是,除了对和的了解之外,我还对限制一个错误和另一个错误感兴趣。Q P QPPPQQQPPPQQQ 我问了一个关于math.SE 的问题,关于和之间的总变异距离与假设检验的关系,并收到了我接受的答案。这个答案是有道理的,但是我仍然无法将总变化距离和假设检验之间更深层的含义笼罩在脑海中,因为这与我的问题有关。因此,我决定转向这个论坛。QPPPQQQ 我的第一个问题是:总变化是否与 I类错误和II类错误的概率之和无关,而与所采用的假设检验方法无关?本质上,只要存在可能由任一分布生成样本的非零概率,至少一个错误的概率就必须为非零。基本上,无论您进行多少信号处理,您都无法避免假设检验器会出错的可能性。而总变化限制了确切的可能性。我的理解正确吗? I型和II型错误与潜在的概率分布和之间还有另一关系:KL散度。因此,我的第二个问题是:KL散度约束是否仅适用于一种特定的假设检验方法(似乎很多涉及对数似然比方法),还是可以将其普遍适用于所有假设检验方法?如果它适用于所有假设检验方法,那么为什么它似乎与总变异范围有很大不同?它的行为是否有所不同?QPPPQQQ 我的基本问题是:在规定的条件下我应该使用约束还是纯粹为了方便起见?什么时候应该使用一个绑定推导结果并使用另一个绑定? 如果这些问题无关紧要,我深表歉意。我是计算机科学家(所以对我来说,这似乎是一个奇特的模式匹配问题:)。)我对信息论非常了解,并且也具有概率论的毕业背景。但是,我才刚刚开始学习所有这些假设检验的知识。如果需要,我将尽力澄清我的问题。

3
如何评估特定非线性模型的拟合优度?[关闭]
很难说出这里的要求。这个问题是模棱两可,含糊,不完整,过于宽泛或夸张的,不能以目前的形式合理地回答。如需帮助澄清此问题以便可以重新打开, 请访问帮助中心。 7年前关闭。 我有一个非线性模型,其中是标准正态分布的cdf,f是非线性的(请参见下文)。在使用最大似然估计找到之后,我想用参数测试该模型与我的数据的拟合优度。什么是适当的测试?我想使用此测试将不良拟合标记为不良,并确定是否应收集更多数据。Φ 一个(X 1,ÿ 1),(X 2,ÿ 2),... ,(X Ñ,ÿ Ñ)一ÿ= Φ (f(x ,a ))+ εy=Φ(f(x,a))+εy=\Phi(f(x,a)) + \varepsilonΦΦ\Phi一个aa(x1个,ÿ1个),(X2,ÿ2),... ,(xñ,ÿñ)(x1,y1),(x2,y2),…,(xn,yn)(x_1,y_1),(x_2,y_2),\dots,(x_n,y_n)一个aa 我研究了使用偏差的方法,该方法将这个模型与饱和模型进行比较,并使用分布对其适合性进行了相应的检验。这样合适吗?我所阅读的关于偏差的大部分内容都将其应用于GLM,而我所没有的。如果偏差测试是适当的,则需要满足哪些假设才能使测试有效?χ2n − 1χn−12\chi^2_{n-1} 更新:对于,有所帮助。 X>1,一>0f=x−1ax2+1√f=x−1ax2+1f = \frac{x-1}{a\sqrt{x^2+1}}x>1,a>0x>1,a>0x>1,a>0


2
两次样本t检验的功效
我试图了解两个独立样本t检验(不假设方差相等,因此我使用Satterthwaite)的功效计算。 这是我发现可以帮助您理解该过程的图表: 因此,我假定给定以下两个总体,并给出样本量: mu1<-5 mu2<-6 sd1<-3 sd2<-2 n1<-20 n2<-20 我可以计算零下的临界值,该临界值与0.05的上尾概率有关: df<-(((sd1^2/n1)+(sd2^2/n2)^2)^2) / ( ((sd1^2/n1)^2)/(n1-1) + ((sd2^2/n2)^2)/(n2-1) ) CV<- qt(0.95,df) #equals 1.730018 然后计算替代假设(对于这种情况,我了解到的是“非中心t分布”)。我使用上图中的非中心分布和临界值在上图中计算了beta。这是R中的完整脚本: #under alternative mu1<-5 mu2<-6 sd1<-3 sd2<-2 n1<-20 n2<-20 #Under null Sp<-sqrt(((n1-1)*sd1^2+(n2-1)*sd2^2)/(n1+n2-2)) df<-(((sd1^2/n1)+(sd2^2/n2)^2)^2) / ( ((sd1^2/n1)^2)/(n1-1) + ((sd2^2/n2)^2)/(n2-1) ) CV<- qt(0.95,df) #under alternative diff<-mu1-mu2 t<-(diff)/sqrt((sd1^2/n1)+ (sd2^2/n2)) ncp<-(diff/sqrt((sd1^2/n1)+(sd2^2/n2))) #power 1-pt(t, …


1
从某种意义上说,样本均值是分布的“最佳”估计值均值吗?
通过大量的(弱/强)法,给出了一些独立同分布的采样点分布的,它们的样本均值˚F *({ X 我,我= 1 ,... ,N } ):= 1{ x一世∈ [Rñ,i = 1 ,… ,N}{xi∈Rn,i=1,…,N}\{x_i \in \mathbb{R}^n, i=1,\ldots,N\}在样本量N趋于 无穷大时,在概率和概率上均收敛于分布均值。F∗({ x一世,i = 1 ,… ,N} ):= 1ñ∑ñ我= 1X一世f∗({xi,i=1,…,N}):=1N∑i=1Nxif^*(\{x_i, i=1,\ldots,N\}):=\frac{1}{N} \sum_{i=1}^N x_i ñNN 当样本量固定时,我想知道LLN估计量f *在某种意义上是否是最佳估计量?例如,ñNNF∗f∗f^* 它的期望是分布均值,因此它是一个无偏估计量。方差为其中σ2是方差分布。但这是UMVU吗?σ2ñσ2N\frac{\sigma^2}{N}σ2σ2\sigma^2 是否有一些函数使得f ∗({ x i,i = 1 ,… ,N } )解决了最小化问题:f ∗({ x i,i = 1 …

2
高度不规则的时间序列
我有一些不同鱼类种群的数据,这些数据是在大约5年的时间内采样的,但模式非常不规则。有时样本之间有几个月的间隔,有时一个月内有多个样本。也有很多0计数 如何处理此类数据? 我可以很容易地在R中绘制它的图形,但是这些图形并不是很特别,因为它们非常颠簸。 在建模方面-将物种建模为各种事物的函数-也许是混合模型(又称为多级模型)。 欢迎任何参考或想法 回应评论的一些细节 大约有15种。 我试图既了解每条鱼的任何趋势或季节性,又看一看物种之间的相互关系(我的客户最初想要一个简单的相关表) 目标是描述性和分析性的,而非预测性的 进一步的编辑:我确实找到了K. Rehfield等人的论文,该论文建议使用高斯核估计高度不规则时间序列的ACF http://www.nonlin-processes-geophys.net/18/389/2011/npg-18-389-2011.pdf


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.