统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
测试IID采样
您将如何测试或检查采样是否为IID(独立且完全相同)?请注意,我不是指高斯和完全分布式,而只是IID。 我想到的想法是,将样本重复分成相等大小的两个子样本,执行Kolmogorov-Smirnov检验,并检查p值的分布是否均匀。 欢迎对该方法发表任何评论,并提出任何建议。 开始赏金后的澄清: 我正在寻找可用于非时间序列数据的常规测试。

4
交叉验证之前的归一化
在执行重复的k倍交叉验证之前,对数据进行归一化处理(均值为零,统一标准差为零)是否会产生诸如过度拟合之类的负面后果? 注意:这是针对#cases> total #features的情况 我正在使用对数转换来转换部分数据,然后如上所述对所有数据进行规范化。然后执行功能选择。接下来,我将选定的特征和标准化数据应用于重复的10倍交叉验证,以尝试估计广义分类器的性能,并担心使用所有数据进行标准化可能不合适。我是否应该使用从该折叠训练数据中获得的归一化数据对每个折叠的测试数据进行归一化? 任何意见表示感谢!很抱歉,这个问题似乎很明显。 编辑: 在对此进行测试(符合以下建议)时,我发现CV之前的规范化与CV中的规范化相比在性能方面没有太大差异。

3
有可用的通用方法来模拟公式或分析中的数据吗?
从实验设计数据框中对数据进行从头模拟。 着重于R(尽管其他语言解决方案会很棒)。 在设计实验或调查时,模拟数据并对该模拟数据进行分析可以提供对设计优点和缺点的深刻了解。 这种方法对于理解和正确使用统计检验也可能至关重要。 但是,此过程往往有些繁琐,并且导致许多人跳过了实验或调查中的这一重要步骤。 统计模型和检验包含模拟数据所需的大多数信息(包括假设或分布的明确表述)。 给定一个分析模型(及其关联的假设,例如正态和平衡),一个因素的水平和一个显着性的量度(例如p值),我想获得模拟数据(理想情况下具有类似于print(),predict(),simulate())。 这样的通用仿真框架可能吗? 如果可以,目前是否有这样的框架? 例如,我想要一个函数,例如: sim(aov(response~factor1+factor2*factor3), p.values=list(factor1=0.05, factor2=0.05, factor3=0.50, factor2:factor3=0.05), levels=list(factor1=1:10, factor2=c("A", "B", "C"), factor3=c("A", "B", "C"))) 即: sim.lm<-function(){ library(DoE.base) design<-fac.design(nlevels=c(10,3,3), factor.names=c("factor1", "factor2", "factor3"), replications=3, randomize=F) response<-with(design, as.numeric(factor1)+ as.numeric(factor2)+ as.numeric(factor3)+ as.numeric(factor2)*as.numeric(factor3)+ rnorm(length(factor1))) simulation<-data.frame(design, response)} 要么 sim(glm(response~factor1+factor2*factor3, family=poisson), p.values=list(factor1=0.05, factor2=0.05, factor3=0.50, factor2:factor3=0.05), levels=list(factor1=1:10, factor2=c("A", "B", "C"), …

3
您将如何向没有统计背景的人们解释广义线性模型?
我总是很难向没有统计背景的听众解释统计技术。如果我想向此类受众解释什么是GLM(不抛出统计术语),那么最佳或最有效的方法是什么? 我通常用三个部分来解释GLM:(1)作为响应变量的随机分量,(2)作为线性预测变量的系统分量,以及(3)作为连接(1)的“关键”的链接函数(2)。然后,我将给出线性或逻辑回归的示例,并说明如何根据响应变量选择链接函数。因此,它充当连接两个组件的关键。

2
哪种分布最常用于建模服务器响应时间?
我有一个基于Servlet的应用程序,其中我测量完成对该Servlet的每个请求所花费的时间。我已经计算出简单的统计数据,例如均值和最大值;但是,我想进行一些更复杂的分析,因此我相信我需要对这些响应时间进行建模。 我肯定地说,响应时间遵循一些众所周知的分布,并且有充分的理由相信分布是正确的模型。但是,我不知道这种分布应该是什么。 想到对数正态和Gamma,您可以制作一种适合实际响应时间的数据。是否有人对响应时间应遵循的分布有看法?

6
如何在一系列数据中找到局部峰/谷?
这是我的实验: 我正在使用quantmod包中的findPeaks函数: 我想在公差5内检测“局部”峰,即时间序列从局部峰下降5以后的第一个位置: aa=100:1 bb=sin(aa/3) cc=aa*bb plot(cc, type="l") p=findPeaks(cc, 5) points(p, cc[p]) p 输出是 [1] 3 22 41 这似乎是错误的,因为我预计“本地高峰”会超过3个... 有什么想法吗?
16 r  time-series 

4
有哪些好的数据集可以说明统计分析的特定方面?
我意识到这是主观的,但是我认为谈论我们喜欢的数据集以及我们认为使它们变得有趣的内容会很好。那里有大量的数据,以及所有API(例如Datamob)和经典数据集(例如R data)的作用,我认为这可能会有一些非常有趣的响应。 例如,我一直喜欢“波士顿住房”数据集(尽管有不幸的含义)和“ mtcars”这样的数据集,因为它们具有多功能性。从教学的角度来看,可以证明使用它们的各种统计技术的优点。Anderson / Fisher的虹膜数据集将在我的心中永远占有一席之地。 有什么想法吗?
16 dataset 

2
带有计数数据和过度分散的回归中的泊松还是拟泊松?
我有计数数据(根据可能的许多因素,对客户数量进行需求/报价分析)。我尝试使用正常错误进行线性回归,但是我的QQ图并不是很好。我尝试了答案的日志转换:再次是不良的QQ图。 所以现在,我正在尝试使用Poisson错误进行回归。使用具有所有重要变量的模型,我得到: Null deviance: 12593.2 on 53 degrees of freedom Residual deviance: 1161.3 on 37 degrees of freedom AIC: 1573.7 Number of Fisher Scoring iterations: 5 残余偏差大于残余自由度:我过于分散。 我怎么知道我是否需要使用准泊松?在这种情况下,拟泊松的目标是什么?我在克劳利(Crawley)的《 The R Book》中阅读了此建议,但我的观点并没有太大的改善。

6
R的计算速度?
我的任务是将我们当前的大型随机模型之一从SAS迁移到新语言。就个人而言,我更喜欢传统的编译语言,但PI希望我签出我从未使用过的R。我们将模型从SAS中剔除的动机是:(1)许多人因为SAS昂贵而无法使用它;(2)我们正在寻求摆脱解释型语言;(3)SAS对于我们拥有的模型类型。 对于(1),显然R满足自由的需求。对于(2),理想情况下,我们想创建一个可执行文件,但是R通常用作脚本语言。我看到有人最近发布了R编译器-这是否广受欢迎?这个容易用吗?我们不想强迫用户自己下载R。对于(3),我们的SAS问题是所有时间都花在I / O写入和读取数据集上。我们的模型是计算密集型的,并且经常受到运行时的限制。(例如,有人在周末劫持人们的计算机来执行运行并不少见。)我们在Fortran中建立了一个类似的模型,该模型不会出现相同的问题,因为所有工作都在内存中完成。R如何工作?它是否与SAS相同,因为它可以在数据步骤中工作,读写文件?还是可以在内存中进行数组操作?
16 r  computing 

1
需要回归中的数据居中和标准化
考虑采用某种正则化的线性回归:例如,找到使| |最小的。| A x − b | | 2 + λ | | x | | 1个xxx||Ax−b||2+λ||x||1||Ax−b||2+λ||x||1||Ax - b||^2+\lambda||x||_1 通常,将A的列标准化为具有零均值和单位范数,而的中心为具有零均值。我想确定我对标准化和居中原因的理解是否正确。bbb 通过使和b列的均值为零,我们不再需要拦截项。否则,目标将是| | A x − x 0 1 − b | | 2 + λ | | x | | 1。通过使A的列的范数等于1,我们消除了仅由于A的一列具有很高的范数而在x中获得较低系数的情况的可能性,这可能导致我们错误地得出结论: A不能很好地“解释” x。AAAbbb||Ax−x01−b||2+λ||x||1||Ax−x01−b||2+λ||x||1||Ax-x_01-b||^2+\lambda||x||_1xxxxxx 这种推理并不严格,而是凭直觉,这是正确的思维方式吗?

2
为什么正交投影的投影矩阵是对称的?
我对此很陌生,所以如果问题很幼稚,希望您能原谅我。(上下文:我正在从Davidson和MacKinnon的书《计量经济学的理论与方法》中学习计量经济学,他们似乎并没有对此进行解释;我还看了Luenberger的优化书,该书以更高的水平处理了预测,但是没有运气)。 假设我有一个正交投影与相关联的投影矩阵。我有兴趣将每个向量投影到某个子空间。PP\mathbb PPP\bf PRn[Rñ\mathbb{R}^nA⊂Rn一种⊂[RñA \subset \mathbb{R}^n 问题:为什么遵循,即是对称的?我可以从哪本教科书看这个结果?T PP=PP=P\bf{P}=PTŤ^TPP\bf P

4
经典线性模型-模型选择
我有一个经典的线性模型,带有5个可能的回归变量。它们彼此不相关,并且与响应的相关性很低。我已经建立了一个模型,其中3个回归变量的t统计量具有显着系数(p <0.05)。对于添加的变量,将其余2个变量中的一个或两个相加得出t统计量的p值> 0.05。这使我相信3变量模型是“最佳”的。 但是,在R中使用anova(a,b)命令,其中a是3变量模型,b是完整模型,F统计量的p值<0.05,这表明我更喜欢完整模型而不是3变量模型。我该如何调和这些明显的矛盾? 谢谢PS编辑:一些进一步的背景。这是家庭作业,因此我将不发布细节,但是我们没有提供回归变量代表的详细信息-它们只是从1到5编号。我们被要求“推导适当的模型,给出理由”。

1
何时使用加权欧几里得距离,以及如何确定要使用的权重?
我有一组数据,其中每个数据包含nnn不同的度量。对于每种度量,我都有一个基准值。我想知道每个数据与基准值有多接近。 我想到了像这样使用加权欧几里得距离: dx,b=(∑ni=1wi(xi−bi)2))1/2dx,b=(∑i=1nwi(xi−bi)2))1/2\hspace{0.5in} d_{x,b}=\left( \sum_{i=1}^{n}w_i(x_i-b_i)^2)\right)^{1/2} 哪里 xixi\hspace{0.5in}x_i是特定数据的第i个度量的值 bibi\hspace{0.5in}b_i是该度量的相应基准值。 wiwi\hspace{0.5in} w_i是我将附加到第i个度量之间的权重值,但要遵守以下条件: 0&lt;wi&lt;10&lt;wi&lt;1\hspace{1in}0<w_i<1和∑ni=11∑i=1n1\sum_{i=1}^{n}1 但是,根据该文档,我发现要使用的权重是第i个度量的方差的倒数。我认为这种加权不会解释我对每种度量标准的重视程度。 因此: 是否有方法提出一组权重来反映观察者对度量的相对重要性,或者观察者可以为权重分配任意值吗? 使用加权欧几里得距离来解决这个问题是否合适?

1
如何计算非线性回归的预测范围?
Prism 的帮助页面对如何计算非线性回归的预测范围进行了以下说明。请原谅长引号,但我没有遵循第二段(它解释了的定义方式以及d Y / d P的计算方式)。任何帮助将不胜感激。G|xG|xG|xdY/dPdY/dPdY/dP 置信度和预测范围的计算是相当标准的。继续阅读有关Prism如何计算非线性回归的预测带和置信带的详细信息。 首先,让我们定义G | x,它是在特定X值下并使用所有参数的最佳拟合值的参数梯度。结果是一个向量,每个参数一个元素。对于每个参数,它定义为dY / dP,其中Y是给定特定X值和所有最佳拟合参数值的曲线的Y值,P是其中一个参数。) G'| x是转置的梯度矢量,因此它是一列而不是一行值。 Cov是协方差矩阵(上次迭代的逆Hessian)。它是一个正方形矩阵,行和列的数量等于参数的数量。矩阵中的每一项都是两个参数之间的协方差。 现在计算c = G'| x * Cov * G | x。结果是任何X值的单个数字。 置信带和预测带以最佳拟合曲线为中心,并在曲线的上方和下方延伸相等的量。 置信带在曲线的上方和下方延伸:= sqrt(c)* sqrt(SS / DF)* CriticalT(Confidence%,DF) 预测带在曲线的上方和下方进一步延伸,等于:= sqrt(c + 1)* sqrt(SS / DF)* CriticalT(Confidence%,DF)

4
多项式逻辑回归中的exp(B)的解释
这在某种程度上是一个初学者的问题,但是如何在多项式逻辑回归模型中解释6.012的exp(B)结果? 1)风险增加6.012-1.0 = 5.012 = 5012%吗? 要么 2)6.012 /(1 + 6.012)= 0.857 =风险增加了85.7%? 如果两种选择都不正确,有人可以提出正确的方法吗? 我已经在互联网上搜索了许多资源,而我找到了这两种选择,但我不完全确定哪一种是正确的。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.