统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
为什么有些人在原始数据上测试类似回归模型的假设,而另一些人在残差上测试它们呢?
我是实验心理学的博士生,我努力提高自己的技能和知识,以分析数据。 在我进入心理学的五年级之前,我一直认为类似回归的模型(例如ANOVA)假设以下内容: 数据的正态性 数据的方差同质性等等 我的本科课程使我相信这些假设与数据有关。但是,在我五年级的时候,我的一些讲师强调了这样一个事实,即假设是关于误差(由残差估计)的,而不是原始数据。 最近,我与一些同事谈论假设问题,他们也承认,他们发现只有在大学的最后几年才检查残差假设的重要性。 如果我了解得很好,类似回归的模型将对误差做出假设。因此,检查残差的假设是有意义的。如果是这样,为什么有人检查原始数据的假设?是否因为这样的检查程序近似于我们通过检查残差而获得的结果? 我会与一些比我和我的同事更准确的知识的人就这个问题进行讨论。我在此先感谢您的回答。

5
John Kerrich投币数据
任何人都可以建议从哪里获得约翰·科里希(John Kerrich)在第二次世界大战期间进行的10,000次硬币翻转的结果(即,所有10,000次正面和反面)?


4
在R中如何计算ROC下面积的p值
我努力寻找一种方法来计算接收器操作员特征(ROC)下面积的p值。我有一个连续变量和诊断测试结果。我想看看AUROC是否具有统计意义。 我发现许多处理ROC曲线的软件包:pROC,ROCR,caTools,验证,Epi。但是,即使花了很多时间阅读文档和测试,我仍然找不到方法。我想我只是想念它。
12 r  p-value  roc 

4
拟合优度适用于非常大的样本量
我每天收集非常大的分类数据样本(> 1,000,000),并希望看到各天之间的数据看起来“明显”不同,以检测数据收集中的错误。 我认为使用拟合度测试(尤其是G检验)将非常适合(双关语)。预期分布由前一天的分布给出。 但是,由于我的样本量太大,该测试具有很高的功效,并且会散发出许多假阳性结果。就是说,即使是很小的每日波动也会产生接近零的p值。 我最终将测试统计量乘以某个常数(0.001),可以很好地解释以该速率采样数据。本文似乎同意这种方法。他们说: 卡方最可靠,样本约100至2500人 我正在寻找有关此的更多权威评论。在大型数据集上进行统计测试时,也可能有一些其他方法可以解决误报问题。

4
增加标准偏差的值
我对以下陈述感到困惑: “为了增加一组数字的标准偏差,必须添加一个比平均值多一个标准偏差的值” 这是什么证明?我当然知道我们如何定义标准偏差,但是我似乎以某种方式错过了那部分。任何意见?

2
汇总中保留哪些统计信息?
如果我们有一个较长的高分辨率时间序列,并且有很多杂讯,通常有必要将数据聚合为较低的分辨率(例如,从每日到每月的值),以更好地了解正在发生的事情,从而有效地去除一些噪音。 我已经看过至少一篇论文,然后将一些统计信息应用于汇总数据,包括对单独变量进行线性回归的。那有效吗?我本来以为,由于降低了噪声,平均过程会稍微修改结果。r2r2r^2 通常,是否可以将某些统计信息应用于汇总的时间序列数据,而其他统计信息则不能?如果是这样,哪个?是线性组合的,也许吗?

1
有没有比“积分平均值”更好的名称?
我正在测试我公司销售的节气门位置传感器(TPS),并打印出与节气门轴旋转有关的电压响应曲线图。TPS是一种旋转传感器,范围 90°,其输出类似于电位计,其全开为5V(或传感器的输入值),初始开为0至0.5V之间的某个值。我用PIC32控制器构建了一个测试台,每0.75°进行一次电压测量,黑线连接这些测量。≈≈\approx 我的一款产品倾向于使局部低振幅变化远离理想线(或在理想线以下)。这个问题是关于我的量化这些局部“凹陷”的算法。测量倾角的过程的好名字或描述是什么?(下面有完整的说明)在下面的图片中,下降出现在图的左三分之一处,这是我是否会通过或未通过这部分的临界情况: 因此,我构建了一个倾角检测器(有关算法的stackoverflow qa)来量化我的直觉。我最初以为我正在测量“面积”。该图基于上面的打印输出以及我尝试以图形方式解释该算法。在17到31之间有13个样本持续下降: 测试数据进入一个数组,我为从一个数据点到另一个数据点的“上升”创建了另一个数组,我将其称为。我使用一个库来获取的平均值和标准差。deltasdeltasdeltasdeltasdeltasdeltas 下图表示分析数组,其中上图的斜率已删除。最初,我认为这是“标准化”或“统一”数据,因为x轴是等步的,现在我只处理数据点之间的上升。在研究这个问题时,我记得这是原始数据的派生。deltasdeltasdeltasdydxdydx\frac {dy}{dx} 我遍历以找到存在5个或更多相邻负值的序列。蓝色条形图是一系列数据点,这些数据点均低于所有的平均值。蓝色条的值是:deltasdeltasdeltasdeltasdeltasdeltas 0.7+1.2+1.3+1.4+1.8+2.5+2.9+3.0+2.5+2.0+1.5+1.0+1.20.7+1.2+1.3+1.4+1.8+2.5+2.9+3.0+2.5+2.0+1.5+1.0+1.20.7 + 1.2 + 1.3 + 1.4 + 1.8 + 2.5 + 2.9 + 3.0 + 2.5 + 2.0 + 1.5 + 1.0 + 1.2 它们的总和为,代表面积(或积分)。我的第一个想法是“我只是对导数进行了积分”,这意味着我会取回原始数据,尽管我确信这是一个术语。232323 绿线是这些“低于平均值”的平均值,这些平均值是用面积除以浸没长度得到的: 23÷13=1.7723÷13=1.7723 \div 13 = 1.77 在测试100多个零件时,我决定以绿线平均值小于跌落为可接受。整个数据集上计算出的标准差对于这些下陷来说还不够严格,因为没有足够的总面积,它们仍然落在我为优质零件设定的极限之内。我观察到选择标准偏差为我允许的最高值。2.62.62.63.03.03.0 为标准偏差设置一个严格到足以使该零件不合格的截止值,将是如此严格以至于使不合格的零件失效,否则这些零件看起来具有很大的绘图性。我也有一个尖峰检测器,如果有任何,该检测器将失败。|deltas−avg|>avg+stddev|deltas−avg|>avg+stddev|deltas - avg| > avg+std dev 自Calc 1算起已经快20年了,所以请对我轻松一点,但是这感觉很像当教授用微积分和位移方程式来解释在赛车中如何以较低的加速度保持较高的转弯速度来击败另一个竞争对手竞争对手在下一弯时具有更大的加速度:更快地通过前一弯,初始速度越高,意味着他的速度(位移)下的面积越大。 …

1
混合效应模型中固定效应的推论
我已经关联了数据,并且正在使用逻辑回归混合效应模型来估计感兴趣的预测变量的个体水平(条件)效应。我知道对于标准边际模型,使用Wald检验推断模型参数对于似然比和得分检验是一致的。它们通常大致相同。因为Wald易于计算并且可以在R输出中使用,所以我用了99%的时间。 但是,对于混合效果模型,我很感兴趣,因为固定效果的Wald检验(在R的模型输出中报告)和“人工”似然比检验之间存在巨大差异,这涉及实际拟合简化模型。凭直觉,我可以理解为什么这会有很大的不同,因为在简化的模型中,随机效应的方差被重新估计,并且会极大地影响可能性。 有人可以解释 对于固定效果,如何在R中计算Wald检验统计量? 混合效应模型中估计模型参数的信息矩阵是什么?(和从中计算Wald测试统计信息的mx相同吗?) 在我描述的案例中,两次测试的结果在解释上有什么区别?哪些通常是动机并在文献中用于推理?

1
多重共线性和样条回归是否存在问题?
当使用自然的(即受限制的)三次样条曲线时,创建的基函数是高度共线性的,当在回归中使用时,似乎会产生非常高的VIF(方差膨胀因子)统计数据,表示多重共线性。当出于预测目的考虑模型的情况时,这是一个问题吗?由于样条线构造的性质,似乎总是这样。 这是R中的示例: library(caret) library(Hmisc) library(car) data(GermanCredit) spl_mat<-rcspline.eval(GermanCredit$Amount, nk=5, inclx=TRUE) #natural cubic splines with 5 knots class<-ifelse(GermanCredit$Class=='Bad',1,0) #binary target variable dat<-data.frame(cbind(spl_mat,class)) cor(spl_mat) OUTPUT: x x 1.0000000 0.9386463 0.9270723 0.9109491 0.9386463 1.0000000 0.9994380 0.9969515 0.9270723 0.9994380 1.0000000 0.9989905 0.9109491 0.9969515 0.9989905 1.0000000 mod<-glm(class~.,data=dat,family=binomial()) #model vif(mod) #massively high OUTPUT: x V2 V3 V4 …


1
严格冯·诺依曼不等式的例子
令表示相对于先验的估计器的贝叶斯风险,令表示参数空间上所有先验的集合,而表示所有(可能是随机的)决策规则。r(π,δ)r(π,δ)r(\pi, \delta)δδ\deltaππ\piΠΠ\PiΘΘ\ThetaΔΔ\Delta 约翰·冯·诺伊曼(John von Neumann)的极小极大不等式的统计解释表明: supπ∈Πinfδ∈Δr(π,δ)≤infδ∈Δsupπ∈Πr(π,δ),supπ∈Πinfδ∈Δr(π,δ)≤infδ∈Δsupπ∈Πr(π,δ), \sup_{\pi\in\Pi} \inf_{\delta\in\Delta} r(\pi, \delta) \leq \inf_{\delta\in\Delta}\sup_{\pi\in\Pi} r(\pi, \delta), 当\ Theta和\ Delta都是有限的时,保证对某些δ′δ′\delta'和\ pi'具有严格的相等性。π′π′\pi'ΘΘ\ThetaΔΔ\Delta 有人可以提供不平等严格的具体例子吗?

1
对lmer和p值的困惑:memisc包中的p值与MCMC的p值相比如何?
我的印象是,该功能下lmer()的lme4包没有产生p值(见lmer,p值和所有)。 我一直在按以下问题使用MCMC生成的p值:混合模型中的显着效果,lme4以及以下问题:在的包中的输出中找不到p值lmer()lm4R。 最近,我尝试了一个名为memisc的程序包,并将其getSummary.mer()模型的固定效果保存到一个csv文件中。就像是魔术一样,p出现了一个名为的列,该列与我的MCMC p值非常紧密地匹配(并且不会遭受使用带来的处理时间pvals.fnc())。 我试探了其中的代码,getSummary.mer并发现了生成p值的行: p <- (1 - pnorm(abs(smry@coefs[, 3]))) * 2 这是否意味着可以直接从lmer输出生成p值,而不是运行pvals.fnc?我意识到这无疑将引发“ p值拜物教”辩论,但我很想知道。我没有听说过memisc,当涉及到前面提到的lmer。 更加简洁:与使用MCMC p值生成的值相比,使用MCMC p值有什么好处(如果有)getSummary.mer()?


1
了解测量浓度不均
本着这个问题的精神,我理解在霍夫丁不等式中使用的引理的证明,我试图理解导致霍夫丁不等式的步骤。 在证明中,对我而言最神秘的是为iid变量之和计算指数矩的那部分,然后应用Markov不等式。 我的目标是了解:为什么这种技术会带来严重的不平等,这是我们可以实现的最严格的吗?一个典型的解释是关于指数的矩产生特性。但是,我觉得这太含糊了。 Tao的博客中的帖子http://terrytao.wordpress.com/2010/01/03/254a-notes-1-concentration-of-measure/#hoeff可能会提供一些答案。 考虑到这一目标,我的问题是我停留在涛的帖子中的三点,希望我能在解释后给我以启发。 Tao使用第k个矩 如果对于任何k都成立,则他得出指数界。这是我迷路的地方。 P(|小号Ñ|≥λ√P(|Sn|≥λn−−√)≤2(ek/2−−−−√λ)k. (7)P(|Sn|≥λn)≤2(ek/2λ)k. (7)\displaystyle {\bf P}( |S_n| \geq \lambda \sqrt{n} ) \leq 2 (\frac{\sqrt{ek/2}}{\lambda})^k. \ \ \ \ \ (7)P( | Sñ| ≥λ Ñ--√)≤ Ç经验值(- Ç λ2)(8 ) P(|Sn|≥λn)≤Cexp⁡(−cλ2) (8)\displaystyle {\bf P}( |S_n| \geq \lambda \sqrt{n} ) \leq C \exp( - c \lambda^2 ) …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.