统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
我该如何解释布劳奇-帕根检验的结果?
在其中,R我可以使用程序包的ncvTest功能对异方差进行Breusch-Pagan测试car。Breusch-Pagan检验是卡方检验的一种。 我如何解释这些结果: > require(car) > set.seed(100) > x1 = runif(100, -1, 1) > x2 = runif(100, -1, 1) > ncvTest(lm(x1 ~ x2)) Non-constant Variance Score Test Variance formula: ~ fitted.values Chisquare = 0.2343406 Df = 1 p = 0.6283239 > y1 = cumsum(runif(100, -1, 1)) > y2 = runif(100, -1, …

3
R中的正稳定分布
正稳态分布由四个参数描述:偏度参数,比例参数,位置参数等称为索引参数。当为零时,分布在左右对称,当它为正(分别为负)时,分布偏向右侧(分别为向左)当减小时,稳定的分布允许出现胖尾巴。β∈ [ - 1 ,1 ]β∈[-1个,1个]\beta\in[-1,1]σ&gt; 0σ&gt;0\sigma>0μ &Element; (- ∞ ,∞ )μ∈(-∞,∞)\mu\in(-\infty,\infty)α &Element; (0 ,2 ]α∈(0,2]\alpha\in(0,2]ββ\betaμμ\muαα\alpha 当严格小于1并且时,分布的支持范围限制为。αα\alphaβ= 1β=1个\beta=1(μ ,∞ )(μ,∞)(\mu,\infty) 对于参数值的某些特定组合,密度函数仅具有闭合形式的表达式。当,,,和它是(参见式(4.4)这里):μ = 0μ=0\mu=0α &lt; 1α&lt;1个\alpha<1β= 1β=1个\beta=1σ= ασ=α\sigma=\alpha F(y)= -1个πÿ∑∞k = 1Γ (ķ α + 1 )ķ !(-ÿ- α)ķ罪(α ķ π)F(ÿ)=-1个πÿ∑ķ=1个∞Γ(ķα+1个)ķ!(-ÿ-α)ķ罪⁡(αķπ)f(y) = -\frac{1}{\pi y} \sum_{k=1}^{\infty} \frac{\Gamma(k\alpha+1)}{k!} (-y^{-\alpha})^k \sin(\alpha k \pi) 它具有无限的均值和方差。 …

1
我可以基于事件发生的随机采样来估计事件的发生频率吗?
进行了一些修改... 这个问题只是为了好玩,因此,如果它不好玩,请随时忽略它。我已经从该站点获得了很多帮助,所以我不想咬我的手。它基于一个现实生活中的示例,这只是我想知道的很多事情。 我周一至周五参观了当地的道场,基本上是随机训练。假设我每周拜访两次。这意味着我每周要访问两次,只有两天不一样。每当我在那里时,几乎都有一个人在那里。如果他和我在同一天访问,那么我将会见到他。假设我在90%的时间在那里。我想知道两件事: 1)他多久训练一次 2)他是随机来还是在一周的固定日期来。 我猜想也许我们必须假设一个人猜另一个?我真的一无所获。我只是在每个星期的热身活动中都在想这件事,并且感到莫名其妙。即使有人给我一个思考问题的方法,我也将不胜感激。 干杯!

1
测量训练后的神经网络的相关性
我正在使用非正态分布数据训练人工神经网络(反向传播,前馈)。除了均方根误差外,文献还经常提出用于评估训练网络质量的皮尔逊相关系数。但是,如果训练数据不是正态分布的,Pearson相关系数是否合理?使用基于等级的相关度量(例如Spearman rho)是否更合理?

1
R实现部分确定系数
有没有人有建议或一揽子计划来计算部分确定系数? 可以将部分确定系数定义为无法在简化模型中解释的变化百分比,但可以由完整模型中指定的预测变量解释。该系数用于深入了解一个或多个其他预测变量在更完全指定的回归模型中是否有用。 在估计您的两个模型并为它们生成ANOVA表后,部分r ^ 2的计算相对简单。局部r ^ 2的计算为: (减少SSE-减少SSEfull)/减少SSE 我已经编写了这个相对简单的函数,可以为多元线性回归模型计算该函数。我不熟悉R中的其他模型结构,其中该功能可能无法很好地发挥作用: partialR2 &lt;- function(model.full, model.reduced){ anova.full &lt;- anova(model.full) anova.reduced &lt;- anova(model.reduced) sse.full &lt;- tail(anova.full$"Sum Sq", 1) sse.reduced &lt;- tail(anova.reduced$"Sum Sq", 1) pR2 &lt;- (sse.reduced - sse.full) / sse.reduced return(pR2) } 对于完成该任务的更健壮的功能和/或以上代码的更有效实现的任何建议或技巧将不胜感激。
9 r  regression  anova 

1
小波多分辨率分析中的边界效应
有什么方法可以减小小波分解中边界的影响? 我使用R和包wavelim。 我发现例如功能 ?brick.wall 但 我不太使用它。 我不确定最好的解决方案是删除一些系数。我在某处读到它存在一些不一样的小波,并且它们的形状在边界处改变。 有任何想法吗?

4
如何在R中搜索统计过程?
是否有R程序包,网站或命令可以让他们搜索他们想要的特定统计程序? 例如,如果我想找到一个具有Box-Cox转换功能的程序包,则网站/程序包/命令可能会返回“ MASS”并使我转至该boxcox()函数。 使用Box-Cox这样的工具相当简单,但是我希望它可以让我找到更困难的过程,或者通过函数的功能进行搜索(“将列连接到数据框”可能会出现cbind())。是否存在这样的东西?
9 r 

2
我是否正确指定了我的lmer模型?
我搜寻了Google和该站点,但对lme4库中的lmer函数仍然感到困惑。 我从不同的精神病房收集了一些数据,这些数据具有多层次的结构。为简化起见,我将选择两个2级和2个1级变量,尽管实际上我还有几个。 2级-WardSize [这是病房的人数]和WAS [这是病房的“好”程度的一种度量] 告诉R谁在哪个病房中的分组变量称为“ Ward” 一级-性别[很明显是性别]和BSITotal [这是症状严重程度的度量] 结果是自我拒绝,这又是听起来的样子。 我有这个公式: help = lmer(公式= Selfreject〜WardSize + WAS +性别+ BSITotal +(1 | Ward)) 我希望这意味着“每个人的得分都与他们自己的性别和症状的严重程度有关,并且对病房的影响与病房的大小以及病情的“好”程度有关。 它是否正确?使我感到困惑的是,除了最后给出的病房级别截距之外,我看不到R如何分辨哪个是1级和哪个2级变量。 如果有人能解释这个概念,那么像我这样的白痴就可以理解,那就更好了。 非常感谢!

2
双层集群入门
我一直在做一些关于bicluster的互联网研究。(我已经阅读了Wiki文章多次。)到目前为止,似乎没有什么定义或标准术语。 我想知道是否有任何对寻找二聚体算法感兴趣的标准论文或书籍。 是否可以说该领域的最新技术水平?我对使用遗传算法找到双聚类的想法很感兴趣,因此,尤其是在其他方法的背景下,我将对该方法的评论表示赞赏。 通常在群集中,目标是将数据集划分为组,其中每个元素都位于某个组中。bicluster算法是否还试图将所有元素放在一个特定的组中?


1
Tukey HSD测试如何比未校正的t.test P值更具意义?
我来自“ 双向ANOVA的事后成对比较 ”(对此帖子),它显示了以下内容: dataTwoWayComparisons &lt;- read.csv("http://www.dailyi.org/blogFiles/RTutorialSeries/dataset_ANOVA_TwoWayComparisons.csv") model1 &lt;- aov(StressReduction~Treatment+Age, data =dataTwoWayComparisons) summary(model1) # Treatment is signif pairwise.t.test(dataTwoWayComparisons$StressReduction, dataTwoWayComparisons$Treatment, p.adj = "none") # no signif pair TukeyHSD(model1, "Treatment") # mental-medical is the signif pair. (输出附在下面) 有人可以解释为什么在配对(未调整的p值)t检验失败时,Tukey HSD能够找到有效的配对吗? 谢谢。 这是代码输出 &gt; model1 &lt;- aov(StressReduction~Treatment+Age, data =dataTwoWayComparisons) &gt; summary(model1) # Treatment is signif …

7
如何使用R计算400万边缘网络中的集中度度量?
我有一个CSV文件,该文件有400万条有向网络的边缘,代表着彼此通信的人(例如,约翰向玛丽发送消息,玛丽向安发送消息,约翰向玛丽发送另一条消息,等等)。我想做两件事: 查找每个人的度数,本位之间和(也许)本征中心度度量。 获得网络的可视化。 我想在Linux服务器上的命令行上执行此操作,因为我的笔记本电脑没有很多功能。我在该服务器和statnet库上安装了R。我在2009年的这个职位发现某人比我更有能力尝试做同样的事情,并且遇到问题。因此,我想知道是否还有其他人对如何执行此操作有任何建议,最好带我一步一步,因为我只知道如何加载CSV文件,而别无其他。 为了给您一个想法,这是我的CSV文件的外观: $ head comments.csv "src","dest" "6493","139" "406705","369798" $ wc -l comments.csv 4210369 comments.csv

1
nlm()函数中的代码变量
在R中,有一个函数nlm(),它使用牛顿-拉夫森算法使函数f最小化。特别是,该函数输出如下定义的可变代码的值: 编码一个整数,指示优化过程为何终止。 1:相对梯度接近零,可能是电流迭代。 2:在容差范围内进行连续迭代,当前迭代可能是解决方案。 3:最后一个全局步骤未能找到一个低于估计值的点。估计是函数的局部最小值,或者阶跃过小。 4:超出迭代限制。 5:最大步长stepmax连续五次超过。该函数在下面是无界的,或者是从上方在某个方向上逐渐变为有限值,或者stepmax太小。 有人可以针对情况1-5解释我(也许只是使用一个仅带有一个变量的函数的简单图示)吗? 例如,情况1可能对应于以下图片: 先感谢您!
9 r  minimum 

1
使用奇异值分解从线性回归模型计算方差协方差矩阵
我有一个p个回归变量,n个观测值的设计矩阵,并且正在尝试计算参数的样本方差-协方差矩阵。我正在尝试使用svd直接计算它。 我正在使用R,当我取设计矩阵的svd时,我得到三个组件:矩阵为,矩阵为 x(可能是特征值),矩阵为。我将对角化,使其成为非对角线中矩阵。UUUn×pn×pn \times pDDD1×31×31\times 3VVV3×33×33\times 3DDD3×33×33\times 3 假设协方差的公式为:,但是矩阵不匹配,甚至不接近R的内置函数。有没有人有任何建议/参考?我承认我在这方面不熟练。VD2V′VD2V′V D^2 V'vcov
9 r  regression 

1
时间序列重要性测试的时间分辨率是多少?
我需要有关池的适当级别的一些指导,以用于对时间序列数据进行均值检验。我担心时间伪复制和牺牲伪复制,这在此应用程序中似乎很紧张。这是参考心理研究而不是操纵性实验。 考虑一个监视练习:一个传感器系统在整个池塘的宽度和深度的多个位置测量溶解氧(DO)含量。每天记录两次每个传感器的测量值,因为已知溶解氧每天都会变化。将这两个值取平均值以记录每日值。每周一次,将每日结果在空间上汇总,以得出整个池塘每周一次的DO浓度。 这些每周的结果会定期报告,并进一步汇总-将每周的结果平均以得出池塘每月的DO浓度。将月度结果取平均值即可得出年值。每年的平均值本身是平均值,以报告池塘的十年溶解氧浓度。 目的是回答以下问题:池塘在X年的DO浓度是较高,较低还是与Y年的浓度相同?最近十年的平均溶解氧浓度是否与前十年的平均溶解氧浓度不同?池塘中的溶解氧浓度会响应大量的大量输入,因此变化很大。需要进行重要性检验。该方法是使用均值的T检验比较。假定十年值是年均值,而年值是月均值,这似乎是适当的。 问题是 –您可以从每月DO值或每年DO值计算十年平均值和这些平均值的T值。平均值当然不会改变,但是置信区间和T值的宽度会改变。由于使用月度值可获得较高的N数量级,因此,如果您选择该路线,则CI通常会明显收紧。对于在均值上观察到的差异的统计显着性而言,这可以得出与使用年度值相反的结论,即对相同数据使用相同的检验。 对这种差异的正确解释是什么? 如果使用月度结果来计算测试统计量的年代平均值差异,那么您是否违反了时间伪复制?如果使用年度结果来计算年代际测验,您是在牺牲信息并因此进行伪复制吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.