统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
R的启动程序包中cv.glm中的cost函数是什么?
我正在使用留一法进行交叉验证。我有一个二进制响应,并且正在使用R的引导程序包,并且 cv.glm函数。我的问题是我不完全了解此功能中的“费用”部分。从我的理解中,这是一个功能,它决定将估计值分类为1还是0,即分类的阈值。它是否正确? 并且,在R的帮助下,他们将此函数用于二项式模型:cost <- function(r, pi = 0) mean(abs(r-pi) > 0.5)。如何解释此功能?因此我可以正确修改它以进行分析。 感谢您提供任何帮助,不想使用我不了解的功能。

3
有关参数和非参数引导程序的问题
我正在阅读凯文·墨菲(Kevin Murphy)的著作《机器学习-概率论》中有关频繁统计的章节。引导程序部分内容为: 引导程序是一种简单的蒙特卡洛技术,用于近似采样分布。这在估算器是真实参数的复杂函数的情况下特别有用。 这个想法很简单。如果我们知道真实参数,则对于s = 1,我们可以从真实分布x_i ^ s \ sim p(·|θ^ ∗)生成许多​​(例如)伪数据集,每个伪数据集的大小为N : S,i = 1:N。然后,我们可以根据每个样本\ hat {\ theta ^ s} = f(x ^ s_ {1:N})计算估计量,然后 将所得样本的经验分布用作我们对采样分布的估计。由于\ theta是未知的,因此参数引导程序的想法是改为使用\ hat {\ theta}(D)生成样本。小号Ñ X 小号我〜p(· | θ *)小号=1:小号,我=1:Ñ ^ θ 小号 =˚F( X 小号1 :Ñ)θθ∗θ∗θ^∗SSSNNNxsi∼p(⋅|θ∗)xis∼p(·|θ∗)x_i^s \sim p (·| θ^∗ )s=1:S,i=1:Ns=1:S,i=1:Ns = 1 …

3
您将如何在R中进行贝叶斯ANOVA和回归分析?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 2年前关闭。 我有一个相当简单的数据集,由一个自变量,一个因变量和一个分类变量组成。我在运行诸如aov()和的频繁测试方面有丰富的经验lm(),但是我无法弄清楚如何在R中执行它们的贝叶斯等效项。 我想对前两个变量进行贝叶斯线性回归,并使用分类变量作为分组进行方差的贝叶斯分析,但是我找不到任何简单的示例来说明如何使用R做到这一点。都?此外,贝叶斯分析所创建的输出统计信息到底是什么,它们表示什么? 我对统计数据不是很精通,但是共识似乎是,现在认为使用带有p值的基本测试有些误入歧途,我正在努力跟上。问候。


1
网站的唯一身份访问者是否遵守幂律?
假设我有一个有序向量,其中第一个元素是在给定时间内访问量最高的唯一IP对该网站的访问次数,第二个元素是该唯一IP所访问的网站的访问次数,第二个元素是访问次数最多,依此类推。我了解每个站点可能会有变化,但是总体上该矢量的形状是否存在假定的模式?例如,它是否遵循幂律分布?
14 web  power-law 

2
LME()错误-达到迭代限制
在指定交叉混合效果模型时,我尝试包括交互。但是,我收到以下错误消息: Error in lme.formula(rate ~ nozzle, random = ~nozzle | operator, data = Flow) : nlminb problem, convergence error code = 1 message = iteration limit reached without convergence (10) 该模型具有以下特征:1. 3种喷嘴类型(固定效果)2. 5个操作员,每个操作员对3种喷嘴类型的燃油流量进行3次重复测量。 我被要求在模型中包括喷嘴类型和操作员之间的相互作用。这是我的模型代码: flow.lme <- lme(rate ~ nozzle, error= nozzle|operator, data=Flow) 为什么我会收到此错误消息?

1
RandomForest-MDS图解说明
我使用randomForest根据8个变量(不同的身体姿势和动作)对6种动物行为进行了分类(例如,站立,行走,游泳等)。 randomForest软件包中的MDSplot给我该输出,并且在解释结果时遇到问题。我对相同的数据进行了PCA,并且已经在PC1和PC2中的所有类之间实现了很好的分隔,但是在这里Dim1和Dim2似乎仅分隔了3种行为。这是否意味着这三种行为比所有其他行为的相异性更高(因此MDS会尝试在变量之间找到最大的相异性,但不一定要在第一步中找到所有变量)?这三个群集的位置(例如在Dim1和Dim2中)指示什么?由于我对RI不太熟悉,因此在该图上绘制图例也有困难(但是我知道不同颜色的含义),但是也许有人可以帮忙吗?非常感谢!! 我在RandomForest中添加使用ClassCenter函数绘制的图。此功能还使用接近矩阵(与MDS图相同)来绘制原型。但是仅仅从查看六个不同行为的数据点来看,我不明白为什么邻近矩阵会像这样绘制我的原型。我还尝试了虹膜数据的classcenter函数,并且可以正常工作。但是似乎不适用于我的数据... 这是我用于此情节的代码 be.rf <- randomForest(Behaviour~., data=be, prox=TRUE, importance=TRUE) class1 <- classCenter(be[,-1], be[,1], be.rf$prox) Protoplot <- plot(be[,4], be[,7], pch=21, xlab=names(be)[4], ylab=names(be)[7], bg=c("red", "green", "blue", "yellow", "turquoise", "orange") [as.numeric(factor(be$Behaviour))]) points(class1[,4], class1[,7], pch=21, cex=2, bg=c("red", "green", "blue", "yellow", "turquoise", "orange")) 我的课程专栏是第一列,其后是8个预测变量。我将两个最佳预测变量绘制为x和y。

3
荟萃分析的利弊
我一直在考虑对进化的特定研究领域进行一些荟萃分析,但是在我进一步研究之前,我想知道一下。这个过程的正面和负面是什么?例如,不需要进行实际的实验是一个优势(时间和金钱),但是会存在出版偏见(发布更令人兴奋的结果),这将是不利的。 统计期刊上有哪些论文讨论了元分析的利弊?

4
如何测量团簇的形状?
我知道这个问题的定义不明确,但是有些群集往往是椭圆形或位于较低维空间中,而其他群集则具有非线性形状(在2D或3D示例中)。 是否有任何衡量团簇非线性(或“形状”)的方法? 请注意,在2D和3D空间中,查看任何群集的形状都不是问题,但是在高维空间中,要说些有关形状的问题。特别是,是否有任何度量凸簇的方法? 许多其他集群问题启发了我这个问题,在这些问题中人们谈论集群,但没人能看到它们(在高维空间中)。此外,我知道2D曲线存在一些非线性度量。

2
将计数数据用作自变量是否违反任何GLM假设?
我想在拟合逻辑回归模型的同时将计数数据用作协变量。我的问题是: 通过使用非负整数计数作为自变量,我是否违反了逻辑模型(更一般地说,广义线性模型)的任何假设? 我在文献中发现了很多关于将计数数据用作结果而不是协变量的参考。参见非常清晰的论文:“ NE Breslow(1996)广义线性模型:检验假设和加强结论,意大利国家生物技术大会,1995年6月,科尔托纳”,网址为 http://biostat.georgiahealth.edu/~dryu /course/stat9110spring12/land16_ref.pdf。 松散地说,似乎glm假设可以表示为: 残差 链接函数必须正确表示因变量和自变量之间的关系; 没有异常值 是否每个人都知道是否存在其他建议/技术问题,可能建议使用其他类型的模型来处理计数协变量? 最后,请注意,我的数据包含的样本相对较少(<100),并且计数变量的范围可以在3-4个数量级内变化(即某些变量的值在0-10范围内,而其他变量的值可以在0-10之间0-10000)。 一个简单的R示例代码如下: \########################################################### \#generating simulated data var1 <- sample(0:10, 100, replace = TRUE); var2 <- sample(0:1000, 100, replace = TRUE); var3 <- sample(0:100000, 100, replace = TRUE); outcome <- sample(0:1, 100, replace = TRUE); dataset <- data.frame(outcome, var1, …


1
在文献中是否知道这种重新采样时间序列的方法?它有名字吗?
我最近在寻找重新采样时间序列的方法, 大约保留长存储进程的自相关。 保留观测值的范围(例如,重新采样的整数时间序列仍然是整数的时间序列)。 如果需要,可能只影响某些比例尺。 我针对长度为的时间序列提出了以下排列方案:2N2N2^N 通过成对的连续观测值对时间序列进行分类(有这样的分类)。分别以概率翻转它们中的每一个(即,从索引到)。2N−12N−12^{N-1}1:22:11/21/21/2 通过连续的观察值对获得的时间序列进行分类(其中有这样的分类)。用概率反转它们中的每一个(即从索引到索引)独立性。2 N - 24442N−22N−22^{N-2}1:2:3:44:3:2:11/21/21/2 与尺寸的仓重复该步骤,,...,总是逆转与概率仓。16 2 Ñ - 1 1 / 28881616162N−12N−12^{N-1}1/21/21/2 这种设计纯粹是经验性的,我正在寻找已经针对这种排列发布的作品。我也乐于接受其他排列或重采样方案的建议。

5
有没有检测异常值的简单方法?
我想知道是否有一种检测异常值的简单方法。 对于我的一个项目,基本上是受访者一周内参加体育锻炼的次数与一周内他们在家里吃饭(快餐)的次数之间的相关性,我画了一个散点图,从字面上删除了极端的数据点。(散点图显示负相关。) 这是基于价值判断(基于散点图,这些数据点显然是极端的)。我没有做任何统计检验。 我只是想知道这是否是一种处理异常值的好方法。 我有350个人的数据,因此丢失(说)20个数据点对我来说并不担心。

5
一类文字怎么做分类?
我必须处理文本分类问题。Web搜寻器搜寻特定域的网页,对于每个网页,我都想找出它是否仅属于一个特定类别。也就是说,如果我将此类称为Positive,则每个已抓取的网页都属于Positive类或Non-Positive类。 我已经有大量关于正面课程的培训网页。但是,如何为非阳性课程创建尽可能具有代表性的训练集呢?我的意思是,我基本上可以在该课程中使用所有内容。我可以收集一些绝对不属于正类的任意页面吗?我确定文本分类算法的性能(我更喜欢使用朴素贝叶斯算法)在很大程度上取决于我为非正类选择的网页。 那我该怎么办?有人可以给我个建议吗?非常感谢你!

1
除了Kolmogorov-Smirnov检验之外,还有其他方法可用于校正带约束的数据吗?
我从两个样本(对照样本和处理样本)中得到了一堆数据,每个样本都包含数千个值,这些值将在R中进行显着性检验。理论上,这些值应该是连续的,但是由于测量软件进行了四舍五入,因此它们不是“他们之间建立了联系。分布是未知的,并且对照分布和处理过的分布的形状可能不同,因此我想使用非参数检验来比较样本中的差异是否对10个不同因素有显着影响。 我曾考虑过使用Kolmogorov-Smirnov检验,但是它并不真正适用于平局。我最近偶然发现了一个名为Matching的新R库,该库执行KS测试的引导版本并可以容忍联系。现在,这真的是一个好主意,还是应该改用其他测试?我是否需要调整p值?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.