统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
插值可保留每周平均值的流感数据
编辑 我找到了一篇准确描述我所需程序的论文。唯一的不同是,论文将每月均值数据插值到每日,同时保留了每月均值。我很难在中实施该方法R。任何提示表示赞赏。 原版的 对于每周,我有以下计数数据(每周一个值): 医生会诊数 流感病例数 我的目标是通过插值获得每日数据(我想到了线性或截断的样条曲线)。重要的是,我要保留每周平均值,即每日内插数据的平均值应等于本周的记录值。此外,插值应平滑。可能出现的一个问题是某个星期少于7天(例如,在一年的开始或结束时)。 对此,我将不胜感激。 非常感谢。 以下是1995年的示例数据集(已更新): structure(list(daily.ts = structure(c(9131, 9132, 9133, 9134, 9135, 9136, 9137, 9138, 9139, 9140, 9141, 9142, 9143, 9144, 9145, 9146, 9147, 9148, 9149, 9150, 9151, 9152, 9153, 9154, 9155, 9156, 9157, 9158, 9159, 9160, 9161, 9162, 9163, 9164, 9165, 9166, 9167, 9168, …

1
对混合效应模型的预测:如何处理随机效应?
让我们考虑这个假设的数据集: set.seed(12345) num.subjects <- 10 dose <- rep(c(1,10,50,100), num.subjects) subject <- rep(1:num.subjects, each=4) group <- rep(1:2, each=num.subjects/2*4) response <- dose*dose/10 * group + rnorm(length(dose), 50, 30) df <- data.frame(dose=dose, response=response, subject=subject, group=group) 我们可以使用lme随机效应模型对响应进行建模: require(nlme) model <- lme(response ~ dose + group + dose*group, random = ~1|subject, df) 我想使用predict该模型的结果来获取例如第1组的一般主题对剂量10的响应: pred <- …

1
自举标准误差和置信区间是否适合违反均等假设的回归?
如果在标准OLS回归中违反了两个假设(误差的正态分布,均方差),自举标准误差和置信区间是否是一种适当的替代方法,以获得关于回归系数的重要性的有意义的结果? 具有自举标准误差和置信区间的显着性测试是否仍可以“异方差”地“起作用”? 如果是,在这种情况下可以使用的适用置信区间(百分位数,BC,BCA)是多少? 最后,如果在这种情况下自举是合适的,那么需要阅读和引用哪些相关文献才能得出这个结论?任何提示将不胜感激!

3
在R中对大数据进行聚类并且与采样相关吗?
我是数据科学的新手,在查找R中具有200,000行和50列的数据集中的聚类时遇到问题。 由于数据同时具有数字变量和名义变量,因此使用Euclidean距离度量的K-means之类的方法似乎不是合适的选择。因此,我转向接受距离矩阵作为输入的PAM,agnes和hclust。 菊花方法可以处理混合类型的数据,但距离矩阵太大:200,000乘以200,000,比2 ^ 31-1(R 3.0.0之前的向量长度限制)大得多。 昨天发布的新R 3.0.0支持长度大于2 ^ 31-1的长向量。但是200,000 x 200,000的双矩阵需要大于16Gb的连续RAM,这在我的机器上是不可能的。 我读过有关并行计算和bigmemory包的信息,但不确定它们是否对您有帮助:如果我使用的是雏菊,它将生成一个大矩阵,该矩阵无论如何都无法容纳在内存中。 我还阅读了有关采样的文章: 采样与“大数据”时代相关吗? 因此,就我而言,对数据集使用抽样,对样本进行聚类然后推断整个数据集的结构是否相关? 你能给我一些建议吗?谢谢! 关于我的机器: R版本3.0.0(2013-04-03) 平台:x86_64-w64-mingw32 / x64(64位) 操作系统:Windows 7 64bit 内存:16.0GB

1
权变表中的权变是什么?
该韦氏字典定义一个偶然事件或情况为 1 : likely but not certain to happen : possible 2 : not logically necessary; especially : empirical 3 a : happening by chance or unforeseen causes b : subject to chance or unseen effects : unpredictable c : intended for use in circumstances not completely foreseen 4 : …


3
我如何根据球员的获胜历史来预测躲避球队获胜的几率?
想象一下,世界上有80位躲避球运动员。他们每个人都以随机的顺序与其他79名球员一起玩了数千场躲避球游戏。这是一个没有球队的世界(例如,每场比赛每个球员都有被选拔的机会)。我知道每个球员的先前获胜率(例如,一个赢得了之前所有游戏的46%,另一个赢得了他之前所有游戏的56%)。可以说一场比赛即将来临,我知道每支球队都在比赛。我也知道他们以前的胜率。 根据团队的组成来计算每个团队获胜的概率的最佳方法是什么? 如果需要相对高级的计算(例如,逻辑回归),请告诉我一些细节。我对SPSS非常熟悉,但是我不需要提出后续问题。 此外,我将如何使用档案数据探索方法的准确性?我知道这并不明确,因为大多数玩家都徘徊在40-60%左右,但仍然如此。 具体来说,A队获胜的几率是多少? A-包含先前获胜率分别为52%,54%,56%,58%,60%的个人B-包含先前获胜率为48%,55%,56%,58%,60%的个人 (这只是出于说明目的的一个随机示例。两个非常好的团队。) 编辑:有没有一种方法可以从一个非常简单的算法开始,然后看它是如何工作的?也许我们可以简单地将每支球队的百分比相加,并预测拥有最高百分比的球队将获胜。当然,我们的分类将是不准确的,但是在成千上万的存档游戏中,我们可以看到我们能否预测胜于偶然。


3
两个独立的伽玛随机变量的总和
根据Wikipedia关于Gamma分布的文章: 如果和ÿ 〜ģ 一米米一个(b ,θ ),其中X和ÿ是独立随机变量,则X + ý 〜ģ 一米米一个(一个+ b ,θ )。X〜ģ 一米米一个(一,θ )X∼Gamma(a,θ)X\sim\mathrm{Gamma}(a,\theta)ÿ〜ģ 一米米一个(b ,θ )Y∼Gamma(b,θ)Y\sim\mathrm{Gamma}(b,\theta)XXXÿYYX+ Y〜ģ 一米米一个(一个+ b ,θ )X+Y∼Gamma(a+b,θ)X+Y\sim \mathrm{Gamma}(a+b, \theta) 但是我没有任何证据。谁能指出我的证据? 编辑:非常感谢Zen,而且我在Wikipedia页面上找到了关于特征函数的答案作为示例。

3
F统计量,F临界值和P值
我对这个领域还很陌生,很难理解基于ANOVA表的结果拒绝零假设的概念。 计算出的F和临界值与p值有何关系? 并且,如果计算出的F大于1,即使p值小于alpha值,这是否始终表明应该拒绝原假设? 很抱歉,如果这些问题表明我无知,但是我今年57岁,缺勤35年后重返校园!谢谢你的帮助。
13 anova 


2
对于随机矩阵,SVD不应完全不解释吗?我究竟做错了什么?
如果我构建一个完全由随机数据组成的二维矩阵,我希望PCA和SVD组件本质上什么也不能解释。 相反,第一个SVD列似乎可以解释75%的数据。怎么可能呢?我究竟做错了什么? 这是情节: 这是R代码: set.seed(1) rm(list=ls()) m <- matrix(runif(10000,min=0,max=25), nrow=100,ncol=100) svd1 <- svd(m, LINPACK=T) par(mfrow=c(1,4)) image(t(m)[,nrow(m):1]) plot(svd1$d,cex.lab=2, xlab="SVD Column",ylab="Singluar Value",pch=19) percentVarianceExplained = svd1$d^2/sum(svd1$d^2) * 100 plot(percentVarianceExplained,ylim=c(0,100),cex.lab=2, xlab="SVD Column",ylab="Percent of variance explained",pch=19) cumulativeVarianceExplained = cumsum(svd1$d^2/sum(svd1$d^2)) * 100 plot(cumulativeVarianceExplained,ylim=c(0,100),cex.lab=2, xlab="SVD column",ylab="Cumulative percent of variance explained",pch=19) 更新资料 谢谢@亚伦。如您所述,解决方法是在矩阵上增加比例,以便数字以0为中心(即平均值为0)。 m <- scale(m, scale=FALSE) 这是校正后的图像,显​​示了对于具有随机数据的矩阵,第一SVD列接近预期的0。
13 r  pca  svd 

2
自相关如何处理?
为此,我有相当深的数学背景,但是我从未真正涉及过时间序列或统计建模。所以你不必对我很温柔:) 我正在阅读有关对商业建筑中的能源使用进行建模的论文,作者提出了这一主张: [出现自相关的出现]是因为该模型是根据能源使用的时间序列数据开发的,该数据固有地是自相关的。时间序列数据的任何纯确定性模型都将具有自相关。如果在模型中包含[更多傅里叶系数],则会发现自相关会降低。但是,在大多数情况下,傅立叶模型的CV较低。因此,该模型对于实际用途而言可能是可以接受的,但实际上并不需要很高的精度。 0.)“时间序列数据的任何纯确定性模型将具有自相关”是什么意思?我可以模糊地理解这是什么意思,例如,如果您有0个自相关,那么您如何期望预测时间序列中的下一个点?可以肯定,这不是一个数学论点,这就是为什么它是0的原因:) 1.)我的印象是自相关基本上杀死了您的模型,但考虑到这一点,我不明白为什么会这样。那么,自相关为什么不好(或好)呢? 2.)我听到的关于自相关的解决方案是区分时间序列。如果没有尝试读取笔者的脑海,为什么一个没有,如果不可忽略的自相关存在做一个差异? 3.)不可忽略的自相关对模型有哪些限制?这是某个假设吗(即使用简单线性回归建模时的正态分布残差)? 无论如何,如果这些是基本问题,我们深表歉意,并在此先感谢您的帮助。

1
了解逻辑回归的预测
我来自逻辑回归模型(R中的glm)的预测并不像我期望的那样介于0和1之间。我对逻辑回归的理解是,您的输入和模型参数线性组合,并且使用对数链接函数将响应转换为概率。由于logit函数的范围是0到1,因此我希望我的预测范围是0到1。 但是,当我在R中实现逻辑回归时,这不是我看到的: data(iris) iris.sub <- subset(iris, Species%in%c("versicolor","virginica")) model <- glm(Species ~ Sepal.Length + Sepal.Width, data = iris.sub, family = binomial(link = "logit")) hist(predict(model)) 如果有的话,predict(model)的输出对我来说看起来很正常。谁能向我解释为什么我得到的值不是概率?

1
AIC / BIC:排列计数多少个参数?
假设我有一个模型选择问题,我正在尝试使用AIC或BIC评估模型。这是简单的有一些数量模型的实值参数。ķkk 但是,如果我们的模型之一(例如Mallows模型)具有置换,加上一些实值参数而不是实值参数,该怎么办?我仍然可以使模型参数的似然性最大化,例如获得置换和参数。但是,为计算AIC / BIC计入多少个参数?p πππ\pipppππ\pi

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.