统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


1
给定参考人口,估计成功的可能性
假设您有以下情况: 您随着时间的推移观察到1000名保龄球运动员,他们每个人都玩相对较少的游戏(例如1到20)。您指出了每个玩家的罢工百分比超过每个玩家所玩游戏的数量。 一个新的保龄球选手进来,打了10场比赛,得到了3次罢工。 假定任何球员的罢工次数分布为二项式。 我想估计该球员成功的“真实”概率。 请注意以下几点: 这不是现实情况,也不是学校问题,只是一个自省的问题。 我是一名学生,其统计教育水平高于Stats 101课程。我对诸如最大似然估计之类的推论有所了解...所以随时告诉我应该阅读的统计数据领域。 我的问题可能缺少信息,或者如果它对成功概率的分布大致正常是有益的,请告诉我。 非常感谢你

1
将2类模型扩展到多类问题
关于Adaboost的这篇论文提出了一些建议和代码(第17页),以将2类模型扩展到K类问题。我想对此代码进行概括,以便我可以轻松地插入不同的2类模型并比较结果。由于大多数分类模型都具有公式界面和predict方法,因此其中某些应该相对容易。不幸的是,我还没有找到从2类模型中提取类概率的标准方法,因此每个模型都需要一些自定义代码。 这是我编写的用于将K类问题分解为2类问题并返回K模型的函数: oneVsAll <- function(X,Y,FUN,...) { models <- lapply(unique(Y), function(x) { name <- as.character(x) .Target <- factor(ifelse(Y==name,name,'other'), levels=c(name, 'other')) dat <- data.frame(.Target, X) model <- FUN(.Target~., data=dat, ...) return(model) }) names(models) <- unique(Y) info <- list(X=X, Y=Y, classes=unique(Y)) out <- list(models=models, info=info) class(out) <- 'oneVsAll' return(out) } 这是我编写的一种预测方法,用于遍历每个模型并进行预测: predict.oneVsAll <- …


1
使用规则为新数据找到合适的规则
我正在使用R(和arules软件包)来挖掘交易的关联规则。我要做的是构造规则,然后将其应用于新数据。 例如,假设我有很多规则,其中之一就是规范{Beer=YES} -> {Diapers=YES}。 然后,我有了新的交易数据,其中一条记录购买了啤酒,但没有购买尿布。如何确定符合LHS但尚未符合RHS的规则? R示例: install.packages("arules") library(arules) data("Groceries") **#generate Rules omitting second record** rules <- apriori(Groceries[-2],parameter = list(supp = 0.05, conf = 0.2,target = "rules")) 生成的规则是: > inspect(rules) lhs rhs support confidence lift 1 {} => {whole milk} 0.25554200 0.2555420 1.000000 2 {yogurt} => {whole milk} 0.05603010 0.4018964 1.572722 …

2
例如基于星期几的回归
我需要一点帮助才能朝着正确的方向前进。自从我研究了任何统计数据以来已有很长时间了,术语似乎已经改变。 想象一下,我有一组与汽车相关的数据,例如 从A镇到B镇的旅程时间 A镇到B镇的距离 马达的尺寸 驾驶员鞋码 汽车的型号 星期几 我想预测出行时间。 我认为时间和距离之间存在很强的相关性,而与引擎尺寸之间的相关性可能较弱(与鞋子尺寸无关)。大概是多元回归分析/ ANOVA是要使用的工具。但是,如何将星期几包括在内,因为仅将其编码为Sunday = 1,Monday = 2等感觉很错误? 例如,使用过Excel的回归工具后,如何解释结果?大概如果R接近1,这是很好的(尽管如果有很多数据项,看起来好像很小但仍然很重要)。但是某些资料来源将r平方看成SD,因此值接近零是好的。它还显示t Stat,P值,F和重要性F,无论它们是多少。谁能推荐一个好的参考资料?


3
抛硬币时应该使用二项式CDF还是普通CDF?
硬币需要进行公平性测试。翻转50次后,出现30个头。假设硬币是公平的,那么在50次翻转中至少获得30个正面的概率是多少? 我的老师说,解决这个问题的正确方法是 normalcdf(min = .6, max = ∞, p = .5, σ = sqrt(.5 * .5 / 50) = 0.0786 但是,我采用了这样的二项式累积分布函数 1 - binomcdf(n = 50, p = .5, x = 29) = 0.1013 我相信满足二项式分布的标准:单个事件是独立的,只有两种可能的结果(正面对反面),问题的概率恒定(0.5),并且试验次数固定为50然而,显然,这两种方法给出的答案不同,并且模拟支持我的答案(至少运行了几次;很明显,我不能保证您会得到相同的结果)。 我的老师是否认为正态分布曲线也是解决此问题的有效方法是错误的(决不是说正态分布是正态分布,而是n * p和n *(1-p)都大于10),还是我误解了二项式分布?

1
在R中的时间线上绘制事件
是否有R的图库,可以将开始和停止时间的数据帧转换为时间轴图,如下所示: Y轴的唯一含义是它与并发一起堆叠,但并不总是表示并发(请参见中间的间隙)。每个灰色框都是一个事件-数据框的一行。数据框将具有两列,开始时间和停止时间。

1
理发师的难题
我的美发师史黛西(Stacey)总是笑着说,但经常因管理时间而受到压力。今天,斯泰西因我的任命而逾期未交,并且非常抱歉。在理发时,我想知道:她的标准约会应该持续多久?(如果可以暂时忽略客户对干净整数的偏爱)。 需要考虑的是某种“涟漪效应”,一个非常晚的客户可能导致一连串的延迟约会。实际上,理发师由于担心这些压力大的日子而直观地学会间隔越来越久。但是,必须要有一些统计天才才能实现最佳,优雅的解决方案。(如果我们稍微降低现实水平) 假设 a)剪发时间是正态分布的, b)只有一个理发师。 预约时间太长,显然会浪费美发师等待下一次约会的时间。让我们将此浪费的时间花费为每分钟$ 1。 但是,如果约会的时间不够长,下一位客户就会一直等待,这对喜欢客户的史黛西来说是每分钟3美元的沉重成本。 Stacey每天最多工作8个小时,并且有足够的需求来满足自己所能容纳的尽可能多的约会 平均剪发需要30分钟,而且要进行性病。10分钟的开发时间。(我们也假设男人的削减和女人的削减是相同的!) 编辑-有些人正确地指出,Stacey可以在他们指定的时间之前参加早期客户。这增加了另一层复杂性,但是如果我们将其视为一个非常现实的问题,则需要将其包括在内。让我们忘记我的90/10假设,并尝试一个可能接近现实的假设。 有些客户迟到,有些则早。客户的平均延迟时间为2分钟,标准差为2分钟(听起来与实际情况差不多吗?) 她的约会应该多长时间? @alexplanation对不起,我已经把您的目标发布了!我相信R读者会感谢您的回答。

3
有多少个最大的术语 加起来是总数的一半?
考虑 其中是iid,而CLT成立。 几个最大的项加起来等于总数的一半? 例如,10 + 9 + 8(10 + 9 + 8 + 1)/ 2:30%的术语大约占总数的一半。∑Ni=1|Xi|∑i=1N|Xi|\sum_{i=1}^N |X_i|X1,…,XNX1,…,XNX_1, \ldots, X_N≈≈\approx……\dots 定义 sumbiggest( j;X1…XN)≡sum of the j biggest of |X1|…|XN|sumbiggest( j;X1…XN)≡sum of the j biggest of |X1|…|XN| \qquad\text{sumbiggest( j}; X_1 \dots X_N ) \equiv \text{sum of the j biggest of } |X_1| \dots …

4
如何最好地分析基于医院的RCT中的住院时间数据?
我很想知道是否存在关于分析来自RCT的住院时间(LOS)数据的最佳方法的共识。这通常是一个非常偏斜的分布,其中大多数患者在几天到一周内出院,但是其余患者的停留时间非常不可预测(有时甚至很长),形成分布的右尾。 分析选项包括: t检验(假设不可能出现正态性) 曼·惠特尼U检验 对数秩检验 组分配的Cox比例风险模型条件 这些方法中的任何一种具有明显更高的功效吗?

1
增量IDF(反向文档频率)
在文本挖掘应用程序,一个简单的方法是使用启发式创建载体作为文件的紧凑稀疏表示。这对于批处理设置很好,因为整个主体被称为先验,因为i d f要求整个主体Ť ˚F- 我dFtf−idftf-idf我dFidfidf 我d ˚F(t )= 对数| D || {d:吨∈ d} |idf(t)=log⁡|D||{d:t∈d}| \mathrm{idf}(t) = \log \frac{|D|}{|\{d: t \in d\}|} 其中是术语,d是文档,D是文档语料库,而T(未显示)是字典。ŤttddddDDŤTT 但是,通常随着时间的推移会收到新的文档。一种选择是使用现有的,以保持,直到已经收到新的文件一定数量,并且重新计算。但是,这似乎效率很低。如果有人事先查看了所有数据,是否有人知道增量更新方案(可能近似)收敛到该值?或者,是否有另一种方法可以捕获相同的概念,但是可以以增量方式计算?我dFidfidf 还有一个相关的问题,随着时间的流逝,i d f是否仍然是一个好的度量。由于idf捕获了语料词频率的概念,因此可以想象,语料库中较旧的文档(例如,我的语料库包括100多年的期刊文章),因为不同词的频率随时间变化。在这种情况下,实际上是明智的做法是,在使用新的滑动窗口i d f时,将新的文档丢掉。可以想象,当计算出新的矢量时,也可以存储所有以前的i d f矢量,然后,如果我们想检索1920-1930年的文档,则可以使用i d f我dFidfidf我dFidfidf我dFidfidf我dFidfidf根据该日期范围内的文档计算得出。这种方法有意义吗? 编辑:关于字典有一个单独的但相关的问题。随着时间的流逝,将会出现以前没有出现过的新词典术语,因此| T | 将需要增长,因此i d f向量的长度。似乎不会有问题,因为可以将零添加到旧的i d f向量上。ŤTT| Ť||T||T|我dFidfidf我dFidfidf

1
了解Hoeffding不等式中使用的引理的证明
我正在学习拉里·瓦瑟曼(Larry Wasserman)关于统计学的讲义,该讲义以卡塞拉(Casella)和伯格(Berger)为主要教材。我正在研究他的讲义集2,并陷入了霍夫丁不等式中使用引理的推论(第2-3页)。我将在下面的注释中复制证明,在证明之后,我将指出我被卡在的地方。 引理 假设,并且。然后 。E(X)=0E(X)=0\mathbb{E}(X) = 0a≤X≤ba≤X≤b a \le X \le bE(etX)≤et2(b−a)2/8E(etX)≤et2(b−a)2/8\mathbb{E}(e^{tX}) \le e^{t^2 (b-a)^2/8} 证明 由于,我们可以写为的凸组合和,即 其中。通过函数凸性,我们得到a≤X≤ba≤X≤ba \le X \le bXXXaaabbbX=αb+(1−α)aX=αb+(1−α)aX = \alpha b + (1 - \alpha) aα=X−ab−aα=X−ab−a\alpha = \frac{X-a}{b-a}y→etyy→etyy \to e^{ty} etX≤αetb+(1−α)eta=X−ab−aetb+b−Xb−aetaetX≤αetb+(1−α)eta=X−ab−aetb+b−Xb−aetae^{tX} \le \alpha e^{tb} + (1 - \alpha) e^{ta} = \frac{X-a}{b-a} e^{tb} + \frac{b-X}{b-a} e^{ta} 取得双方的期望并使用事实来获得E(X)=0E(X)=0\mathbb{E}(X) …

2
lm的默认诊断图的可能扩展(在R中和一般而言)?
我开始深入研究plot.lm函数,该函数给出了lm的六个图,它们是: 残差与拟合值的关系图 sqrt(|残差|)对拟合值的比例位置图 普通QQ图,库克距离与行标签的图 残差与杠杆的关系图 库克距离与杠杆/(1-杠杆)的关系图 我想知道线性图还存在电流图的其他常见/有用扩展,以及它们如何在R中完成?(也欢迎链接到包装的文章) 因此,boxcox函数(来自{MASS})是另一个有用的诊断图的示例(这样的答案会很好),但是,我对R中lm的现有默认诊断图的变化/扩展感到好奇(尽管一般始终欢迎您对此主题发表其他评论)。 这是我的意思的一些简单示例: #Some example code for all of us to refer to set.seed(2542) x1 <- rnorm(100) x2 <- runif(100, -2,2) eps <- rnorm(100,0,2) y <- 1 + 2*x1 + 3*x2 + eps y[1:4] <- 14 # adding some contaminated points fit <- lm(y~x1+x2) …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.