统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
R中的复数回归图
我需要绘制复杂的图形以进行可视数据分析。我有2个变量和大量案例(> 1000)。例如(如果使分散度减少为“正常”,则为100): x <- rnorm(100,mean=95,sd=50) y <- rnorm(100,mean=35,sd=20) d <- data.frame(x=x,y=y) 1)我需要以点大小绘制原始数据,对应于巧合的相对频率,因此plot(x,y)这不是一种选择-我需要点大小。要做到这一点应该怎么做? 2)在同一图上,我需要绘制95%的置信区间椭圆和代表相关性变化的线(不知道如何正确命名)-像这样: library(corrgram) corrgram(d, order=TRUE, lower.panel=panel.ellipse, upper.panel=panel.pts) 但两个图都在一个图上。 3)最后,我需要在此基础上绘制一个生成的linar回归模型: r<-lm(y~x, data=d) abline(r,col=2,lwd=2) 但错误范围...类似于QQ绘图: 但是如果可能的话,会出现拟合错误。 所以问题是: 如何在一张图表上实现所有这些?

4
测试统计软件
哪些技术/方法可用于测试统计软件?我对使用最大似然进行参数估计的程序特别感兴趣。 将结果与其他程序或已发布资源中的结果进行比较并不总是可能的,因为在我编写自己的程序的大多数时候,这是因为所需的计算尚未在现有系统中实现。 我并不是在坚持可以保证正确性的方法。我会对可以捕获部分错误的技术感到满意。

1
替代漏斗图,无需使用标准误差(SE)
在提交荟萃分析之前,我想作一个漏斗图以测试异质性和发表偏见。我有合并的效应大小和每个研究的效应大小,它们的取值范围是-1至+1。我有每个研究的患者和对照的样本量n1,n2。由于无法计算标准误差(SE),因此无法执行Egger回归。我不能在垂直轴上使用SE或precision = 1 / SE。 问题 我还能在水平轴突上用效应大小在垂直轴上用总样本大小n(n = n1 + n2)进行漏斗图吗? 这样的漏斗图应如何解释? 一些发表的论文提出了这样的漏斗图,在垂直轴上具有总样本大小(已发布的PMID:10990474、10456970)。同样,维基百科漏斗图维基对此也表示同意。但是,最重要的是,Mathhias Egger在BMJ 1999上的论文(PubMed PMID:9451274)显示了这样的漏斗图,没有SE,只有垂直轴上的样本大小。 更多问题 当标准误差未知时,这样的图可接受吗? 它与标准轴突上SE或presicion = 1 / SE的经典漏斗图相同吗? 它的解释不同吗? 我应该如何设置直线以形成等边三角形?

2
RNG,R,mclapply和计算机集群
我在R和计算机集群上运行模拟,并且遇到以下问题。在每台X台计算机上运行: fxT2 <- function(i) runif(10) nessay <- 100 c(mclapply(1:nessay, fxT2), recursive=TRUE) 有32台计算机,每台计算机具有16个核心。但是,大约2%的随机数是相同的。您将采取什么策略来避免这种情况? 通过设置等待时间(即,将每个作业发送到X台计算机的时间延迟了几秒钟),我已经能够避免fxT2出现此问题。但是,对于fxt2来说似乎是非常特殊的。 问题在于,实际上fxT2是一项涉及伪随机数的漫长任务。在过程的最后,我希望得到同一统计实验的X * nessay复制,而不是 nessay复制。如何确保确实如此,是否有办法检查?

1
如何量化功能冗余?
我具有用于解决分类问题的三个功能。最初,这些功能产生布尔值,因此我可以通过查看正向分类和负向分类重叠多少来评估其冗余度。现在,我扩展了功能以生成实际值(分数),并且我想再次分析其冗余度,但是我完全不知道该怎么做。谁能为我提供有关如何实现此目标的指示或想法? 我知道这个问题很模糊,这是因为我对统计数据没有很强的掌握。因此,如果您对我没有答案,也许您有一些问题可以帮助我更好地理解自己。 编辑:我目前正在浏览有关该主题的维基百科,我感觉我想要的是相关系数,但是我仍然不确定这是否是正确的方法,以及许多可用系数中的哪个合适。 编辑2:在布尔型情况下,我首先为每个功能创建了真实的样本集。那么,两个特征之间的相关性就是这些集合的交集大小超过这些集合的并集大小。如果此值为1,则它们是完全冗余的,因为始终相同。如果为0,则它​​们永远不会相同。

4
从电子邮件地址到准随机数[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 2年前关闭。 我的目标: 我想要一个具有电子邮件地址并输出1、2、3或4的准随机数的函数。 一点细节: 通过准随机数,我的意思是给定一个典型的电子邮件地址,获得值1、2、3或4的概率大致相等,并且电子邮件地址的明显系统属性(例如域名)不会影响获得值1、2、3或4的可能性。 一点背景: 我有一个以询问方式编写的在线实验,参与者有两次登录。我想将参与者随机分配到四个组之一。尽管对于一个会话来说这很容易做到(我只能使用随机数生成器),但是我需要某种方式来记住跨会话的分配。因此,我认为我可以从参与者电子邮件中提取一个准随机组分配。我在可用的功能集中也受到限制(完整列表请参见此处)。字符串函数是:较低上部大写concat搜索replaceall包含以结尾开头的字符串,带有子字符串trim trimright trimleft长度格式求值 初步想法: 我考虑过尝试提取电子邮件地址的一组功能,这些功能返回的概率分别为1、2、3或4。然后,我可以对这些属性求和并得到mod 4 plus 1。因此,假设类似中心极限定理,我可能会接近。 我可能想到的功能: 字符串长度 第一个“ a”,“ b”等的位置

4
有关统计基础概念的资源,而不是应用统计中使用的技术
哪本书对统计学中的基本概念最彻底的处理?我并不需要一本关于计算和程序方法细节的书,我主要是对一本能彻底解释基本概念的书感兴趣……对核心思想的直观/插图/视觉方法...而不是负担书的大小是没有问题的,即使是大容量的多卷文本也可以做到,甚至连网络资源也可以做到。
10 references 

1
在R中使用stats包进行kmeans聚类
我很难理解集群程序包的一两个方面。我正在密切关注Quick-R中的示例,但不了解分析的一两个方面。我已经包含了用于此特定示例的代码。 ## Libraries library(stats) library(fpc) ## Data mydata = structure(list(a = c(461.4210925, 1549.524107, 936.42856, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 131.4349206, 0, 762.6110846, 3837.850406), b = c(19578.64174, 2233.308842, 4714.514274, 0, 2760.510002, 1225.392118, 3706.428246, 2693.353714, 2674.126613, 592.7384164, 1820.976961, 1318.654162, 1075.854792, 1211.248996, 1851.363623, 3245.540062, 1711.817955, 2127.285272, …
10 r  clustering 

1
成功的实际应用中的计量经济学方法的书面/可复制示例?
这个问题听起来可能很广泛,但这就是我想要的。我知道有许多关于计量经济学方法的优秀书籍,以及关于计量经济学技术的许多出色的说明性文章。如此CrossValidated 问题中所述,甚至还有极好的可重复的计量经济学示例。实际上,此问题中的示例与我要寻找的非常接近;这些示例中唯一缺少的是它们仅是研究报告,而没有提及研究结果在实际应用中的表现。 我正在寻找的是计量经济学理论在现实世界中应用的已记录/可复制的示例,这些示例理想地具有以下特征: 它们应该是可重复的,即,包含的详细描述(并指针)的数据,计量技术,和代码。理想情况下,代码将使用R语言。 根据详细量化的成功指标,应该有详细的文档显示该技术在现实世界中取得了成功(例如“该技术有助于增加收入,因为它可以改善需求预测,这是其中涉及的数字”) 我在这里广泛使用“ 计量经济学 ”一词-我的意思是任何种类的数据挖掘,统计数据分析,预测,预测或机器学习技术。查找此类示例的一个直接问题是:计量经济学的许多成功应用都是在营利性环境中完成的,因此是专有的,因此,如果一项技术行之有效,则可能不会公开(特别是在专有交易的情况下)策略),但我仍然希望有一些已发布的示例至少具有上述属性(2),如果不是同时具有(1)和(2)。

2
JAGS中的审查/截断
我有一个关于如何在JAGS中解决审查问题的问题。 我观察到X值存在测量误差的双变量混合法线。我想对观察到的检查值的真正基础“手段”建模。 ⌈ X牛逼[R ü è+ ε ⌉ = Xø b 小号Ë - [R v ë d ε 〜Ñ(0 ,s ^ d= .5 )⌈XŤ[RüË+ϵ⌉=XØbsË[RvËd ϵ〜ñ(0,sd=.5)\begin{align*} \lceil x_{true}+\epsilon \rceil = x_{observed} \ \epsilon \sim N(0,sd=.5) \end{align*} 这是我现在所拥有的: for (i in 1:n){ x[i,1:2]~dmnorm(mu[z[i],1:2], tau[z[i],1:2,1:2]) z[i]~dcat(prob[ ]) } Y也有测量误差。我想做的是这样的: for (i in 1:n){ …

4
构建与Ross Quinlan C5.0的MATLAB和R接口
我正在考虑为Ross Quinlan的C5.0构建MATLAB和R接口(对于不熟悉它的人,C5.0是决策树算法和软件包;是C4.5的扩展),而我试图了解我需要编写的组件。 我在这里找到的有关C5.0的唯一文档在这里,这是See5(C5.0的Windows界面)的教程。该焦油文件带有一个Makefile,但没有自述文件或任何其他文件。 根据我在上面的教程中所读的内容,C5.0使用基于ASCII的表示形式来处理输入和输出,并且我还在考虑构建一个接口,该接口直接在MATLAB或R和C5.0之间传递二进制数据。其他任何机器学习/分类软件都使用C5.0的数据表示吗? 之前有人尝试过建立针对ID3,C4.5或C5.0的MATLAB或R接口吗? 谢谢

2
R和SAS中的岭回归实现之间的区别
我已经阅读了《应用线性统计模型》第5版第11章中对岭回归的描述。岭回归是根据此处可用的身体脂肪数据完成的。 教科书与SAS中的输出匹配,在拟合模型中反变换系数为: Y=−7.3978+0.5553X1+0.3681X2−0.1917X3Y=−7.3978+0.5553X1+0.3681X2−0.1917X3 Y=-7.3978+0.5553X_1+0.3681X_2-0.1917X_3 从SAS显示为: proc reg data = ch7tab1a outest = temp outstb noprint; model y = x1-x3 / ridge = 0.02; run; quit; proc print data = temp; where _ridge_ = 0.02 and y = -1; var y intercept x1 x2 x3; run; Obs Y Intercept X1 X2 …

3
如何从数据样本中估计Zipf截断分布的参数?
我对Zipf的估算参数有问题。我的情况如下: 我有一个样本集(从产生应遵循Zipf分布的调用的实验中测得)。我必须证明此生成器确实会生成带有zipf分发的调用。我已经阅读了此问答,如何从一组最高频率中计算Zipf定律系数?但由于使用了截短的分布,所以结果很差。例如,如果我在生成过程中将“ s”值设置为“ 0.9”,则如果我尝试估算报告的“问题与答案”中所写的“ s”值,那么我将获得等于0.2 ca的“ s”。我认为这是由于我使用了TRUNCATED发行版(我必须用截断点来限制zipf,它被右截断了)。 如何使用截断的zipf分布估算参数?

3
指数模型的估计
指数模型是由下面的等式所描述的模型: ÿ一世^= β0⋅ èβ1个X1 我+ … + βķXķ 我yi^=β0⋅eβ1x1i+…+βkxki\hat{y_{i}}=\beta_{0}\cdot e^{\beta_{1}x_{1i}+\ldots+\beta_{k}x_{ki}} 用于估计此类模型的最常见方法是线性化,可以通过计算双方的对数轻松完成。还有哪些其他方法?在某些观察中,我对那些能够处理特别感兴趣ÿ一世= 0yi=0y_{i}=0。 更新31.01.2011 我知道这个模型不能产生零的事实。我将详细说明我要建模的内容以及为什么选择此模型。假设我们要预测客户在商店中花了多少钱。当然,许多客户只是在寻找而他们什么都没买,这就是为什么有0的原因。我不想使用线性模型,因为它会产生很多负值,这毫无意义。另一个原因是该模型的确非常好,比线性模型好得多。我已经使用遗传算法估算了这些参数,因此它不是“科学”的方法。现在,我想知道如何使用更科学的方法来解决问题。也可以假设大多数或什至所有变量都是二进制变量。

1
绘制分段回归线
除了lines用于单独绘制每个段或使用之外,是否有办法绘制像这样的分段模型的回归线geom_smooth(aes(group=Ind), method="lm", fill=FALSE)? m.sqft <- mean(sqft) model <- lm(price~sqft+I((sqft-m.sqft)*Ind)) # sqft, price: continuous variables, Ind: if sqft>mean(sqft) then 1 else 0 plot(sqft,price) abline(reg = model) Warning message: In abline(reg = model) : only using the first two of 3regression coefficients 谢谢。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.