统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
功率分析,用于生存分析
如果我假设基因签名可以识别出较低的复发风险,即20%的人群中的事件发生率降低0.5(危险比为0.5),并且我打算使用回顾性队列研究的样本是否需要针对两个假设的组中不相等的数字来调整样本量? 例如,使用Collett,D:《医学研究中的生存数据建模》,第二版-2003年第二版。可以使用以下方法找到所需的事件总数d, d=(Zα/2+Zβ/2)2p1p2(θR)2d=(Zα/2+Zβ/2)2p1p2(θR)2\begin{equation} d = \frac{(Z_{\alpha/2} + Z_{\beta/2})^2}{p_1 p_2 (\theta R)^2} \end{equation} 其中和Z _ {\ beta / 2}分别是标准正态分布的上\ alpha / 2和上\ beta / 2点。Zα/2Zα/2Z_{\alpha/2}Zβ/2Zβ/2Z_{\beta/2}α/2α/2\alpha/2β/2β/2\beta/2 对于特定的值, p1=0.20p1=0.20p_1 = 0.20 p2=1−p1p2=1−p1p_2 = 1 - p_1 θR=−0.693θR=−0.693\theta R = -0.693 α=0.05α=0.05\alpha = 0.05,所以Z0.025=1.96Z0.025=1.96Z_{0.025}= 1.96 β=0.10β=0.10\beta = 0.10,所以Z0.05=1.28Z0.05=1.28Z_{0.05} = 1.28, 并θR=logψR=log0.50=−0.693θR=log⁡ψR=log⁡0.50=−0.693\theta R = \log …



2
如何处理不存在(不丢失)的数据?
我从未真正找到任何好的文本或示例来说明如何处理任何分类器输入的“不存在”数据。我已经阅读了很多有关丢失数据的信息,但是对于与多变量输入相关的不存在或不存在的数据,该怎么办。我了解这是一个非常复杂的问题,并且会根据所使用的培训方法而有所不同... 例如,如果尝试使用良好的准确数据来预测多个跑步者的运动时间。在许多输入中,许多中可能的变量是: 输入变量-第一次跑步(是/否) 输入变量-前一圈时间(0-500秒) 输入变量-年龄 输入可变高度。。。更多输入变量等 &Output Predictor-预测的延迟时间(0-500秒) 可以通过几种方式(“ 1”)计算“ 2.之前的转圈时间”的“缺失变量”。第一次跑步者将始终等于N。但是对于初次跑步的“不存在数据”(其中“ 1.初次跑步” = Y),我应该给“ 2”赋予什么价值/待遇。前一圈吗? 例如,分配“ 2。之前的“ -99”或“ 0”之间的圈速会严重影响分布,使新跑步者表现良好。 我目前的培训方法是使用Logistic回归,SVM,NN和决策树

3
如何在3维单位球中生成均匀分布的点?
我已经发布了一个先前的问题,这是相关的,但是我认为最好启动另一个线程。这次,我想知道如何在3-d单位球体内生成均匀分布的点,以及如何从视觉和统计角度检查分布?我看不到那里发布的策略可以直接转移到这种情况。


1
预测长进程
我用双态处理工作在为XŤXŤx_t{ 1 ,− 1 }{1个,-1个}\{1, -1\}吨= 1 ,2 ,...Ť=1个,2,…t = 1, 2, \ldots 自相关函数表示一个具有长内存的过程,即它显示幂律衰减为指数<1的幂律。 > library(fArma) > x<-fgnSim(10000,H=0.8) > x<-sign(x) > acf(x) 我的问题:仅给出自相关函数,是否有一种规范的方法可以最佳地预测序列中的下一个值?预测的一种方法就是简单地使用 X^(t )= x (t − 1 )X^(Ť)=X(Ť-1个)\hat{x}(t) = x(t-1) 的分类率为,其中是滞后1自相关,但我认为必须考虑长内存结构才能做得更好。(1 + ρ1个)/ 2(1个+ρ1个)/2(1 + \rho_1) / 2ρρ\rho

2
使用Dynlm R包进行1步提前预测
我已经使用dynlm包对具有多个自变量的模型进行了拟合,其中一个是因变量的滞后。 假设我对自变量有1步超前预测,如何对因变量有1步超前预测? 这是一个例子: library(dynlm) y<-arima.sim(model=list(ar=c(.9)),n=10) #Create AR(1) dependant variable A<-rnorm(10) #Create independant variables B<-rnorm(10) C<-rnorm(10) y<-y+.5*A+.2*B-.3*C #Add relationship to independant variables data=cbind(y,A,B,C) #Fit linear model model<-dynlm(y~A+B+C+L(y,1),data=data) #Forecast A<-c(A,rnorm(1)) #Assume we already have 1-step forecasts for A,B,C B<-c(B,rnorm(1)) C<-c(C,rnorm(1)) y=window(y,end=end(y)+c(1,0),extend=TRUE) newdata<-cbind(y,A,B,C) predict(model,newdata) 这是使用dyn包的示例,该示例有效。 library(dyn) #Fit linear model model<-dyn$lm(y~A+B+C+lag(y,-1),data=data) #Forecast predict(model,newdata)the dyn …

6
在R中运行mlogit函数后进行预测
这是我想做的,但是似乎没有predict办法进行mlogit。有任何想法吗? library(mlogit) data("Fishing", package = "mlogit") Fish <- mlogit.data(Fishing, varying = c(2:9), shape = "wide", choice = "mode") Fish_fit<-Fish[-1,] Fish_test<-Fish[1,] m <- mlogit(mode ~price+ catch | income, data = Fish_fit) predict(m,newdata=Fish_test)

3
由Levene或Bartlett检验方差同质性产生的p值的解释
我对一项实验的一组数据进行了Levene和Bartlett的检验,以验证我没有违反ANOVA的方差均质性假设。如果您不介意的话,我想与大家确认我没有做任何错误的假设 这两个测试返回的p值是我的数据(如果再次使用相等方差生成的数据)相同的概率。因此,通过使用这些检验,可以说我没有违反方差分析关于方差均匀性的假设,我只需要一个高于所选alpha水平(例如0.05)的p值? 例如,根据我当前使用的数据,巴特利特检验返回p = 0.57,而莱文(Levene)检验(我们称其为Brown-Forsythe Levene型检验)得出ap = 0.95。这意味着,无论我使用哪种测试,我都可以说我的数据符合假设。我有什么错误吗? 谢谢。

2
ggplot2中如何通过连续交互来连续绘制一个图?
假设我有数据: x1 <- rnorm(100,2,10) x2 <- rnorm(100,2,10) y <- x1+x2+x1*x2+rnorm(100,1,2) dat <- data.frame(y=y,x1=x1,x2=x2) res <- lm(y~x1*x2,data=dat) summary(res) 我想通过连续交互来绘制连续图,以使x1在X轴上,而x2用3条线表示,一条在Z分数为0时代表x2,在Z分数为+1时代表另一条,而在a Z分数为-1,每行分别有单独的颜色和标签。如何使用ggplot2执行此操作? 例如,它可能看起来像这样(尽管当然使用不同的彩色线条而不是不同的线条类型):

5
测量击中本垒打的均值回归
棒球之后的任何人都可能听说过多伦多何塞·包蒂斯塔(Jose Bautista)的MVP型表现。在之前的四年中,他每个赛季打出大约15次本垒打。去年他达到了54岁,在棒球历史上仅次于12位球员。 在2010年,他的薪水为240万,他要向车队索取2011年的1050万。他们出价760万。如果他能在2011年再次重申这一点,那么他将很容易获得这两个值。但是他重复的几率是多少?我们能期望他回归到平均水平有多难?我们可以预期他有多少表现是偶然的?我们可以预期他的2010年调整后的均值回归是什么?我该如何解决? 我一直在研究拉曼棒球数据库,并提出了一个查询,该查询返回前五个赛季中所有至少拥有50支蝙蝠的球员的本垒打总数。 表格看起来像这样(第10行中的Jose Jose Bautista注意) first last hr_2006 hr_2007 hr_2008 hr_2009 hr_2010 1 Bobby Abreu 15 16 20 15 20 2 Garret Anderson 17 16 15 13 2 3 Bronson Arroyo 2 1 1 0 1 4 Garrett Atkins 29 25 21 9 1 5 Brad Ausmus 2 …
11 r  regression  modeling 

2
我可以用朴素的贝叶斯分类器预测什么样的事情?
我是统计学的初学者(仅参加了一门大学课程),但是我有编程背景。 我刚刚开始使用针对Ruby的贝叶斯分类器库,并且正在寻找想法进行分析。 现在,我在搞乱Tweet的分类,但是您有什么想法吗? 更重要的是,我如何了解哪种数据类型适合朴素的贝叶斯分类。 谢谢。

2
检测时间序列的变化
我遇到了一张应用程序原型的图片,该原型发现了交通数据中的重大变化(“趋势”,而不是峰值/离群值): 我想编写一个能够做到这一点的程序(Java,或者可选的R)-但是由于我的统计技能有点生锈,因此我需要再次深入探讨该主题。 因此,我应该使用/研究什么方法/算法?

4
由于Y和X的相关性,如何在解释方差中表示增益?
我正在寻找如何(直观地)向大一学生解释简单的线性相关性。 可视化的经典方法是给出带有直线回归线的Y〜X散点图。 最近,我想到了通过向图添加3张图像来扩展此类图形的想法,剩下的是:y〜1,然后是y〜x,resid(y〜x)〜x,最后是散点图残差(y〜x)〜1(以平均值为中心) 这是这种可视化的示例: 和产生它的R代码: set.seed(345) x <- runif(50) * 10 y <- x +rnorm(50) layout(matrix(c(1,2,2,2,2,3 ,3,3,3,4), 1,10)) plot(y~rep(1, length(y)), axes = F, xlab = "", ylim = range(y)) points(1,mean(y), col = 2, pch = 19, cex = 2) plot(y~x, ylab = "", ) abline(lm(y~x), col = 2, lwd = …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.