统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


2
如何为小样本数据选择训练,交叉验证和测试集大小?
假设我的样本量较小,例如N = 100,并且有两个类别。如何为机器学习选择训练,交叉验证和测试集的大小? 我会直觉地选择 训练集大小为50 交叉验证集大小为25,并且 测试大小为25。 但这可能或多或少都有意义。我应该如何真正确定这些价值?我可以尝试其他选择吗(尽管我认为它不是那么可取……过度学习的可能性增加了)? 如果我上两节课以上怎么办?

2
如何更改R randomForests中的分类阈值?
所有物种分布建模文献都认为,当使用输出概率的模型(例如,RandomForests)预测物种的存在/不存在时,选择阈值概率来将物种实际分类为存在或不存在很重要,应该并不总是依赖默认值0.5。我需要一些帮助!这是我的代码: library(randomForest) library(PresenceAbsence) #build model RFfit <- randomForest(Y ~ x1 + x2 + x3 + x4 + x5, data=mydata, mytry = 2, ntrees=500) #eventually I will apply this to (predict for) new data but for first I predict back to training data to compare observed vs. predicted RFpred <- predict(RFfit, …


2
非嵌套模型的广义对数似然比检验
我知道如果我有两个模型A和B,并且A嵌套在B中,那么在给定一些数据的情况下,我可以使用MLE拟合A和B的参数,并应用广义对数似然比检验。特别地,测试的分布应为具有个自由度,其中是和具有的参数数量之差。χ2χ2\chi^2ññnññn一个一个A乙乙B 但是,如果和具有相同数量的参数,但模型未嵌套,会发生什么情况?那就是他们只是不同的模型。有什么方法可以应用似然比检验,还是可以做其他事情?一个一个A乙乙B

1
套袋为何使用自举样品?
套袋是在N个不同的引导样本上创建N个学习者,然后取其预测平均值的过程。 我的问题是:为什么不使用任何其他类型的采样?为什么要使用引导程序样本?
10 bagging 



2
插入符varImp用于randomForest模型
我在了解该varImp函数如何对带有caret包的randomForest模型起作用时遇到了麻烦。在下面的示例中,功能var3使用插入符号varImp函数的重要性为零,但基础的randomForest最终模型对功能var3的重要性为非零。为什么会这样呢? require(randomForest) require(caret) rf <- train(x, y, method = "rf", trControl = trainControl(method = "oob"), importance = TRUE, verbose = TRUE, tuneGrid = data.frame(mtry = num.predictors) ) fm <- rf$finalModel > varImp(f) rf variable importance Overall var1 100.00 var2 80.14 var3 0.00 > importance(fm) %IncMSE IncNodePurity var2 872.7935 40505276 var1 …
10 r  caret  random-forest 

1
与k倍CV相比,延期验证是否更好地近似了“获取新数据”?
我一直在重新思考几个星期前我对一个问题的回答 保持交叉验证可生成单个测试集,该测试集可重复用于演示。我们大家似乎都同意,这在许多方面都是不利的特征,因为通过随机性,一个被保留的集合可能变得没有代表性。此外,您可能最终以过度拟合训练数据的方式过度拟合测试数据。 但是,在我看来,保留样本的静态性质比“ k倍CV”更好地近似为“获取更多数据”,并且避免了跨折平均的问题。但是,我无法为这种感觉提供任何统计依据。我的直觉有逻辑吗? 例如,对于即将到来的项目,我要想到的是首先使用保持验证来构建和测试模型,然后在验证步骤中多次重绘保持集以显示我对预测误差的估计(测试集上的数据)对测试集中的采样误差具有鲁棒性。这是个坏主意吗?之前曾问过这个问题,但从未得到答案。

2
干预与差异
例如,如此处讨论的那样,当使用时间序列数据(也称为“中断时间序列”)进行干预分析时,我的一项要求是估算由于干预导致的总收益(或损失),即获得或损失的单位数(Y变量) )。 我不完全了解如何使用R中的过滤器函数来估计干预函数,而是以蛮力的方式进行了研究,希望它能够在任何情况下都能通用。 假设给定数据 cds<- structure(c(2580L, 2263L, 3679L, 3461L, 3645L, 3716L, 3955L, 3362L, 2637L, 2524L, 2084L, 2031L, 2256L, 2401L, 3253L, 2881L, 2555L, 2585L, 3015L, 2608L, 3676L, 5763L, 4626L, 3848L, 4523L, 4186L, 4070L, 4000L, 3498L), .Dim = c(29L, 1L), .Dimnames = list( NULL, "CD"), .Tsp = c(2012, 2014.33333333333, 12), class = …

2
数据类型(标称/有序/间隔/比率)是否真的应视为变量类型?
例如,这是我从标准教科书中获得的定义 变量-总体或样本的特征。例如 测试中股票或等级的价格 数据-实际观测值 因此,对于两列报表[名称| 收入]列名称将是变量和实际观察值{dave | 100K},{jim | 200K}将是数据 因此,如果我说[名称]列是名义数据,[收入]是比率数据,那么将其描述为变量类型而不是像大多数教科书那样将其描述为数据类型不是更准确吗?我知道这可能是语义,这很好,那就是全部。但是我担心这里可能会丢失一些东西。

3
在R(或一般而言)中是否可能迫使回归系数成为某个符号?
我正在处理一些现实世界的数据,回归模型产生了一些违反直觉的结果。通常,我相信统计数据,但实际上其中一些事情是不正确的。我看到的主要问题是,实际上必须将它们负相关时,一个变量的增加会引起响应的增加。 有没有一种方法可以为每个回归系数强制指定符号?任何这样做的R代码也将不胜感激。 感谢您提供的所有帮助!

4
确定ARIMA建模的参数(p,d,q)
我是统计学和R语言的新手。我想知道为我的数据集确定ARIMA参数的过程。您能帮我使用R并从理论上(如果可能的话)弄清楚吗? 数据范围为1月12日至14年3月,描述了每月的销售量。这是数据集: 99 58 52 83 94 73 97 83 86 63 77 70 87 84 60 105 87 93 110 71 158 52 33 68 82 88 84 这是趋势: 数据没有显示趋势,季节性行为或周期性。
10 r  arima  box-jenkins 

2
可以成倍增长的稳定分布?
卷积下的稳定分布是不变的。稳定分布的哪些子族也通过乘法闭合?从某种意义上说,如果和,则乘积概率密度函数(直到归一化常数)也属于?FFFf∈Ff∈Ff\in Fg∈Fg∈Fg\in F f⋅gf⋅gf \cdot gFFF 注意:我已实质上更改了此问题的内容。但是这个想法本质上是相同的,现在它变得简单得多。我只有部分答案,所以我认为还可以。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.