统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


4
Logistic回归中的模型选择和模型性能
我对逻辑回归中的模型选择和模型性能有疑问。我有基于三个不同假设的三个模型。前两个模型(分别命名为z和x)在每个模型中只有一个解释变量,而第三个模型(分别命名为w)更复杂。我正在使用AIC来选择w模型的变量,然后使用AIC来比较三个模型中最能解释因变量的模型。我发现w模型的AIC最低,现在想对该模型进行一些性能统计,以了解该模型的预测能力。既然我所知道的是,该模型比其他两个模型更好,但并不是那么好。 由于我已经使用所有数据来学习模型(以便能够比较所有三个模型),我该如何提高模型性能?从我收集到的信息来看,我不能仅对使用AIC从模型选择中获得的最终模型进行k折交叉验证,而是需要从头开始并包括所有解释变量,这是正确的吗?我想这是我与AIC选择的最终模型,我想知道它的性能如何,但确实意识到我已经对所有数据进行了训练,因此该模型可能会产生偏差。因此,如果我应该从头开始考虑所有折叠的所有解释变量,那么我将在某些折叠中得到不同的最终模型,我是否可以仅从折叠中选择具有最佳预测能力的模型,并将其应用于完整数据集进行比较AIC与其他两个模型(z和x)一起使用吗?或如何运作? 我的问题的第二部分是有关过度参数化的基本问题。我有156个数据点,其中52个为1,其余为0。对于w模型,我有14个解释变量可供选择,我意识到由于过分参数化,我无法将所有变量都包括在内,我读到您应该只使用因果变量组中的10%,而观察到的数据最少。对我来说只有5个 我正在尝试回答生态学中的一个问题,是否可以选择仅基于生态学就可以解释最佳依存关系的起始变量?或如何选择起始解释变量?完全排除某些变量并不正确。 所以我真的有三个问题: 在具有交叉验证的完整数据集上训练的模型上测试性能是否可以? 如果没有,在进行交叉验证时如何选择最终模型? 我该如何选择起始变量,以便过度参数化? 对不起我的问题和无知。我知道有人问过类似的问题,但仍然有些困惑。赞赏任何想法和建议。

2
在哪里可以找到对测试我自己的机器学习实现有用的数据集?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 6年前关闭。 我目前正在尝试自行实现一些机器学习算法。他们中的许多人具有难以调试的讨厌特性,某些错误不会导致程序崩溃,而是无法按预期方式工作,而且似乎算法给出的结果较弱。 我想以某种方式增加对实现的信心,例如,如果我有一些小型数据集,并带有其他信息“算法X用于Y迭代,并且结果Z在该数据集上”,那将非常有帮助。有人听说过这样的数据集吗?
9 dataset 

6
为什么波动率是金融计量经济学中的重要话题?
我不知道这是否完全是题外话,但我认为就波动率为何在金融计量经济学中成为重要主题,发表意见并提供汇总答案可能会很有用。 我认为这始于投资组合理论,并且需要了解资产收益的潜在第二时刻的属性。随后,Black-Scholes公式和衍生工具的普及使该实体在金融中变得非常重要。

2
动态调整NN架构:发明不必要的东西吗?
我开始了我的博士之旅,而我自己设定的最终目标是开发ANN,以监控他们工作的环境并动态调整体系结构以解决当前的问题。明显的含义是数据的暂时性:如果数据集不是连续的并且不会随时间变化,那么为什么要进行调整呢? 最大的问题是:随着深度学习的兴起,它仍然是一个相关的话题吗?FFNN是否有机会在概念漂移问题中找到自己的位置? 我担心会给线程带来过多的问题,但这并不是完全不合时宜的事情:我知道RNN,但是我对它们的经验有限(可以,没有,或者纯粹是理论上的);我相信在RNN的背景下,动态架构适应必须是一个相关主题。问题是,它是否已经得到回答,我会重新发明轮子吗? PS交叉发布以进行MetaOptimize

3
使用Pearson相关和线性回归的Bonferroni校正
我正在针对3个DV的5个IV(5个人格特质,性格外向,和agree,尽责,神经质,开放)运行统计数据,包括PCT态度,CBT态度,PCT与CBT态度。我还添加了年龄和性别,以查看还有其他影响。 我正在测试以查看人格特征是否可以预测DV的态度。 最初,我对所有变量都使用了Pearson相关性(45个测试)。 主要发现是外向性与PCT态度在p = 0.05相关。但是,当我进行45次测试时,我对Bonferroni进行了alpha = 0.05 / 45 = 0.001的校正,因此这一发现无关紧要。 然后,我对所有变量进行了简单的线性回归,对于PCT态度,外向性再次很重要。如果我进行Bonferroni校正,那么它再次显得微不足道。 问题: 我需要Bonferroni纠正Pearson的相关性吗? 如果我这样做了,因此对PCT的态度无忧无虑,那么进行线性回归还有意义吗? 如果我进行线性回归,是否还需要对此进行Bonferroni校正? 我只报告校正后的值还是未校正和校正后的值?

2
如何从mcmc.list生成类似于plot.bugs和plot.jags生成的图?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 2年前关闭。 R似乎能够从R2WinBUGS :: bugs和R2jags:jags函数生成的bugs和jags对象中输出漂亮的摘要图。 但是,我正在使用该rjags软件包。当我尝试rjags::coda.samples使用R2WinBUGS::plot.mcmc.list结果绘制函数结果时,是每个参数的诊断图(参数密度,链时间序列,自相关)。 下面是我想制作的绘图类型,来自安德鲁· 盖尔曼( Andrew Gelman)的教程“ R中运行WinBuugs和OpenBugs”。这些是使用制作的plot.pugs。 问题是plot.bugs将一个bugs对象作为参数,而plot.mcmc.list将的输出作为参数coda.samples。 这是一个示例(来自coda.samples): library(rjags) data(LINE) LINE$recompile() LINE.out <- coda.samples(LINE, c("alpha","beta","sigma"), n.iter=1000) plot(LINE.out) 我需要的是 一种生成相似的,信息丰富的一页摘要图的方法,类似于 plot.bugs 将转换LINE.out为bug对象的函数,或者


1
涉及高级案例交互时的Cox比例风险模型和系数解释
这是我使用的Coxph模型的摘要输出(我使用R,输出基于最佳最终模型,即包括所有重要的解释变量及其相互作用): coxph(formula = Y ~ LT + Food + Temp2 + LT:Food + LT:Temp2 + Food:Temp2 + LT:Food:Temp2) # Y<-Surv(Time,Status==1) n = 555 coef exp(coef) se(coef) z Pr(>|z|) LT 9.302e+02 Inf 2.822e+02 3.297 0.000979 *** Food 3.397e+03 Inf 1.023e+03 3.321 0.000896 *** Temp2 5.016e+03 Inf 1.522e+03 3.296 0.000979 *** LT:Food …


1
通过以坐标作为预测变量进行回归建模空间趋势
我打算将坐标作为协变量包括在回归方程中,以便针对数据中存在的空间趋势进行调整。之后,我想测试随机变化中空间自相关的残差。我有几个问题: 我应该执行线性回归,其中仅自变量是和坐标,然后测试空间自相关的残差,还是应该不仅包括坐标作为协变量,还包括其他变量,然后测试残差。xxxyyy 如果我期望具有二次趋势,然后不仅包括,还包括,和,那么其中的一些(和)的值将大于阈值-我应该排除那些值较高的变量不重要吗?那我该如何解释趋势,它肯定不再是二次方了?x,yx,yx,yxyxyxyx2x2x^2y2y2y^2xyxyxyy2y2y^2pppppp 我想我应该将和坐标视为其他任何协变量,并通过构造部分残差图来测试它们是否与因变量具有线性关系...但是一旦我对它们进行了变换(如果它们显示它们需要变换),那将不会不再是那种趋势(特别是如果我将,和在二次趋势中)。例如,它可能表明需要转换,而则不需要转换?在这些情况下我应该如何应对?xxxyyyxyxyxyx2x2x^2y2y2y^2x2x2x^2xxx 谢谢。

1
对重复实验进行仿真研究的问题解释了95%的置信区间-我在哪里做错了?
我正在尝试编写R脚本来模拟95%置信区间的重复实验解释。我发现它高估了样本的95%CI中包含某个比例的真实总体值的时间比例。差异不大-大约是96%和95%,但这仍然令我感兴趣。 我的函数samp_n从伯努利分布中随机抽取了一个样本pop_p,然后prop.test()使用连续性校正或更精确地使用来计算95%的置信区间binom.test()。如果真实人口比例pop_p包含在95%CI中,则返回1 。我编写了两个函数,一个使用prop.test(),一个使用binom.test()并具有相似的结果: in_conf_int_normal <- function(pop_p = 0.3, samp_n = 1000, correct = T){ ## uses normal approximation to calculate confidence interval ## returns 1 if the CI contain the pop proportion ## returns 0 otherwise samp <- rbinom(samp_n, 1, pop_p) pt_result <- prop.test(length(which(samp == 1)), samp_n) lb <- pt_result$conf.int[1] …

1
为什么引入随机斜率效应会增大斜率的SE?
我正在尝试分析Year对特定个体组(我有3个组)的变量logInd的影响。最简单的模型: > fix1 = lm(logInd ~ 0 + Group + Year:Group, data = mydata) > summary(fix1) Call: lm(formula = logInd ~ 0 + Group + Year:Group, data = mydata) Residuals: Min 1Q Median 3Q Max -5.5835 -0.3543 -0.0024 0.3944 4.7294 Coefficients: Estimate Std. Error t value Pr(>|t|) Group1 4.6395740 0.0466217 …

3
如何测试/证明数据为零膨胀?
我有一个问题,我认为应该很简单,但无法完全解决。我正在查看种子授粉,我有成簇开花的植物(n = 36),我从每棵植物中采样了3个花簇,并从每个簇中采样了6个种子荚(每个植物总计18个种子荚)。一个豆荚可以授粉0到4个种子。因此,数据是有上限的计数。我发现平均约有10%的种子被授粉,但在给定植物上的授粉量介于1%至30%之间,因此在分散的数据上,当然,在3棵植物上有4个缺失的簇重复,因此不完全对称。 我要问的问题是,这些数据是否支持这种植物需要传粉媒介进行结实的想法。 我发现一个豆荚中种子数量的分布看起来比有更多的0个授粉种子豆荚(16个中有6-9个豆荚)以及更多的3个和4个授粉种子豆荚(每个有2-4个)如果种群中的种子只是随机授粉,这是可以预期的。基本上,我认为这是零膨胀数据的经典示例,首先,昆虫完全不访问花朵(一个零生成器),如果这样做,则在另一个分布中对0-4的种子进行授粉。另一个假设是植物是部分自交的,然后可以预期每个种子都具有相同的授粉概率(此数据表明大约有0.1的机会,这意味着同一荚中的两粒种子有0.01的机会,依此类推) 。 但是我只是想证明数据最适合一种或另一种分布,而不是实际上对数据进行ZIP或ZINB处理。我认为我使用的任何方法都应考虑到授粉种子的实际数量和每棵植物上采样的豆荚的数量。我想到的最好的事情是做某种引导带事情,我只是将给定植物的授粉种子数量随机分配到我采样的种子荚数量中,进行10,000次,看看有多大可能性给定植物的实验数据来自该随机分布。 我只是觉得有些事情比蛮力自举要容易得多,但是经过几天的思考和搜索,我放弃了。我不能仅将其与Poisson分布进行比较,因为它是上限,它不是二项式的,因为我需要以某种方式生成期望的分布。有什么想法吗?而且我正在使用R,所以这里的建议(尤其是如何最优雅地将10,000个n球的随机分布生成到16个可以最多包含4个球的盒子中)。 ADDED 9/07/2012首先,感谢大家的关注和帮助。阅读答案,使我想重新表达我的问题。我要说的是,我有一个假设(种子现在我认为是无效的),即种子在豆荚之间随机授粉,而我的另一种假设是,至少有1个授粉种子的种子荚更可能种子的授粉种子数量多于随机过程所预期的数量。我提供了来自三个工厂的真实数据作为示例,以说明我在说什么。第一列是豆荚中已授粉种子的数量,第二列是具有该种子数的豆荚的频率。 植物1(总共3粒种子:4%授粉) 种子数:: pod.freq 0 :: 16 1 :: 1 2 :: 1 3 :: 0 4 :: 0 植物2(总共19粒种子:26%授粉) num.seeds :: pod.freq 0 :: 12 1 :: 1 2 :: 1 3 :: 0 4 :: 4 植物3(总共16粒种子:22%授粉) num.seeds :: …


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.