统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
交叉验证和参数优化
使用10倍交叉验证时,我对参数优化存在疑问。 我想问一下,在每次折叠的模型训练过程中参数是否应该固定,即(1)为每个折叠的平均精度选择一组优化的参数。 要么 (2)我应该为每个折页找到优化参数,然后每个折页使用不同的优化参数来训练其模型,然后分别对折页的测试数据进行测试,最后平均每个折页的准确性作为结果? 交叉验证的正确方法是哪一种?非常感谢。

1
使用bca方法计算置信区间时,为什么R引导程序包会产生错误“估计调整'a'是NA”?
我有一个使用dput上传到这里的数字向量(... / code / MyData.Rdata)。 我想获得bca ci,所以我编写了以下代码: my.mean <- function(dat, idx){ return (mean(dat[idx], na.rm = TRUE)) } boot.out<-boot(data=my.data, statistic = my.mean, R=1000) 但是当我运行以下命令时,我得到了: > boot.ci(boot.out) Error in bca.ci(boot.out, conf, index[1L], L = L, t = t.o, t0 = t0.o, : estimated adjustment 'a' is NA In addition: Warning message: In …
14 r  bootstrap 

3
多元模式的计算有效估计
简短版:估算从连续分布中采样的多维数据集模式的最有效的计算方法是什么? 长版:我有一个数据集,需要估计其模式。该模式与均值或中位数不一致。下面显示了一个示例,这是一个2D示例,但ND解决方案会更好: 目前,我的方法是 在等于模式所需分辨率的网格上计算内核密度估计 寻找最大的计算点 显然,这会在很多不合理的点上计算KDE,如果有很多高维度的数据点或者我希望模式具有良好的分辨率,则这尤其糟糕。 一种替代方法是使用模拟退火,遗传算法等在KDE中找到全局峰。 问题是是否有一种更聪明的方法来执行此计算?

2
估计R中的生存概率
基于生存时间的样本,我想使用Kaplan-Meier估计量来估计某个特定的生存时间的概率。有可能这样做吗?请注意,不一定是事件时间。牛逼牛逼牛逼ññnŤŤtŤŤtRŤŤt
14 r  kaplan-meier 

1
单边置信区间能否覆盖95%
我想知道给定a (-尾)的alpha水平的假设.05,我们能否谈论95%的 置信区间? 例如,我们可以为单面Z或t检验分别构造“单面”和“两面”置信区间吗?给定单边检验,每个置信区间的“解释”是什么? 我对此有些困惑吗?





1
L-BFGS如何工作?
本文的目的是通过最大化正则对数似然来优化一些参数。然后他们计算偏导数。然后作者提到,他们使用标准准牛顿程序L-BFGS优化方程,以优化许多变量的平滑函数(没有更多细节)。 它是如何工作的 ?

4
对一致和渐近无偏的区别的直觉理解
我试图对“一致”和“渐近无偏”一词之间的区别和实际区别获得直观的理解和感觉。我知道他们的数学/统计定义,但是我正在寻找直观的东西。在我看来,看看他们的个人定义,他们几乎是同一回事。我意识到差异一定很细微,但我看不到。我试图将差异可视化,但不能做到。有人可以帮忙吗?

2
柯西分布的样本均值的分布是什么?
通常,当一个人获得某分布的随机样本平均值(样本大小大于30)时,便会获得以平均值为中心的正态分布。但是,我听说柯西分布没有平均值。获取柯西分布的样本均值时,将获得什么分布? 基本上,对于柯西分布,是未定义的,那么是什么,的分布是什么?μ ˉ X ˉ Xμxμx\mu_xμx¯μx¯\mu_{\bar{x}}x¯x¯\bar{x}
14 cauchy 

1
用分类数据解释负二项式GLM的.L和.Q输出
我只是运行负二项式GLM,这是输出: Call: glm.nb(formula = small ~ method + site + depth, data = size.dat, init.theta = 1.080668549, link = log) Deviance Residuals: Min 1Q Median 3Q Max -2.2452 -0.9973 -0.3028 0.3864 1.8727 Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 1.6954 0.1152 14.720 < 2e-16 *** method.L -0.6828 0.1637 -4.171 …


1
对数回归最大化的逻辑回归是否也必然使线性模型的AUC最大化?
给定的数据集与二元结果ÿ∈ { 0 ,1 }ñy∈{0,1}ny\in\{0,1\}^n和一些预测矩阵X∈Rn×pX∈Rn×pX\in\mathbb{R}^{n\times p},标准逻辑回归模型估计系数βMLEβMLE\beta_{MLE}其最大化二项式可能性。当XXX是满秩βMLEβMLE\beta_{MLE}是独一无二的; 当不存在完美分离时,它是有限的。 这是否最大似然模型还最大化ROC AUC(又名ccc t-统计),还是存在一些系数估计βAUC≠βMLEβAUC≠βMLE\beta_{AUC} \neq \beta_{MLE}这将获得较高的ROC AUC?如果确实MLE不一定使ROC AUC最大化,那么看这个问题的另一种方式是“是否存在似然最大化的替代方案,它将始终使对数回归的ROC AUC最大化?” 我假设模型在其他方面是相同的:我们不会在XXX添加或删除预测变量,也不会更改模型规格,并且我假设似然最大化和AUC最大化模型正在使用相同的链接函数。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.