统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
处理混合模型中的奇异拟合
假设我们有一个模型 mod <- Y ~ X*Condition + (X*Condition|subject) # Y = logit variable # X = continuous variable # Condition = values A and B, dummy coded; the design is repeated # so all participants go through both Conditions # subject = random effects for different subjects summary(model) Random effects: …

3
分母等于0时,精度和召回率的正确值是多少?
精度定义为: p =真阳性/(真阳性+假阳性) 如果(真肯定+假肯定)= 0,那么精度的值是多少?它只是不确定的吗? 召回相同的问题: r =真阳性/(真阳性+假阴性) 在这种情况下,如果(真肯定+假否定)= 0,召回值是多少? PS这个问题与问题非常相似,在极端情况下,精度和召回率的正确值是多少?。

2
使用Adam Optimizer解释训练损失与迭代中的峰值
我正在使用i)SGD和ii)Adam Optimizer训练神经网络。当使用正常的SGD时,我得到了一条平滑的训练损耗与迭代曲线的曲线,如下图所示(红色的曲线)。但是,当我使用Adam Optimizer时,训练损耗曲线会有一些尖峰。这些尖峰的解释是什么? 型号详情: 14个输入节点-> 2个隐藏层(100-> 40个单位)-> 4个输出单位 我使用的默认参数为亚当beta_1 = 0.9,beta_2 = 0.999,epsilon = 1e-8和batch_size = 32。 i)与SGD ii)与Adam


1
分类器vs模型vs估计量
分类器,模型和估计器有什么区别? 据我所知: 估计量是通过回归算法找到的预测量 分类器是从分类算法中找到的预测变量 模型既可以是估计器,也可以是分类器 但是从网上看,似乎我可能混淆了这些定义。那么,在机器学习的上下文中真正的定义是什么?

2
为什么收缩真正起作用,0有什么特别之处?
该网站上已经有一篇文章谈论同一问题: 收缩为什么起作用? 但是,即使答案很流行,我也不认为这个问题的实质能够真正解决。很明显,在估计中引入一些偏差会导致方差减少,并可能提高估计质量。然而: 1)为什么引入偏差造成的损害要比方差获得的损害少? 2)为什么它总是可以工作?例如,在岭回归的情况下:存在定理 3)0(原点)有什么有趣的地方?显然,我们可以缩小到我们喜欢的任何位置(例如Stein estimator),但是它能像原点一样工作吗? 4)为什么各种通用编码方案更喜欢原点周围的位数较少?在这些假设只是更可能? 期望参考已证明的定理或确定的结果进行回答。

2
为什么将边际分布/边际概率描述为“边际”?
边际通常指的是很小的影响,是指更大的系统之外的东西。它往往会削弱所谓“边际”的重要性。 那么,这如何适用于随机变量子集的概率呢? 假设单词因其含义而被使用可能在数学中是一个冒险的命题,所以我知道这里不一定有答案,但是有时此类问题的答案可以帮助您获得真正的见识,因此我为什么我问。

2
作为新观测数据流的方式递归更新MLE
一般问题 假设我们有iid数据x1x1x_1,,... \ sim f(x \,| \,\ boldsymbol {\ theta})流进来。我们要递归计算\ boldsymbol {\ theta}的最大似然估计。也就是说,已经计算了 \ hat {\ boldsymbol {\ theta}} _ {n-1} = \ underset {\ boldsymbol {\ theta} \ in \ mathbb {R} ^ p} {\ arg \ max} \ prod_ { i = 1} ^ {n-1} f(x_i \,| \,\ …


7
我应该将哪种曲线(或模型)拟合到百分比数据?
我正在尝试创建一个显示病毒拷贝与基因组覆盖率(GCC)之间关系的图。这是我的数据: 起初,我只是绘制了线性回归图,但是我的主管告诉我这是不正确的,并尝试使用S形曲线。所以我使用geom_smooth做到了: library(scales) ggplot(scatter_plot_new, aes(x = Copies_per_uL, y = Genome_cov, colour = Virus)) + geom_point() + scale_x_continuous(trans = log10_trans(), breaks = trans_breaks("log10", function(x) 10^x), labels = trans_format("log10", math_format(10^.x))) + geom_smooth(method = "gam", formula = y ~ s(x), se = FALSE, size = 1) + theme_bw() + theme(legend.position = 'top', legend.text …


2
GLM中的过度分散测试实际上是否“有用”?
每当我们使用限制响应变量方差的模型时,就会在GLM中出现“过度分散”现象,并且数据显示的方差大于模型限制所允许的方差。在使用Poisson GLM对计数数据进行建模时,通常会发生这种情况,并且可以通过众所周知的测试进行诊断。如果测试表明存在统计学上显着的过度分散迹象,那么我们通常通过使用更广泛的分布族来概括模型,该分布族将方差参数从原始模型下出现的约束中解脱出来。对于Poisson GLM,通常将其推广为负二项式或准Poisson GLM。 这种情况怀有明显的异议。为什么要从Poisson GLM开始呢?可以直接从较宽的分布形式开始,后者具有(相对)自由的方差参数,并允许方差参数适合数据,而完全忽略了过度分散测试。在其他情况下,当我们进行数据分析时,我们几乎总是使用至少允许前两个时刻自由的分布形式,那么为什么在这里例外? 我的问题:是否有充分的理由从确定方差的分布(例如泊松分布)开始,然后执行过度分散测试?与完全跳过本练习并直接转到更通用的模型(例如,负二项式,准泊松等)相比,此过程如何?换句话说,为什么不总是使用带有自由方差参数的分布呢?

1
两个决策树的总和是否等于单个决策树?
假设我们有两个回归树(树A和B树),该地图输入为输出。对于树A,让对于树B,让。每棵树都使用二进制拆分,并以超平面作为分离函数。X ∈ řdX∈[Rdx \in \mathbb{R}^d Ŷ =˚F甲(X)˚F乙(X)ÿ^∈ [Rÿ^∈[R\hat{y} \in \mathbb{R}ÿ^= f一种(x )ÿ^=F一种(X)\hat{y} = f_A(x)F乙(x )F乙(X)f_B(x) 现在,假设我们对树的输出进行加权求和: FC(x )= w一种 F一种(x )+ w乙 F乙(x )FC(X)=w一种 F一种(X)+w乙 F乙(X)f_C(x) = w_A \ f_A(x) + w_B \ f_B(x) 函数等效于单个(更深的)回归树?FCFCf_C如果答案是“有时”,那么在什么条件下? 理想情况下,我想允许倾斜的超平面(即对特征的线性组合执行的分割)。但是,如果这是唯一的答案,那么假设单功能拆分可能是可以的。 例 这是在2d输入空间上定义的两个回归树: 该图显示了每棵树如何划分输入空间以及每个区域的输出(以灰度编码)。彩色数字表示输入空间的区域:3、4、5、6对应于叶节点。1是3和4的并集,依此类推。 现在假设我们对树A和树B的输出求平均: 平均输出在左侧绘制,树A和B的决策边界重叠。在这种情况下,可以构造一棵更深的树,其输出等于平均值​​(在右侧绘制)。每个节点对应于输入空间的一个区域,该区域可以在树A和B定义的区域之外构建(由每个节点上的彩色数字表示;多个数字表示两个区域的交集)。请注意,这棵树不是唯一的-我们可能已经从树B而不是树A开始构建。 此示例表明,在某些情况下答案为“是”。我想知道这是否总是对的。


3
什么时候不宜控制变量?
我可以想到至少一个幼稚的例子。假设我想研究X和Z之间的关系。我还怀疑Y影响Z,所以我控制Y。但是,事实证明,我不知道X引起Y,Y引起Z。因此,通过控制对于Y,我“了解”了X和Z之间的关系,因为X在给定Y的情况下独立于Z。 现在,在前面的示例中,可能是我应该研究的关系是X和Y以及Y和Z之间的关系。但是,如果我事先知道这些事情,我就不会在第一名。我现在所做的研究表明,X和Z之间没有关系,事实并非如此。...X和Z是相关的。 在下面的依赖关系图中对此进行了说明。在正确的情况下,Z取决于X和Y,并且X和Y是独立的。我们正确地控制了Y以确定X和Z之间的关系。在左情况下,Z取决于依赖于X的Y。X和Z在给定Y的情况下是独立的,因此通过控制是的 我的问题基本上是“什么时候适合控制变量Y,什么时候不适合?” ...可能很难或不可能完全研究X和Y之间的关系,但是,例如,将Y控制在给定的水平是一个选项。在进行研究之前,我们如何决定?控制太多或太少的常见陷阱是什么? 引文表示赞赏。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.