统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
为什么使用康沃尔-菲舍尔扩展而不是样本分位数?
在康沃尔-Fisher展开提供了一种估算基于矩分布的分位数的方式。(从这个意义上说,我认为它是对Edgeworth Expansion的补充,后者基于矩来估计累积分布。)我想知道在哪种情况下,人们更愿意将Cornish-Fisher扩展用于实证研究而不是样本分位数,反之亦然。一些猜测: 通过计算,可以在线计算样本矩,而在线估计样本分位数则很困难。在这种情况下,CF“获胜”。 如果一个人有能力预测力矩,那么CF将允许人们利用这些预测来进行分位数估计。 CF扩展可能会给出观察值范围之外的分位数估计,而样本分位数可能不会。 我不知道如何围绕CF给出的分位数估计来计算置信区间。在这种情况下,样本分位数“获胜”。 似乎CF膨胀需要一个来估计分布的多个较高矩。这些估计中的误差可能以CF扩展具有比样本分位数更高的标准误差的方式复合。 还有其他吗?是否有人有使用这两种方法的经验?

2
计算复杂季节性的季节性指标
我想使用指数平滑来预测零售商品(按周)。我现在停留在如何计算,存储和应用共鸣指数上。 问题是我发现的所有示例都涉及一种简单的季节性。就我而言,我有以下问题:1.季节不是每年的同一周发生:它们是可移动的。狂欢节,借来的,复活节的和其他一些。2.有些季节会根据年份而变化。例如,有一个国家假期。根据假期是否接近周末,客户是否会离开城镇。因此,这就像有两个季节:一个是客户离开城镇的季节,另一个是他们不离开城镇的季节。3.有时两个(或三个)季节同时发生。例如,我们将“狂欢节”季节与情人节季节同时发生。 4.有时持续时间会改变。例如,“万圣节季节”是今年年初开始的。圣诞节也是另一个例子,似乎每年我们都开始提早运送产品。 在我看来,我需要找到一种方法来设置某种“季节特征”,然后根据特定情况添加某种“季节特征”以获得正确的季节指数。那有意义吗? 有人知道我在哪里可以找到有关此操作的实用信息吗? 谢谢,埃德加德

2
软阈值与套索惩罚
我正在尝试总结到目前为止在使用高维数据集进行的惩罚性多元分析中所了解的内容,但我仍然在努力获得正确的软阈值与Lasso(或)惩罚的定义方面遇到困难。L1L1L_1 更准确地说,我使用稀疏PLS回归分析包括基因组数据的2块数据结构(单核苷酸多态性,其中我们将次等位基因的频率在{0,1,2}范围内,视为数值变量)和连续表型(量化人格特征或脑不对称性的得分,也视为连续变量)。这个想法是要找出最有影响力的预测因子(这里是DNA序列的遗传变异)来解释个体之间的表型变异。 我最初使用mixOmics R包(以前integrOmics),该包具有受罚的PLS回归和正则化的CCA。查看R代码,我们发现预测变量中的“稀疏性”只是通过选择第个分量(算法为)上具有最高负载(绝对值)的前变量来诱发的是迭代的并且计算组件上的变量负载,在每次迭代时缩小预测变量块,有关概述,请参见稀疏PLS:集成Omics数据时的变量选择)。相反,S。Keleş与他人合着了spls软件包(请参见i i = 1 ,... ,k k L 1kkkiiii=1,…,ki=1,…,ki=1,\dots, kkkk稀疏偏最小二乘回归的同时降维和变量选择,对于这些作者所采取的方式)实现一个更加正式的描述 -penalization变量处罚。L1L1L_1 在我看来,在基于软阈值的迭代特征选择和正则化之间是否存在严格的“双射”并不明显。所以我的问题是:两者之间是否存在数学联系?L1L1L_1 参考文献 Chun,H.和Kelȩs,S.(2010),稀疏偏最小二乘用于同时减少维数和变量选择。皇家统计学会:B系列,72,3-25。 Le Cao,K.-A.,Rossoou,D.,Robert-Granie,C.和Besse,P.(2008年),《整合Omics数据时用于变量选择的稀疏PLS》。在遗传学和分子生物学统计应用程序,7,第35条。

5
有什么方法可以证明两种分析方法是等效的?
我有两种不同的分析方法,可以测量基质中特定分子的浓度(例如测量水中的盐含量) 两种方法不同,每种方法都有自己的错误。有什么方法可以证明这两种方法是等效的(或不等效)。 我认为在散点图上绘制通过两种方法测量的多个样本的结果是一个不错的第一步,但是有没有好的统计方法?

2
能够
如果 β∗= 一个ř 克中号我Ñβ∥ ÿ- Xβ∥22+ λ ∥ β∥1个β∗=一个[RG米一世ñβ‖ÿ-Xβ‖22+λ‖β‖1个\beta^*=\mathrm{arg\,min}_{\beta} \|y-X\beta\|^2_2+\lambda\|\beta\|_1, 能够 ∥ β∗∥2‖β∗‖2\|\beta^*\|_2 增加时间 λλ\lambda 增加? 我认为这是可能的。虽然∥ β∗∥1个‖β∗‖1个\|\beta^*\|_1 何时不增加 λλ\lambda增加(我的证明),∥ β∗∥2‖β∗‖2\|\beta^*\|_2可以增加。下图显示了一种可能性。什么时候λλ\lambda 增加,如果 β∗β∗\beta^* 从(线性)行进 PPP 至 问问Q, 然后 ∥ β∗∥2‖β∗‖2\|\beta^*\|_2 增加而 ∥ β∗∥1个‖β∗‖1个\|\beta^*\|_1减少。但是我不知道如何构造一个具体的例子(即XXX 和 ÿÿy),这样 β∗β∗\beta^*证明这种行为。有任何想法吗?谢谢。
11 lasso 

1
受限三次样条曲线和惩罚样条曲线有何不同?
我正在阅读很多有关在各种回归问题中使用样条曲线的信息。一些书(例如Hodges Riched Parrameterized线性模型)推荐了样条曲线。其他(例如Harrell 回归建模策略)选择了受限制的三次样条曲线。 在实践中,这些有何不同?您是否经常会从使用一种或另一种获得实质上不同的结果?一个或另一个具有特殊优势吗?

1
“先验稀疏”一词指的是什么(FBProphet论文)?
阅读“大规模预测”(FBProphet预测工具,请参阅https://peerj.com/preprints/3190.pdf)一文,我遇到了“先验稀疏”一词。作者解释说,他们正在使用这样的“稀疏先验”模型来建模与某些标量速率的速率偏差的向量,后者是逻辑增长模型中的模型参数。δδ\mathbf{\delta}ķķk 当他们指出,如果参数小,我是否正确理解“稀疏”是指携带接近零的元素的向量?我很困惑,因为我认为所有矢量元素都必须是回归的参数,但是像这样定义它们只会让参数和成为自由模型参数,不是吗?δĴ〜拉普拉斯(0 ,τ)δĴ〜拉普拉斯(0,τ)\delta_j \sim\text{Laplace}(0,\tau)ττ\tauķķkττ\tau 另外,是否使用拉普拉斯分布来生成先验共性?我不明白为什么它比例如正态分布更可取。

4
为什么我们不只是学习超级参数?
我正在实施一篇颇受欢迎的论文“ 解释和利用对抗性示例 ”,在该论文中,它训练了对抗性目标函数 J''(θ)=αJ(θ)+(1 −α)J'(θ)。 它将α视为超参数。α可以是0.1、0.2、0.3等。 不管这份具体论文如何,我都想知道,为什么我们不只是将α纳入参数并学习最佳的α? 这样做的缺点是什么?是因为过度拟合吗?如果是这样,为什么只学习1个参数会导致过拟合呢?



1
如何为R中的每个预测计算回归的置信度得分(使用随机森林/ XGBoost)?
使用随机森林或极端梯度增强(XGBoost)之类的算法时,是否可以获取每个预测值的置信度得分(也可以称为置信度值或似然度)?假设此置信度得分介于0到1之间,表示我对特定预测的信心如何。 根据我在互联网上发现的有关信心的信息,通常用间隔来衡量。这是一个使用库中confpred函数计算的置信区间的示例lava: library(lava) set.seed(123) n <- 200 x <- seq(0,6,length.out=n) delta <- 3 ss <- exp(-1+1.5*cos((x-delta))) ee <- rnorm(n,sd=ss) y <- (x-delta)+3*cos(x+4.5-delta)+ee d <- data.frame(y=y,x=x) newd <- data.frame(x=seq(0,6,length.out=50)) cc <- confpred(lm(y~poly(x,3),d),data=d,newdata=newd) if (interactive()) { ##' plot(y~x,pch=16,col=lava::Col("black"), ylim=c(-10,15),xlab="X",ylab="Y") with(cc, lava::confband(newd$x, lwr, upr, fit, lwd=3, polygon=T, col=Col("blue"), border=F)) } 代码输出仅给出置信区间: 还有一个库conformal,但我也将其用于回归的置信区间:“共形允许在共形预测框架中计算预测误差:(i)用于分类的p。值,以及(ii)回归的置信区间。 ” …

1
为什么LKJcorr是相关矩阵的先验?
I'm阅读中(第13章“冒险协方差” 高超)一书统计反思理查德McElreath在那里,他提出以下层次模型: (R是一个相关矩阵) 作者解释说,这LKJcorr是信息量较弱的先验,可作为相关矩阵的正则化先验。但是为什么会这样呢?LKJcorr分布具有什么特征,使其成为相关矩阵的先验?相关矩阵在实践中还使用了哪些其他先验条件?

3
一键编码与伪编码的问题
我知道以下事实:具有k个级别的分类变量应使用虚拟编码中的k-1个变量进行编码(与多值分类变量类似)。我想知道针对不同的回归方法,主要是线性回归,惩罚线性回归(Lasso,Ridge,ElasticNet),基于树的(随机森林),单次热编码(即使用k个变量代替)比虚拟编码有多少问题? ,梯度增强机)。 我知道在线性回归中会出现多重共线性问题(即使实际上我使用OHE拟合线性回归也没有任何问题)。 但是,是否需要在所有编码中都使用伪编码?如果使用一热编码,结果将有多大错误? 我的重点是在具有多个(高基数)分类变量的回归模型中进行预测,因此我对置信区间不感兴趣。

2
引导的利弊
我刚刚了解了自举的概念,并且想到了一个幼稚的问题:如果我们总是可以生成大量的数据自举样本,为什么还要费心去获取更多的“真实”数据呢? 我确实有一个解释,请告诉我我是否正确:我认为引导过程会减少方差,但是如果我的原始数据集是BIASED,那么无论有多少副本,我都将保持低方差和高偏差我在拿。

3
CIFAR-10不能达到60%以上的精度,带有Tensorflow后端的Keras [关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 去年关闭。 在CIFAR-10数据集上经过15个纪元后的训练似乎使验证损失不再减少,大约为1.4(验证准确度为60%)。我重新整理了训练集,将其除以255,然后导入为float32。我已经尝试了许多体系结构,在Conv2D层中有或没有辍学,似乎没有任何效果。相同的体系结构在MNIST的测试集上实现了99.7%的准确性。请查看以下架构: (注意:我曾尝试增加Adam优化器的辍学率和提高/降低学习率,以防止过度拟合,所有这些操作都是为了防止过度拟合,但是现在训练和测试集的准确性都低至60%左右)。 with tf.device('/gpu:0'): tf.placeholder(tf.float32, shape=(None, 20, 64)) #placeholder initialized (pick /cpu:0 or /gpu:0) seed = 6 np.random.seed(seed) modelnn = Sequential() neurons = x_train_reduced.shape[1:] modelnn.add(Convolution2D(32, 3, 3, input_shape=neurons, activation='relu', border_mode='same')) modelnn.add(Convolution2D(32, 3, 3, activation='relu', border_mode='same')) modelnn.add(MaxPooling2D(pool_size=(2, 2))) modelnn.add(Dropout(0.2)) modelnn.add(Convolution2D(64, 3, 3, activation='relu', border_mode='same')) modelnn.add(Convolution2D(64, 3, 3, …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.