统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
重采样的好文字?
小组可以为应用的重采样技术推荐一个好的介绍文字/资源吗?具体而言,我对经典参数测试(例如t检验,ANOVA,ANCOVA)的替代方案感兴趣,这些替代方案用于在明显违反正态性等假设的情况下进行群体比较。 我想教育自己解决问题的一种示例类型可能涉及以下内容: I) 2组:治疗和控制 因变量:干预后帐户余额的变化 协变量:干预前帐户余额美元。 应用ANCOVA的问题:许多主题不会有任何变化(很多零)。 II) 2组:治疗和控制 从属变量:添加了新帐户 协变量:干预前帐户数。 *许多科目将没有任何添加的帐户(许多零)。 我可以使用引导程序吗?排列测试?这是我要应用非参数重采样方法的分析类型。

4
如何估算R中零膨胀参数的密度?
我有一个很多零的数据集,看起来像这样: set.seed(1) x <- c(rlnorm(100),rep(0,50)) hist(x,probability=TRUE,breaks = 25) 我想为其密度画一条线,但是该density()函数使用一个移动窗口来计算x的负值。 lines(density(x), col = 'grey') 有一个density(... from, to)参数,但是这些参数似乎只会截断计算,而不会更改窗口,因此0处的密度与数据一致,如以下图所示: lines(density(x, from = 0), col = 'black') (如果插值被更改,我希望黑线在0处的密度比灰线高) 此功能是否有替代方法可以更好地计算零密度?
10 r  probability  kde 

2
哪种核方法能提供最佳的概率输出?
最近,我已经使用Platt对SVM输出的缩放来估计默认事件的概率。更直接的替代方法似乎是“内核逻辑回归”(KLR)和相关的“导入向量机”。 谁能说出哪种给出概率输出的核方法是最新技术?是否存在KLR的R实现? 非常感谢您的帮助!

5
根据经验数据生成随机多元值
我正在使用蒙特卡洛(Monte Carlo)函数对具有部分相关收益的几种资产进行估值。目前,我只是生成协方差矩阵并将其馈送到rmvnorm()R中的函数。(生成相关的随机值。) 但是,从资产收益的分布来看,它不是正态分布的。 这实际上是一个由两部分组成的问题: 1)当我拥有的只是一些真实世界的数据而没有已知分布时,我如何估算某种PDF或CDF? 2)我如何生成相关值(例如rmvnorm),但对于这种未知(非正态)分布呢? 谢谢! 分布似乎不适合任何已知的分布。我认为假设参数然后将其用于蒙特卡洛估计将非常危险。 我是否可以查看某种引导程序或“经验蒙特卡洛”方法?
10 mcmc  monte-carlo  pdf 

3
用于组合因子级别以进行数据挖掘的R包?
想知道是否有人在R中的某个包/函数上运行过,它将组合某个因子的水平,而该水平在一个因子中的所有水平的比例小于某个阈值?具体来说,我进行数据准备的第一步之一就是将稀疏的因子水平合在一起(称为“其他”因子),这些因子至少不构成总数的2%。这是在无监督的情况下完成的,并且当目标是为营销中的某些活动建模时(而不是欺诈检测,因为那些很小的事件可能非常重要),可以执行此操作。我正在寻找一个可以折叠水平直到达到某个阈值比例的函数。 更新: 由于这些出色的建议,我很容易地编写了一个函数。我确实意识到,虽然有可能使比例<最小值的水平崩溃,而仍然使重新编码的水平<最小值,但需要添加比例>最小值的最低水平。可能会更有效,但它似乎可以工作。下一个增强功能是弄清楚如何捕获将折叠逻辑应用于新数据(验证集或将来的数据)的“规则”。 collapseFactors<- function(tableName,minPercent=5,fillIn ="RECODED" ) { for (i in 1:ncol(tableName)) { if(is.factor(tableName[,i]) == TRUE) #process just factors { sortedTable<-sort(prop.table(table(tableName[,i]))) numberToCollapse<-length(sortedTable[sortedTable<(minPercent/100)]) if (sum(sortedTable[1:numberToCollapse])<(minPercent/100)) { numberToCollapse=numberToCollapse+1 #add next level if < minPercent } if(numberToCollapse>1) #if not >1 then nothing to collapse { lf <- names(sortedTable[1:numberToCollapse]) levels(tableName[,i])[levels(tableName[,i]) %in% lf] <- fillIn …

2
如何在PLS中计算回归系数的置信区间?
PLS的基本模型是,给定的矩阵和向量y与 X = TP'+ E,y = T q'+ f相关, 其中T是一个潜在的n x k矩阵,而E ,f是噪声项(假设X,y为中心)。n×mn×mn \times mXXXnnnyyyX=TP′+E,X=TP′+E,X = T P' + E, y=Tq′+f,y=Tq′+f,y = T q' + f,TTTn×kn×kn \times kE,fE,fE, fX,yX,yX, y PLS生成T,P,q的估计T,P,qT,P,qT, P, q,以及回归系数\ hat {\ beta}的“捷径”向量,β^β^\hat{\beta}从而y∼Xβ^y∼Xβ^y \sim X \hat{\beta}。我想在一些简化的假设下找到\ hat {\ beta}的分布β^β^\hat{\beta},其中可能包括以下内容: 该模型是正确的,即 对于未知的T,P,q,X = TP'+ E,y = T q'+ …

1
在R中,“ glmnet”是否适合截距?
我正在使用R在R中拟合线性模型glmnet。原始(非正规化)模型使用来拟合,lm并且没有常数项(即,形式为lm(y~0+x1+x2,data))。 glmnet采用预测变量矩阵和响应向量。我一直在阅读glmnet文档,找不到常量术语。 那么,有没有办法要求glmnet通过原点强制线性拟合呢?
10 r  regression  lasso 

3
用于学习虚假时间序列回归的资源
我经常听到“虚假回归”(在时间序列中)和诸如单位根测试之类的相关术语,但从未理解。 为什么/何时会发生?(我相信这是两个时间序列进行协整的时候,即两者的某种线性组合是固定的,但是我不明白为什么协整会导致虚假。)如何避免这种情况? 我正在寻找对协整/单位根检验/ Granger因果关系与虚假回归有什么关系的高级理解(我记得其中三个是与虚假回归相关联的术语,但我不记得到底是什么),因此,无论是自定义响应还是指向我可以了解更多信息的引用的链接,都很棒。

1
GLS和SUR之间的区别
我一直在阅读有关广义最小二乘(GLS)的文章,并尝试将其与我的基本计量经济学背景联系起来。我记得在读研究生时使用的似乎无关的回归(SUR)似乎与GLS相似。我偶然发现的一篇论文甚至将SUR称为GLS的“特殊情况”。但是我仍然无法绕过异同。 所以问题是: GLS和SUR之间有什么异同?应该使用一种方法代替另一种方法的问题的标志是什么?

4
开始进行统计建模的提示和技巧?
我从事数据挖掘领域的工作,很少接受统计学方面的正规教育。最近,我读了很多关于贝叶斯学习和挖掘范式的工作,我觉得这很有趣。 我的问题是(分为几个部分),考虑到一个问题,是否有一个通用的框架可以用来构建统计模型?给定想要为其基础流程建模的数据集时,您要做的第一件事是什么?有没有好的书籍/教程可以解释这个过程,或者是经验的问题?在构建模型时,推理是在您的思维的最前沿吗?还是在担心如何使用数据进行计算之前首先要描述数据? 任何见识将不胜感激!谢谢。

2
卡方检验分布是否相等:它可以容忍多少个零?
我正在比较两组突变体,每组突变体只能具有21种不同表型中的一种。我想看看两组之间这些结果的分布是否相似。我找到了一个在线测试 ,用于计算“分布均等性的卡方检验”,并给出一些合理的结果。但是,此表中有很多零,所以在这种情况下我可以完全使用卡方吗? 这是具有两组和特定表型计数的表: 2 1 2 3 1 6 1 4 13 77 7 27 0 1 0 4 0 2 2 7 2 3 1 5 1 9 2 6 0 3 3 0 1 3 0 3 1 0 1 2 0 1

1
聚类分析,然后进行判别分析
我在文献中不时看到的(主要是关于精神障碍的临床分型),如果对基于k均值的聚类算法的结果使用判别分析(DA),有什么理由(如果有)? 通常不建议测试在聚类构建过程中使用的变量的组差异,因为它们支持类间(分别为类内)惯性的最大化(最小化)。因此,除非我们设法将个体嵌入较小维度的阶乘空间中,并获得这种划分的“一般化”的想法,否则我不确定是否会完全理解预测DA的附加值。但是即使在这种情况下,聚类分析从根本上仍然是一种探索性工具,因此乍一看,使用以这种方式计算的类成员资格来进一步得出评分规则似乎很奇怪。 对相关论文有什么建议,想法或指示吗?

1
将R转换为C ++(最终使用Rcpp)[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 2年前关闭。 我想学习使用Rcpp。我浏览了该软件包的CRAN网站上的文档,但是我觉得编写一个实际示例(考虑到convolve3是第二个实际示例)会更有帮助。 我从robustbase软件包中提出了以下代码,因为它既不会太长也不会太短,它使用R类型和R函数的组合,并且具有那些在R中速度太慢的小型算术迭代之一。 -ing吗? scaleTau2<-function (x, c1 = 4.5, c2 = 3, consistency = TRUE, mu.too = FALSE){ n <- length(x) medx <- median(x) x. <- abs(x - medx) sigma0 <- median(x.) mu <- if (c1 > 0) { x. <- x./(sigma0 * c1) w <- 1 …
10 r  c++ 

3
如何在逻辑回归(SPSS)中处理非二元分类变量
我必须使用许多自变量进行二进制逻辑回归。它们大多数是二进制的,但是一些分类变量具有两个以上的级别。 处理此类变量的最佳方法是什么? 例如,对于一个具有三个可能值的变量,我假设必须创建两个虚拟变量。然后,在逐步回归过程中,最好同时测试两个虚拟变量,或者分别测试它们? 我将使用SPSS,但我不太清楚,所以:SPSS如何处理这种情况? 此外,对于序数分类变量,使用伪变量重新创建序数标度是一件好事吗?(例如,使用三个虚拟变量为一个4状态定序变量,把0-0-0用于电平,为电平2,为电平3和用于电平4,而不是,,和为4个级别)。1个111-0-02221-1-03331-1-14440-0-01-0-00-1-00-0-1

4
量化QQ图
qq图可用于可视化两个分布的相似程度(例如,可视化分布与正态分布的相似性,还可以比较两个人工数据分布)。是否有任何统计数据能够生成更客观的数值度量来表示其相似性(最好以归一化(0 <= x <= 1)形式)?例如,在使用洛伦兹曲线时,基尼系数用于经济学中。QQ图有东西吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.