统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
将概率收敛模拟为常数
渐近结果不能通过计算机仿真来证明,因为它们是涉及无穷大概念的陈述。但是我们应该能够感觉到事情确实按照理论告诉我们的方式前进了。 考虑理论结果 limn→∞P(|Xn|>ϵ)=0,ϵ>0林ñ→∞P(|Xñ|>ϵ)=0,ϵ>0\lim_{n\rightarrow\infty}P(|X_n|>\epsilon) = 0, \qquad \epsilon >0 其中是随机变量的函数,它们是相同且独立分布的。这表示的概率收敛到零。我想这里的原型示例是是样本均值减去样本的iidrv的共同期望值的情况,XnXñX_nnñnXnXñX_nXnXñX_n Xn=1n∑i=1nYi−E[Y1]Xñ=1个ñ∑一世=1个ñÿ一世-Ë[ÿ1个]X_n = \frac 1n\sum_{i=1}^nY_i - E[Y_1] 问题: 我们如何通过使用来自有限样本的计算机模拟结果来令人信服地证明上述关系“在现实世界中得以实现”? 请注意,我特别选择了收敛为常数。 我在下面提供我的方法作为答案,并希望有更好的方法。 更新:我脑后的东西困扰着我-我发现了什么。我挖出一个较旧的问题,在对一个答案的评论中进行了最有趣的讨论。在这里,@ Cardinal提供了一个估计量的示例,该估计量是一致的,但其方差保持非零且渐近地为有限。因此,我的问题变得更加棘手:当模拟统计量渐近地保持非零和有限方差时,如何通过模拟证明统计量收敛于常数呢?

1
使用分类变量进行过采样
我想执行过采样和欠采样的组合,以使我的数据集与大约4000个分为两组的客户保持平衡,其中一组的比例约为15%。 我研究了SMOTE(http://www.inside-r.org/packages/cran/DMwR/docs/SMOTE)和ROSE(http://cran.r-project.org/web/packages/ROSE/ ROSE.pdf),但是这两种方法都可以使用现有的观测数据(例如kNN)创建新的合成样本。 但是,由于与客户相关的许多属性都是分类的,因此我认为这不是正确的方法。例如,我的很多变量(例如Region_A和Region_B)都是互斥的,但是使用kNN可以将新的观测值放置在Region_A和Region_B中。您是否同意这是一个问题? 在那种情况下-如何通过简单地复制现有观测值来在R中执行过采样?还是这是错误的方法?

3
使用R进行K折或保留交叉验证以进行岭回归
我正在对200个主题和1000个变量的数据预测进行交叉验证。我对岭回归很感兴趣,因为变量数(我想使用)大于样本数。所以我想使用收缩估计量。以下是示例数据: #random population of 200 subjects with 1000 variables M <- matrix(rep(0,200*100),200,1000) for (i in 1:200) { set.seed(i) M[i,] <- ifelse(runif(1000)<0.5,-1,1) } rownames(M) <- 1:200 #random yvars set.seed(1234) u <- rnorm(1000) g <- as.vector(crossprod(t(M),u)) h2 <- 0.5 set.seed(234) y <- g + rnorm(200,mean=0,sd=sqrt((1-h2)/h2*var(g))) myd <- data.frame(y=y, M) myd[1:10,1:10] y X1 …

2
如何在助推树中找到调整参数的最佳值?
我意识到在Boosting Trees模型中有3个调整参数,即 树数(迭代数) 收缩参数 分割数(每个构成树的大小) 我的问题是:对于每个调整参数,我应该如何找到其最佳值?什么方法? 请注意:收缩参数和树木数量参数一起使用,即收缩参数的值越小,树木数量的值就越高。我们也需要考虑到这一点。 我对为分割数找到最佳值的方法特别感兴趣。是否应该基于交叉验证或有关背后模型的领域知识? 这些事情如何gbm在R 的包中进行?

1
GLMM的Anova III型测试
我正在R包中拟合glmer模型lme4。我正在寻找其中显示p值的方差分析表,但找不到适合它的包装。有可能在R中做到吗? 我适合的模型具有以下形式: model1<-glmer(dmn~period*teethTreated+(1|fullName), family="poisson", data=subset(dataset, group=='Four times a year'), control=glmerControl(optimizer="bobyqa"))

1
标尺可靠性度量(Cronbach's alpha等)与组件/因子负载之间有什么关系?
假设我有一个数据集,其中包含一堆问卷项目的得分,理论上,这些项目的评分范围较小,例如心理学研究中。 我知道这里的常见方法是使用Cronbach's alpha或类似方法检查量表的可靠性,然后将量表中的项目汇总以形成量表分数并从那里继续进行分析。 但是,还有因素分析,可以将您所有项目的得分作为输入,并告诉您其中哪些构成一致的因素。通过查看负载和社区等,您可以了解这些因素的强大程度。对我来说,这听起来像是同一件事,只是更深入。 即使您所有的秤可靠性都不错,EFA也会根据哪些项目更适合哪个秤来纠正您,对吗?您可能会遇到交叉负荷,使用派生因子得分比简单的比例总和更有意义。 如果我想将这些量表用于以后的分析(如回归或ANOVA),只要能保持其可靠性,我是否应该汇总这些量表?或者是CFA之类的东西(测试量表是否保持良好的因素,这似乎在衡量与“可靠性”相同的东西)。 我已经分别学习了这两种方法,所以我真的不知道它们之间的关系,是否可以一起使用它们,或者哪种方法对哪种环境更有意义。在这种情况下,是否存在用于良好研究实践的决策树?就像是: 根据预测的规模项目运行CFA 如果CFA拟合良好,请计算因子得分并将其用于分析。 如果CFA显示不合适,请改用EFA并采用探索性方法(或其他方法)。 因子分析和可靠性测试是否确实是针对同一事物的单独方法,还是我在某个地方误解了?

1
glmnet如何处理过度分散?
我有一个关于如何对计数数据进行文本建模的问题,尤其是如何使用该lasso技术来减少特征。 假设我有N篇在线文章以及每篇文章的综合浏览量。我为每篇文章提取了1克和2克,我想对1,2克进行回归。由于特征(1,2克)比观察的数量更多,所以套索将是减少特征数量的好方法。另外,我发现glmnet运行套索分析非常方便。 然而,网页浏览量计数的overdispersed(方差>的意思),但glmnet不提供quasipoisson(明确的),或者negative binomial,但poisson对数的数据。我想到的解决方案是对log transform计数数据(社会科学家中常用的方法)进行计数,并使响应变量大致遵循正态分布。因此,我可以使用高斯族对数据进行建模glmnet。 所以我的问题是:这样做合适吗?或者,应我只是用泊松的glmnet情况下glmnet手柄quasipoisson?还是有其他R软件包可以处理这种情况? 非常感谢你!

5
大数据的逻辑回归
我有大约5000个功能的数据集。对于这些数据,我首先使用卡方检验进行特征选择。之后,我得到了大约1500个变量,这些变量与响应变量之间显示出显着的关系。 现在,我需要对此进行逻辑回归。我正在为R使用glmulti软件包(glmulti软件包为vlm提供了有效的子集选择),但一次只能使用30个功能,否则其性能会下降,因为数据集中的行数约为20000。 是否有其他方法或技术可以解决上述问题?如果我采用上述方法,将需要太多时间来拟合模型。

4
帮助解释一个交互图?
当两个独立变量之间存在交互时,我很难解释交互图。 下图来自此站点: 此处,和是自变量,是因变量。一个AA乙BBd VDVDV 问:有互动的主要作用,但没有主效应一个AA乙BB 我可以看到,如果B在,则的值越高,的值越高,否则,无论的值如何,都是恒定。因此,存在之间的相互作用和和的主效应(因为较高导致更高,保持以恒定)。一个AAd VDVDV乙1个B1B_1d VDVDV一个AA一个AABBBAAAAAADVDVDVBBBB1B1B_1 另外,我可以看到不同层次的会导致不同程度的,拿着常数。因此,存在B的主要作用。但是,事实显然并非如此。因此,这必须表示我错误地解释了交互图。我究竟做错了什么?BBBDVDVDVAAA 我也错误地解释了情节6-8。我用来解释它们的逻辑与我上面使用的逻辑相同,所以如果我知道我在上面犯的错误,我应该能够正确解释其余的逻辑。否则,我将更新此问题。

1
蛋白质组学的力量?
赠款通常需要进行功效分析以支持建议的样本量。在蛋白质组学(和大多数组学)中,在10个样本(可能是100个,但不太可能)中测量的特征/变量为100到1000。同样,众所周知,其中一些测量单位(例如,蛋白质的光谱计数)不是正态分布的,因此我们将使用非参数检验进行分析。我已经看到了假设进行单次测量和进行t检验而确定的样本量的功效,但是我认为这是不完全正确的。特别是频谱计数的另一个问题是,每100个特征的比例都在非常不同的尺度上,并且误差相差很大(数值越大,误差就越小)。[这个问题在极限倍数变化模型中很好地描述,Mutch等,2002 ] 考虑到FDR的某些假设和可接受的倍数变化,确定建议样本量的功效的合适方法是什么?使用此处的工具,我能够确定以下各项: 300个基因 3次误报 1.4倍差异 0.8所需功率 0.7标准差 每组需要49个样本。 这很方便,因为我提出了50v50设计,知道1.4倍变化是可以接受的,1%FDR是可以的,并且在这个实验中我可能会测量300种蛋白质。功效或样本数量计算的问题将继续发生,因此最好采用参考方法。 编辑: 我读到一位同事提议使用似然函数和Wald检验从负二项式分布建模光谱计数的地方。基本上使用预备数据来获得蛋白质差异估算值,然后针对每个分位数计算组之间可检测到的倍数变化。还有一个FDR(alpha)输入。因此,给定> 80%的功效并设置样本大小,他们可以针对25%的最低方差,50%的较小方差和25%的最高方差确定可检测的倍数变化。问题是我不知道他们是怎么做到的。不确定是否共享这种方法是否可以帮助任何人找到答案。


1
使用哪种分布来模拟网页阅读时间?
我有一个函数可以返回Web用户的平均等待时间。即,给定了以字为单位的网络资源长度,它给出了普通用户可以停留在网页上的平均时间。我想结合使用此功能(以及得到的平均值)和分布来对浏览网络的“平均网络用户”进行建模。哪种发行版本可能适合此操作,为什么? 编辑:我也特别想知道为此目的使用指数分布的可行性。 谢谢

3
如何将和包括在回归中,以及是否将它们居中?
我想将项及其平方(预测变量)包括在回归中,因为我假设低值对因变量有积极影响,而高值则有负面影响。在应该捕获更高价值的作用。因此,我期望的系数为正,的系数为负。除了,我还包括其他预测变量。xxxx2x2x^2xxxx2x2x^2xxxx2x2x^2xxx 我在这里读过一些文章,在这种情况下,最好将变量居中以避免多重共线性。 进行多元回归时,何时应将预测变量居中以及何时应对其进行标准化? 我应该分别将两个变量居中(平均)还是应该仅居中然后取平方,还是应该仅居中并包含原始?xxxx2x2x^2xxx 如果是一个计数变量,是否有问题?xxx 为了避免成为计数变量,我考虑过将其除以理论上定义的面积,例如5平方公里。这应该有点类似于点密度计算。xxx 但是,恐怕在这种情况下,如和x²= 4时,我对系数符号的最初假设将不再成立。x=2x=2x=2x²=4x²=4x²=4 x=2/5 km2x=2/5 km2x= 2 / 5 \text{ km}^2 = 0.4 km20.4 km20.4 \text{ km}^2 但是x2x2x^2会更小,因为 x2=(2/5)2=0.16x2=(2/5)2=0.16x^2= (2/5)^2= 0.16。

2
广义线性模型的参数估计
默认情况下,当我们glm在R中使用函数时,它使用迭代加权最小二乘(IWLS)方法来找到参数的最大似然估计。现在我有两个问题。 IWLS估计是否可以保证似然函数的全局最大值?根据本演示文稿的最后一张幻灯片,我认为事实并非如此!我只是想确保这一点。 我们可以说上述问题1的原因是因为几乎所有数值优化方法都可能停留在局部最大值而不是全局最大值吗?

2
为什么负二项式回归的Pearson残差比Poisson回归的残差小?
我有这些数据: set.seed(1) predictor <- rnorm(20) set.seed(1) counts <- c(sample(1:1000, 20)) df <- data.frame(counts, predictor) 我进行了泊松回归 poisson_counts <- glm(counts ~ predictor, data = df, family = "poisson") 负二项式回归: require(MASS) nb_counts <- glm.nb(counts ~ predictor, data = df) 然后我为泊松回归计算色散统计量: sum(residuals(poisson_counts, type="pearson")^2)/df.residual(poisson_counts) # [1] 145.4905 负二项式回归: sum(residuals(nb_counts, type="pearson")^2)/df.residual(nb_counts) # [1] 0.7650289 在不使用方程式的情况下,谁能解释为什么负二项式回归的色散统计量远小于泊松回归的色散统计量?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.