统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
证明或提供反例: 如果,则XnXnX_n →a.s.→a.s.\,{\buildrel a.s. \over \rightarrow}\, (∏ n i = 1 X i )1 / nXXX(∏ni=1Xi)1/n(∏i=1nXi)1/n(\prod_{i=1}^{n}X_i)^{1/n} →a.s.→a.s.\,{\buildrel a.s. \over \rightarrow}\, XXX 我的尝试: 否:假设只能取负值,并且假设X ñ ≡ X ∀ ñXXXXn≡XXn≡XX_n \equiv X ∀∀\forall nnn THEN,但是即使,也不严格是负数。相反,它将负数替换为正数和负数。因此,不收敛几乎肯定到。XnXnX_n →a.s.→a.s.\,{\buildrel a.s. \over \rightarrow}\, n (∏ n i = 1 X i )1 / n(∏ n i …

1
在PET-PEESE和用于荟萃分析的多层次方法之间陷入困境:是否有快乐的媒介?
我目前正在进行荟萃分析,为此我需要分析样本中嵌套的多个效应大小。与部分其他可能的策略(例如,忽略依赖性,在研究中平均效应大小,选择一种效应大小或转移分析单位)。我的许多因果效应大小的相关性都涉及相当独特(但局部相关)的变量,因此对它们进行平均计算在概念上是没有意义的,即使这样做,也将我要分析的总因果大小数减少了近一半。 但是,与此同时,我也对在评估荟萃分析效果的过程中使用Stanley&Doucouliagos(2014)的解决出版偏见的方法感兴趣。简而言之,要么适合使用一种元回归模型,即可通过其各自的方差(精密效果测试或PET)或各自的标准误差(带有标准误差的精密效果估计值或PEESE)来预测研究效果的大小。根据拦截模型在PET模型中的重要性,可以使用PET模型的拦截(如果PET拦截p > .05)或PEESE模型(如果PET拦截p <.05)作为估计的发布-无偏差平均效果大小。 但是,我的问题源于Stanley&Doucouliagos(2014)的摘录: 在我们的模拟中,总是包含过多的无法解释的异质性。因此,按照常规做法,应优先选择REE [随机效应估计器],而不是FEE [固定效应估计器]。但是,当选择出版物时,常规做法是错误的。通过选择具有统计意义的变量,REE总是比FEE更为偏见(表3)。这种可预测的劣势归因于以下事实:REE本身就是简单平均数(具有最大的发布偏差)和FEE的加权平均值。 这段话使我相信,我不应该在随机效应/混合效应荟萃分析模型中使用PET-PEESE,但是多层次的荟萃分析模型似乎需要一个随机效应估计量。 我为该做的事而感到痛苦。我希望能够对我所有的依存效应大小进行建模,但同时要利用这种特殊的出版偏倚校正方法。我是否可以通过某种方式将3级荟萃分析策略与PET-PEESE合法整合? 参考文献 张铭华(2014)。使用三级荟萃分析来建模依赖效应的大小:一种结构方程式建模方法。心理学方法,19,211-229。 Stanley,TD,&Doucouliagos,H.(2014年)。元回归近似可减少出版物选择的偏见。研究综合方法,5,60-78。


1
比较混合效应模型和固定效应模型(测试随机效应的显着性)
给定三个变量y和x,它们是正连续的,而和z是分类的,我有两个候选模型,分别为: fit.me <- lmer( y ~ 1 + x + ( 1 + x | factor(z) ) ) 和 fit.fe <- lm( y ~ 1 + x ) 我希望比较这些模型,以确定哪种模型更合适。在我看来,从某种意义上讲,它fit.fe是嵌套的fit.me。通常,当这种一般情况成立时,可以执行卡方检验。在中R,我们可以使用以下命令执行此测试, anova(fit.fe,fit.me) 当两个模型包含随机效应(通过生成lmer从所述lme4包),则anova()命令工作正常。由于边界参数的存在,通常建议通过仿真测试所得的卡方统计量,尽管如此,我们仍可以在仿真过程中使用该统计量。 当两个模型都只包含固定效果时,此方法(以及相关的anova()命令)可以正常工作。 但是,当一个模型包含随机效应而精简模型仅包含固定效应时,如上述情况一样,该anova()命令将不起作用。 更具体地说,出现以下错误: > anova(fit.fe, fit.me) Error: $ operator not defined for this S4 class 从上方使用Chi-Square方法(模拟)有什么问题吗?还是这仅仅是anova()不知道如何处理由不同函数生成的线性模型的问题? 换句话说,手动生成从模型得出的卡方统计量是否合适?如果是这样,比较这些模型的适当自由度是多少?据我估计: F=((SSEreduced−SSEfull)/(p−k))((SSEfull)/(n−p−1))∼Fp−k,n−p−1F=((SSEreduced−SSEfull)/(p−k))((SSEfull)/(n−p−1))∼Fp−k,n−p−1 F …

1
不同频率的回归
我正在尝试进行简单回归,但我的Y变量按月频率观察,而x变量按年频率观察。我将非常感谢有关可用于不同频率回归的合适方法的一些指导。 非常感谢你

1
k最近邻的VC维
如果k等于使用的训练点数,则k最近邻居算法的VC维是多少? 上下文:在我参加的课程中提出了这个问题,给出的答案为0。但是,我确实不明白为什么会这样。我的直觉是,VC-Dimension应该为1,因为应该可以选择两个模型(即训练点集),以便根据第一个模型,每个点都被标记为属于一个类别,而属于另一个类别根据第二种模型,因此应该有可能粉碎单个点。我的推理错误在哪里?

1
如何找到平滑样条/黄土回归的p值?
我有一些变量,我很想找到它们之间的非线性关系。因此,我决定拟合一些样条曲线或黄土,并打印漂亮的图(请参见下面的代码)。但是,我还希望获得一些统计数据,以使我了解这种关系是随机性问题的可能性有多大……即,我需要一些总体p值,例如对于线性回归而言。换句话说,我需要知道拟合曲线是否有意义,因为我的代码会将曲线拟合到任何数据。 x <- rnorm(1000) y <- sin(x) + rnorm(1000, 0, 0.5) cor.test(x,y) plot(x, y, xlab = xlab, ylab = ylab) spl1 <- smooth.spline(x, y, tol = 1e-6, df = 8) lines(spl1, col = "green", lwd = 2) spl2 <- loess(y ~ x) x.pr <- seq(min(x), max(x), length.out = 100) lines(x.pr, …
10 r  regression  splines  loess 

3
在线性回归模型还是非线性回归模型之间进行选择
如何选择使用线性回归模型还是非线性回归模型? 我的目标是预测Y。 在简单的和数据集的情况下,我可以通过绘制散点图轻松确定应使用哪种回归模型。xxxyyy 在像和这样的多变量的情况下。如何确定必须使用哪种回归模型?也就是说,我将如何决定使用简单的线性模型还是非线性模型(例如二次,三次等)。x1,x2,...xnx1,x2,...xnx_1,x_2,...x_nyyy 是否有任何技术或统计方法或图形绘制来推断和决定必须使用哪种回归模型?

1
有优惠券收集者问题的一般形式的公式吗?
我偶然发现了优惠券收集者的问题,并试图为通用化制定一个公式。 如果有NNN不同的对象,你想收集至少每个任何副本人(其中),什么是你应该有多少个随机购买对象的期望?正常的优惠券收集器问题有和。米米≤ Ñ 米= Ñ ķ = 1kkkmmmm≤Nm≤Nm \le Nm=Nm=Nm = Nk=1k=1k = 1 集合中有12个不同的乐高人物。我想收集10个(任意10个)图形中的每个图形的3个副本。我可以一次随机购买。在我每10个拥有3份副本之前,我应该期望购买多少个?

3
“ R”中图聚类的方法和示例
我正在寻找使用'r'中的图集群对图中的节点进行分组/合并。 这是我的问题的一个惊人的玩具变化。 有两个“集群” 有一个“桥”连接集群 这是一个候选网络: 当我查看连接距离(“跳数”)时,如果可以的话,我可以得到以下矩阵: mymatrix <- rbind( c(1,1,2,3,3,3,2,1,1,1), c(1,1,1,2,2,2,1,1,1,1), c(2,1,1,1,1,1,1,1,2,2), c(3,2,1,1,1,1,1,2,3,3), c(3,2,1,1,1,1,1,2,3,3), c(3,2,1,1,1,1,1,2,2,2), c(2,1,1,1,1,1,1,1,2,2), c(1,1,1,2,2,2,1,1,1,1), c(1,1,2,3,3,2,2,1,1,1), c(1,1,2,3,3,2,2,1,1,1)) 这里的想法: 幸运的是,或者由于玩具的简单性,矩阵具有明显的斑块(在(很大)矩阵中)就不会出现这种情况。如果我将点与行之间的关系随机化,那将不是那么干净。 我可能写错了-如果我有错字,请告诉我。 这里的跳数是连接第i行的点与第j列的点的最短跳数。自跳仍然是跳,因此对角线全为跳。 因此,在此矩阵中,较大的距离(跳跃数)具有较高的数字。如果我想要一个显示“连通性”而不是距离的矩阵,那么我可以做一个点逆,将矩阵的每个像元都替换为其乘性逆。 问题: 为了帮助我找到自己的方式: 通过组合它们来减少图上节点数的术语是什么?它是集群,合并,纠结吗?我应该使用什么词? 有哪些成熟的技术?是否有关于该主题的教科书?您可以指向论文或网站吗? 现在,我尝试首先看一下这里-这是一个不错的“首次检查”地点。我没有找到想要的东西。如果我错过了(不是不太可能),您能给我指出关于简历的一个或两个有关该主题的问题吗? 要带我去哪里: 是否有一个“ R”包可以正确群集网络上的节点? 您能指出我要执行此操作的示例代码吗? 是否有一个“ R”包可以图形化地显示缩小后的网络? 您能指出我要执行此操作的示例代码吗? 提前致谢。

1
如何确定CNN中卷积运算符的数量?
在使用卷积神经网络(CNN)进行计算机视觉任务(例如对象分类)时,该网络具有出色的性能。但是我不确定如何在卷积层中设置参数。例如,在灰度图像(480x480)中,第一卷积层可以使用像的卷积算子11x11x10,其中数字10表示卷积算子的数量。 问题是如何确定CNN中卷积运算符的数量?

1
不平衡数据集的ROC曲线
考虑输入矩阵和二进制输出y。XXXyyy 衡量分类器性能的一种常用方法是使用ROC曲线。 在ROC图中,对角线是从随机分类器获得的结果。在输出不平衡的情况下,可以选择具有不同概率的0或1来改善随机分类器的性能。yyy000111 如何在ROC曲线图中表示此类分类器的性能?我想应该是一条具有不同角度的直线,而不是对角线了吗?

3
定义尾部依赖
我一直在尝试找到有关尾部依赖的简单,简洁的定义。任何人都可以分享他们的看法。 其次,如果我要在图形上使用不同的copula绘制模拟,我将如何知道哪些显示尾部相关性。
10 fat-tails 

2
d素数具有100%的命中率概率和0%的虚警率
我想为涉及检测新旧项目的存储任务计算d素数。我的问题是某些受试者的命中率为1和/或错误警报率为0,这使概率分别为100%和0%。 对于式d素是d' = z(H) - z(F),在这里z(H)和z(F)分别命中率和假警报,的Z转换。 为了计算z变换,我使用Excel函数NORMSINV(即z(H)=NORMSINV(hit rate))。但是,如果命中率或误报警率分别为1或0,该函数将返回错误。据我了解,这是因为z变换指示ROC曲线下的面积,在数学上不允许100%或0%的概率。在这种情况下,我不确定如何为具有天花板表现的拍摄对象计算d'。 一个网站建议用1-1 /(2N)和1 / 2N替换1和0比率,其中N为最大点击和错误警报数。另一个网站说“ H或F都不可以是0或1(如果是,请向上或向下稍微调整一下”)。这似乎是任意的。是否有人对此有意见或想向我指出正确的资源?

1
引导程序:估计值超出置信区间
我使用混合模型(带有交互作用的多个变量和一个随机变量)进行了引导。我得到了这个结果(只是部分): > boot_out ORDINARY NONPARAMETRIC BOOTSTRAP Call: boot(data = a001a1, statistic = bootReg, R = 1000) Bootstrap Statistics : original bias std. error t1* 4.887383e+01 -1.677061e+00 4.362948e-01 t2* 3.066825e+01 1.264024e+00 5.328387e-01 t3* 8.105422e+01 2.368599e+00 6.789091e-01 t4* 1.620562e+02 4.908711e+00 1.779522e+00 ...... 现在,我想获取截距的置信区间: > boot.ci(boot_out,type=c("norm","basic","perc"), index=1) BOOTSTRAP CONFIDENCE INTERVAL CALCULATIONS Based on …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.