统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
回归比率,又称克朗马尔问题
最近,随机浏览的问题引发了我的一位教授几年前对临时评论的记忆,并警告说在回归模型中使用比率。因此,我开始阅读此书,最终导致Kronmal 1993。 我想确保我正确解释了他关于如何建模这些建议的建议。 对于在从属和独立方面均具有相同分母比率的模型: ž− 1ÿ= Z− 11个ñβ0+ Z− 1XβX+ βž+ Z− 1ϵž-1个ÿ=ž-1个1个ñβ0+ž-1个XβX+βž+ž-1个ϵ Z^{-1}Y = Z^{-1}1_n\beta_0 + Z^{-1}X\beta_X + \beta_Z + Z^{-1}\epsilon 除其他比率外,还依赖于(反)分母变量的回归相关比率 分母变量(反)的权重 对于具有因变量作为比率的模型: ÿ= β0+ βXX+ Z1个ñα0+ ZXαX+ Z− 1ϵÿ=β0+βXX+ž1个ñα0+žXαX+ž-1个ϵ Y = \beta_0 + \beta_XX + Z1_n\alpha_0 + ZX\alpha_X + Z^{-1}\epsilon 用原始变量,分母和分母乘以原始变量的回归分子[分类变量是什么?] 权重(反分母) 对于仅具有独立变量比率的模型: ÿ= β0+ XβX+ Z− …


2
硬币翻转,决策过程和信息价值
想象一下以下设置:您有2个硬币,保证硬币A 为公平硬币,而硬币B可能为公平硬币,也可能不是。您被要求进行100次硬币翻转,并且您的目标是最大数目的正面。 您有关硬币B的先前信息是,硬币B被翻转3次并产生1个头。如果您的决策规则仅基于比较两个硬币正面的预期概率,则可以将硬币A翻转100次并完成操作。即使使用合理的概率贝叶斯估计(后验均值)也是如此,因为您没有理由相信硬币B产生更多的正面。 但是,如果硬币B实际上偏向正面,该怎么办?在某些情况下,通过翻转硬币B两次(因此获得有关其统计属性的信息)肯定会放弃“潜在的头脑”,这在某种意义上是有价值的,因此会影响您的决策。如何用数学方式描述“信息价值”? 问题:在这种情况下,如何在数学上构造最佳决策规则?

1
线性模型中的R平方与广义线性模型中的偏差成正比?
这是我针对这个问题的上下文:据我所知,使用加权数据和数据survey包时,我们无法在R中运行普通的最小二乘回归。在这里,我们必须使用svyglm(),而不是运行一个广义线性模型(可能是同一件事?在这里我不清楚什么是不同的)。 在OLS中,通过该lm()函数,它可以计算R平方值,我确实理解其解释。但是,svyglm()似乎并没有计算出这个误差,而是给了我一个偏差,我在互联网上的短暂旅行告诉我,这是一种拟合优度度量,其解释与R平方不同。 所以我想我基本上有两个我希望得到指导的问题: 为什么survey似乎无法在Stata中使用加权数据来在包中运行OLS ? 广义线性模型的偏差和r平方值在解释上有什么区别?


4
用kNN处理关系,权重和投票
我正在编写kNN算法,想了解以下内容: 抢七局: 如果在多数表决中没有明确的获胜者会怎样?例如,所有k个最近的邻居都来自不同的类别,或者对于k = 4,有2个来自A类的邻居和2个来自B类的邻居? 如果由于更多的邻居具有相同的距离而无法精确确定k个最近的邻居,会发生什么情况?例如,对于距离列表,(x1;2), (x2;3.5), (x3;4.8), (x4;4.8), (x5;4.8), (x6;9.2)将无法确定k = 3或k = 4最近的邻居,因为第3至第5个邻居都具有相同的距离。 重量: 我读到,在选择获胜级别之前,最好权衡k个最近的邻居。这是如何运作的?即,邻居如何加权,然后如何确定类别? 多数投票的替代方案: 除多数表决外,还有其他规则/策略来确定获胜者吗?

2
一堆正态分布的随机变量中最大的是哪个?
我有随机变量。 具有正态分布,均值且方差。的 RVS通常与平均分布和方差。一切都是相互独立的。X0,X1,…,XnX0,X1,…,XnX_0,X_1,\dots,X_nX0X0X_0μ>0μ>0\mu>0111X1,…,XnX1,…,XnX_1,\dots,X_n000111 令表示是其中最大的事件,即。我想计算或估计\ Pr [E]。我正在寻找\ Pr [E]的表达式,作为\ mu,n的函数,或者是\ Pr [E]的合理估计或近似值。EEEX0X0X_0X0>max(X1,…,Xn)X0>max(X1,…,Xn)X_0 > \max(X_1,\dots,X_n)Pr[E]Pr[E]\Pr[E]Pr[E]Pr[E]\Pr[E]μ,nμ,n\mu,nPr[E]Pr[E]\Pr[E] 在我的应用程序中,nnn是固定的(n=61n=61n=61),我想找到使\ Pr [E] \ ge 0.99的\ mu的最小值,但我也对一般问题感到好奇。μμ\muPr[E]≥0.99Pr[E]≥0.99\Pr[E] \ge 0.99

2
分类和回归树背后的数学
有人可以帮助解释CART中分类背后的一些数学吗?我想了解两个主要阶段是如何发生的。例如,我在数据集上训练了CART分类器,并使用测试数据集来标记其预测性能,但是: 如何选择树的初始根? 每个分支为何以及如何形成? 我的数据集包含15列23类的40万条记录,从混淆矩阵中获得了100%的准确性,我对数据集使用了10倍交叉验证。如果有人能帮助解释CART分类的阶段,我将非常感激。

2
卡尔曼滤波器何时会比简单的移动平均值给出更好的结果?
我最近在一个以随机速度和加速度测量粒子位置的简单示例上实现了卡尔曼滤波器。我发现卡尔曼滤波效果很好,但是随后我问自己,做一次移动平均线有什么区别?我发现,如果我使用约10个样本的窗口,则移动平均值优于Kalman滤波器,并且我试图寻找一个使用Kalman滤波器时仅使用移动平均值的优势的示例。 我觉得移动平均值比卡尔曼滤波器直观得多,您可以盲目地将其应用于信号,而不必担心状态空间机制。我觉得我在这里缺少一些基本的东西,希望有人能提供任何帮助。

2
如果许多单元的频率小于5,则卡方检验的适用性
为了找到同伴的支持(独立变量)和工作满意度(独立变量)之间的关联,我希望应用卡方检验。对等人的支持程度根据支持程度分为四类:1 =很少程度,2 =一定程度,3 =很大程度,4 =很大程度。工作满意度分为两类:0 =不满意和1 =满意。 SPSS的输出结果表明,有37.5%的单元频率小于5。我的样本大小为101,我不想将自变量中的类别减少为更少的数目。在这种情况下,还有其他测试可用于测试此关联吗?

6
面板数据与混合模型之间的差异
我想知道面板数据分析和混合模型分析之间的区别。据我所知,面板数据和混合模型都使用固定和随机效应。如果是这样,为什么它们有不同的名称?还是它们的同义词? 我阅读了以下文章,其中描述了固定,随机和混合效应的定义,但并不能完全回答我的问题:固定效应,随机效应和混合效应模型之间有什么区别? 如果有人可以向我介绍有关混合模型分析的简短参考(约200页),我也将不胜感激。补充一点,无论软件处理如何,我都希望使用混合建模参考。主要是混合建模的理论解释。

3
两个离散傅立叶变换的相似性?
在气候建模中,您正在寻找可以充分描绘地球气候的模型。这包括显示半周期性的模式:诸如厄尔尼诺南方涛动。但是模型验证通常发生在相对短的时间段内,那里有不错的观测数据(近150年)。这意味着您的模型可能会显示正确的模式,但是却是异相的,因此线性比较(如相关性)将无法证明模型运行良好。 离散傅里叶变换通常用于分析气候数据(这里是一个示例),以获取这种循环模式。是否有任何标准度量可以用作验证工具的两个DFT相似性(即模型的DFT与观察值的DFT之间的比较)? 取两个面积归一化DFT中最小值的整数(使用绝对实数值)是否有意义?我认为这将导致一个分数,其中X = 1x∈[0,1]x∈[0,1]x\in[0,1]x=1⟹x=1⟹x=1\implies完全相同的模式,并且x=0⟹x=0⟹x=0\implies完全不同的模式。这种方法的缺点是什么?


1
广义线性模型的假设
我制作了一个具有单个响应变量(连续/正态分布)和4个解释变量(其中3个是因子,第四个是整数)的广义线性模型。我使用了具有身份链接功能的高斯误差分布。我目前正在检查模型是否满足广义线性模型的假设,即: Y的独立性 正确的链接功能 解释变量的正确计量范围 没有影响力的观察 我的问题是:如何检查模型是否满足这些假设?最好的起点似乎是针对每个解释变量绘制响应变量。但是,有3个解释变量是分类的(具有1-4个级别),那么在图中我应该寻找什么? 另外,我是否需要检查解释变量之间的多重共线性和相互作用?如果是,我该如何使用分类解释变量?

1
R中的wilcox.test和coin :: wilcox_test有什么区别?
R中存在这两个函数,但我不知道它们之间的区别。似乎当wilcox.test使用时correct=FALSE,和wilcox_test(在硬币包装中)使用时,它们仅返回相同的p值distribution="aymptotic"。对于其他值,它们返回不同的p值。而且wilcox.test始终为我的数据集返回W = 0,而与参数的设置无关: x = c(1, 1, 1, 3, 3, 3, 3) 和 y = c(4, 4, 6, 7, 7, 8, 10) 另外,当我尝试使用除R以外的其他工具(一些可在线使用,其他作为Excel附加组件)时,有时它们报告的p值不同。 那么我怎么知道哪个工具给出了“正确的” p值呢? 是否存在“正确的” p值,或者如果一些工具给出的p值<0.05,我应该感到高兴吗?(有时这些工具没有提供像R这样的众多参数化可能性。) 我在这里想念什么?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.