统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


1
直观了解协方差,互协方差,自相关/互相关和功率谱密度
我目前正在为我的ECE学士学位学习基础统计学的决赛。 虽然我认为我的数学大部分都处于下降状态,但我缺乏直觉上的理解数字的实际含义。 我知道E [X]是X的所有结果按其概率加权的“加权平均值”。 Var [X]给出与E [X]平方的期望方差,因此告诉我们有关分布“模糊性”的一些信息。 我知道公式的其他属性,但缺乏任何直觉。有人有很好的解释/资源来帮助您吗?

5
共线变量怎么办
免责声明:这是一个家庭作业项目。 我正在尝试根据几个变量提出最佳的钻石价格模型,到目前为止,我似乎已经有了一个很好的模型。但是我遇到了两个显然是共线的变量: >with(diamonds, cor(data.frame(Table, Depth, Carat.Weight))) Table Depth Carat.Weight Table 1.00000000 -0.41035485 0.05237998 Depth -0.41035485 1.00000000 0.01779489 Carat.Weight 0.05237998 0.01779489 1.00000000 Table和Depth相互依赖,但是我仍然希望将它们包括在我的预测模型中。我对钻石进行了一些研究,发现“表”和“深度”是指钻石的顶部长度和顶部至底部的距离。由于这些钻石的价格似乎与美感相关,而美感似乎与比例有关,因此,我将使用的比率来预测价格。这是处理共线变量的标准程序吗?如果没有,那是什么?Ť一个b 升ëd Ë p 吨ħŤ一种b升ËdËpŤH\frac{Table}{Depth} 编辑:这是深度〜表的图:

1
验证Poisson回归模型的成本函数
对于我收集的计数数据,我使用泊松回归来构建模型。我使用glmR中的函数来执行此操作family = "poisson"。为了评估可能的模型(我有几个预测变量),我使用了AIC。到目前为止,一切都很好。现在,我要执行交叉验证。我已经使用包中的cv.glm函数成功完成了此操作boot。从我的文档中可以cv.glm看到,例如对于二项式数据,您需要使用特定的成本函数来获得有意义的预测误差。但是,我还不知道哪种成本函数适用于family = poisson,并且广泛的Google搜索没有产生任何特定的结果。我的问题是,任何人都需要弄清楚哪种成本函数适用cv.glm于Poisson glm。

1
韦尔奇测验的自由度是否总是小于合并测验的DF?
我正在教授基础统计课程,我们正在对两个具有不等方差的独立样本进行t检验(韦尔奇检验)。在我看到的示例中,Welch检验使用的调整后的自由度始终小于或等于。 ñ1个+ n2− 2ñ1个+ñ2-2n_1+n_2-2 总是这样吗?韦尔奇检验是否总是降低(或保持不变)合并t检验(等方差)的自由度? 并且在同一主题上,如果样本标准偏差相等,那么Welch检验的DF是否减少为?我看了一下公式,但是代数变得凌乱。ñ1个+ n2− 2ñ1个+ñ2-2n_1+n_2-2

5
如果不是泊松,那么这是什么分布?
我有一个数据集,其中包含个人在7天内执行的操作数。具体操作与该问题无关。下面是该数据集的一些描述性统计: RangeMeanVarianceNumber of observations0−77218.22791696Range0−772Mean18.2Variance2791Number of observations696 \begin{array}{|c|c|} \hline \text{Range} & 0 - 772 \\ \hline \text{Mean} & 18.2 \\ \hline \text{Variance} & 2791 \\ \hline \text{Number of observations} & 696 \\ \hline \end{array} 这是数据的直方图: 从数据的来源来看,我认为它适合泊松分布。但是,均值≠方差,并且直方图在左侧的权重很高。另外,我goodfit在R中运行测试并得到: > gf <- goodfit(actions,type="poisson", method = "MinChisq") <br> > summary(gf) <br> Goodness-of-fit test for poisson …

1
顺序蒙特卡洛滤波器的Rao-Blackwellization
在开创性论文“动态贝叶斯网络的Rao-Blackwellised粒子滤波”中,A。Doucet等人。等 提出了一种顺序蒙特卡洛滤波器(粒子滤波器),它在马尔可夫过程利用线性子结构。通过边缘化此线性结构,可以将滤波器分为两部分:使用粒子滤波器的非线性部分,以及可以由卡尔曼滤波器处理的一个线性部分(以非线性部分)。X大号ķxkLx^L_kXķ= (x大号ķ,Xñķ)xk=(xkL,xkN)x_k = (x^L_k, x^N_k)XñķxkNx^N_k 我了解边缘化部分​​(有时所描述的过滤器也称为边缘化过滤器)。我的直觉为何称其为Rao-Blackwellized粒子滤波器(RBPF),是因为高斯参数对于底层线性过程是足够的统计量,并且根据Rao-Blackwell定理,以这些参数为条件的估计量至少可以达到作为采样估计量。 Rao-Blackwell估计量定义为。在这种情况下,我猜想是蒙特卡洛估计器,是,而是高斯参数化。我的问题是我看不到本文中实际应用的位置。Ë(δ(X)| Ť(X))= δ1个(X)E(δ(X)|T(X))=δ1(X)E(\delta(X)|T(X)) = \delta_1(X)δ(X)δ(X)\delta(X)δ1个(X)δ1(X)\delta_1(X)Ť(X)T(X)T(X) 那么为什么将其称为Rao-Blackwellized粒子滤波器,Rao-Blackwellization实际发生在什么地方?


2
分类问题中类可分离性的度量
Fisher的线性判别率是衡量线性判别学习者班级可分离性的一个很好的例子。还有其他有用的指标来确定功能集是否在目标变量之间提供了良好的类分离吗?特别是,我有兴趣寻找良好的多变量输入属性以最大程度地实现目标类别的分离,并且最好采用非线性/非参数度量来快速确定它们是否提供良好的可分离性。


3
逻辑回归中变量的重要性
我可能正在处理一个可能已经解决了一百次的问题,但是我不确定在哪里可以找到答案。 当使用逻辑回归时,给定许多特征并尝试预测二进制分类值,我对选择可以很好地预测的特征子集感兴趣。 y yX1个,。。。,Xñx1,...,xnx_1,...,x_nÿyyÿyy 是否可以使用类似于套索的程序?(我只看到套索用于线性回归。) 查看拟合模型的系数是否表明了不同特征的重要性? 编辑-看到一些答案后的澄清: 当我指的是拟合系数的大小时,我指的是那些拟合到归一化(均值0和方差1)特征的系数。否则,正如@probabilityislogic指出的那样,1000x的重要性似乎不如x。 我对仅寻找最佳k子集(如@Davide所提供的)不感兴趣,而是权衡不同功能之间的相对重要性。例如,一个特征可能是“年龄”,而另一个特征可能是“年龄> 30”。它们的增量重要性可能很小,但两者都可能很重要。

2
通过基因重复水平进行富集分析
生物学背景 随着时间的流逝,某些植物物种倾向于复制其整个基因组,从而获得每个基因的额外副本。由于这种设置的不稳定性,许多这些基因随后被删除,基因组重新排列并稳定下来,准备再次复制。这些复制事件与物种形成和入侵事件相关,并且理论上说复制可以帮助植物更快地适应其新环境。 羽扇豆属开花植物属入侵安第斯山脉,是有史以来发现的最迅速的物种形成事件之一,而且,与最密切相关的属巴氏杆菌属相比,它的基因组中有更多重复副本。 现在是数学问题: 已经对羽扇豆成员和巴氏杆菌成员的基因组进行了测序,从而提供了每个物种中约25,000个基因的原始数据。通过查询已知功能基因的数据库,我现在对基因可能具有的功能有了“最佳猜测”-例如,Gene1298可能与“果糖代谢,盐胁迫反应,冷胁迫反应”相关。我想知道,巴普蒂西亚和羽扇豆之间是否有重复事件,基因丢失是随机发生的,还是具有特定功能的基因更可能被保留或删除。 我有一个脚本,它将输出如下表所示的表。L *是与功能相关的所有羽扇豆基因的计数。L 1+是与至少存在一个重复副本的功能相关的羽扇豆基因的计数。我可以得到它来产生L 2 +,L 3+等,尽管由于测序过程,L 1+比L 2+更可靠。 Function | L * | L 1+ | B * | B 1+ | fructose metabolism | 1000 | 994 | 1290 | 876 | salt stress | 56 | 45 | 90 | 54 | etc. …

2
在R randomForest中进行替换采样
randomForest实现不允许采样超过观察次数,即使使用替换采样也是如此。为什么是这样? 工作正常: rf <- randomForest(Species ~ ., iris, sampsize=c(1, 1, 1), replace=TRUE) rf <- randomForest(Species ~ ., iris, sampsize=3, replace=TRUE) 我想做的事: rf <- randomForest(Species ~ ., iris, sampsize=c(51, 1, 1), replace=TRUE) Error in randomForest.default(m, y, ...) : sampsize can not be larger than class frequency 没有分层样本的类似错误: rf <- randomForest(Species ~ …

1
动态贝叶斯系统的定义及其与HMM的关系?
来自维基百科 动态贝叶斯网络(DBN)是贝叶斯网络,它在相邻的时间步长上相互关联变量。这通常被称为“两倍时间BN”,因为它表示在任何时间点T上,变量的值都可以从内部回归值和紧邻的先验值(时间T-1)中计算出来。DBN在机器人技术中很常见,并且已经显示出了广泛的数据挖掘应用程序的潜力。例如,它们已用于语音识别,蛋白质测序和生物信息学。DBN已显示出产生与隐马尔可夫模型和卡尔曼滤波器等效的解决方案。 我想知道“即时优先值(时间T-1)”是否意味着DBN中的时间索引始终是离散的? “在任何时间点T上,都可以从内部回归变量中计算出变量的值,并且立即数在先值(时间T-1)”是否意味着DBN是离散时间的马尔可夫过程? 如果我理解正确,那么如果同时忽略状态的输出,那么HMM也是离散时间的马尔可夫过程。所以我想知道HMM和DBN是否是相同的概念?但是另一篇维基百科文章 说 隐马尔可夫模型(HMM)是一种统计马尔可夫模型,其中将要建模的系统假定为具有未观察(隐藏)状态的马尔可夫过程。HMM可被视为最简单的动态贝叶斯网络。 第一篇文章还有另一句话: DBN已显示出产生与隐马尔可夫模型和卡尔曼滤波器等效的解决方案。 谢谢!

2
R中的零膨胀计数模型:真正的优势是什么?
为了分析零膨胀的鸟类计数,我想使用R包pscl应用零膨胀的计数模型。但是,查看文档中提供的主要功能之一(?zeroinfl)的示例后,我开始怀疑这些模型的真正优势是什么。根据此处给出的示例代码,我计算了标准泊松,拟泊松和负生物模型,简单的零膨胀泊松和负二项式模型以及零膨胀泊松模型和负二项式模型,其中零分量为回归变量。然后,我检查了观测数据和拟合数据的直方图。(这是复制该代码的代码。) library(pscl) data("bioChemists", package = "pscl") ## standard count data models fm_pois <- glm(art ~ ., data = bioChemists, family = poisson) fm_qpois <- glm(art ~ ., data = bioChemists, family = quasipoisson) fm_nb <- glm.nb(art ~ ., data = bioChemists) ## with simple inflation (no regressors for zero component) …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.