统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
正态分布
不幸的是,有一个统计问题,我不知道从哪里开始(我正在独自学习,所以如果我听不懂的话,没有人可以问。 问题是 iid N (a ,b 2); a = 0 ; b 2 = 6 ; v a r (X 2 + Y 2)= ?X,YX,YX,Yñ(a ,b2); a = 0 ; b2= 6 ; v 一个[R (X2+ Y2)= ?N(a,b2);a=0;b2=6;var(X2+Y2)=?N(a,b^2); a=0; b^2=6; var(X^2+Y^2)=?

2
为什么这组数据没有协方差?
我对协方差如何工作的理解是,相关数据应具有较高的协方差。我遇到了一种情况,我的数据看起来很相关(如散点图所示),但协方差接近零。如果数据的相关性是相关的,如何将它们设为零? import numpy as np x1 = np.array([ 0.03551153, 0.01656052, 0.03344669, 0.02551755, 0.02344788, 0.02904475, 0.03334179, 0.02683399, 0.02966126, 0.03947681, 0.02537157, 0.03015175, 0.02206443, 0.03590149, 0.03702152, 0.02697212, 0.03777607, 0.02468797, 0.03489873, 0.02167536]) x2 = np.array([ 0.0372599 , 0.02398212, 0.03649548, 0.03145494, 0.02925334, 0.03328783, 0.03638871, 0.03196318, 0.03347346, 0.03874528, 0.03098697, 0.03357531, 0.02808358, 0.03747998, 0.03804655, 0.03213286, 0.03827639, 0.02999955, …

1
我可以在每次MCMC迭代中对大型数据集进行二次采样吗?
问题:我想执行Gibbs采样以推断大型数据集的一些后验。不幸的是,我的模型不是很简单,因此采样速度太慢。我会考虑采用变型或并行方法,但在此之前…… 问题:我想知道是否可以在每次Gibbs迭代中从数据集中随机采样(替换),以便在每个步骤中学习的实例更少。 我的直觉是,即使我更改样本,我也不会更改概率密度,因此Gibbs样本不应注意到这一窍门。我对吗?是否有人提到过这样做?

1
如何测量人群图片中的人数?
背景:以色列(以及整个中东)充满了抗议活动。 我很好奇,当得到一张照片时,估计其中有多少人(通常是一大群人的照片)。 哪种建模可以为该问题提供一些解决方案?(当然,可以使用任何开源程序包来完成。比如,R?)

1
我可以将混合模型与只有1个观察值的对象拟合吗?
我有一个非常大的数据集,随着时间的推移,我对各个位置进行了重复测量。有些位置可能有10个数据点,而有些位置只有1个数据点。我拟合了混合模型,并将位置用作随机效果。我的问题是我是否仍可以使用只有1个数据点的位置(因为您不能仅用1个数据绘制回归线)还是应该排除这些位置?

1
如何进行“啤酒和尿布”的相关分析
我的数据等于: shopper_1 = ['beer', 'eggs', 'water',...] shopper_2 = ['diapers', 'beer',...] ... 我想对此数据集进行一些分析,以获得一个具有相似含义的相关矩阵:如果您购买了x,则很可能会购买y。 使用python(或者除MATLAB以外的其他任何东西),我该如何处理?一些基本准则或指向我应该去哪里的指针将有所帮助。 谢谢, 编辑-我学到的东西: 这些类型的问题称为关联规则发现。维基百科上有一篇很好的文章,介绍了一些常用的算法。这样做的经典算法似乎是Apriori,原因是Agrawal等。等 这使我想到了Orange,这是一个python接口的数据挖掘程序包。对于Linux,最好的安装方式似乎是使用提供的setup.py从源代码安装 默认情况下,橙色读取来自文件的输入,格式为几种受支持的方式之一。 最后,一个简单的先验关联规则的学习是简单的橙色。
By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.