统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
零膨胀泊松分布的均值和方差
谁能用概率质量函数显示零膨胀泊松的期望值和方差 f(y)={π+(1−π)e−λ,(1−π)λye−λy!,if y=0if y=1,2....f(y)={π+(1−π)e−λ,if y=0(1−π)λye−λy!,if y=1,2.... f(y) = \begin{cases} \pi+(1-\pi)e^{-\lambda}, & \text{if }y=0 \\ (1-\pi)\frac{\lambda^{y}e^{-\lambda}}{y!}, & \text{if }y=1,2.... \end{cases} 其中是通过二项式过程观察到的零值的概率,而是泊松的均值的推导?ππ\piλλ\lambda 结果为期望值,方差为。μ=(1−π)λμ=(1−π)λ\mu =(1-\pi)\lambdaμ+π1−πμ2μ+π1−πμ2\mu+ \frac{\pi}{1-\pi}\mu^{2} 添加:我正在寻找一个过程。例如,您可以使用力矩生成功能吗?最终,我想看看如何做到这一点,以更好地理解零膨胀伽玛和其他。

3
电影收视率预测的分类模型
我对数据挖掘有些陌生,并且正在研究用于电影收视率预测的分类模型。 我已经从IMDB收集了数据集,并计划在模型中使用决策树和最近邻方法。我想知道哪种免费的数据挖掘工具可以提供我需要的功能。

2
分类变量之间的共线性
关于连续预测变量的共线性有很多,但我在分类预测变量上找不到太多。我的数据如下所示。 第一个因素是遗传变量(等位基因计数),第二个因素是疾病类别。显然,基因在疾病之前,并且是显示导致诊断的症状的因素。但是,像SPSS心理中通常使用的II型或III型平方和的常规分析会失去效果。输入适当的订单(因为它与订单有关)时,我进行平方和分析的类型就会选择它。此外,疾病过程中可能存在与基因无关的额外成分,这些成分与II型或III型不能很好地鉴定,请参阅下面的anova (lm1) vs lm2或Anova。 示例数据: set.seed(69) iv1 <- sample(c(0,1,2), 150, replace=T) iv2 <- round(iv1 + rnorm(150, 0, 1), 0) iv2 <- ifelse(iv2<0, 0, iv2) iv2 <- ifelse(iv2>2, 2, iv2) dv <- iv2 + rnorm(150, 0, 2) iv2 <- factor(iv2, labels=c("a", "b", "c")) df1 <- data.frame(dv, iv1, iv2) library(car) chisq.test(table(iv1, …



1
时间序列差异的置信区间
我有一个用于模拟某些过程的时间序列的随机模型。我对将一个参数更改为特定值的效果感兴趣,并希望显示时间序列(例如模型A和模型B)与某种基于仿真的置信区间之间的差异。 我一直在简单地运行来自模型A的一堆模拟和来自模型B的一堆模拟,然后在每个时间点减去中值以找到整个时间的中值差。我使用相同的方法来找到2.5和97.5分位数。这似乎是一种非常保守的方法,因为我没有共同考虑每个时间序列(例如,每个点在以前和将来都被认为独立于所有其他时间点)。 有一个更好的方法吗?

2
正确使用和解释零膨胀伽玛模型
背景:我是一名生物统计学家,目前正在努力研究细胞表达率数据集。该研究使从各种供体中成组收集的大量细胞暴露于某些肽。细胞要么表达某些生物标志物,要么不表达。然后记录每个捐助者群体的答复率。应答率(以百分比表示)是关注的结果,而肽暴露则是预测因素。 请注意,观察结果集中在捐助者之内。 由于我只有汇总数据,因此我将捐助方的回应率视为连续数据(至少目前如此)。 复杂性源于我的数据中有很多零的事实。太多不容忽视。我正在考虑使用零膨胀伽玛模型来处理这样一个事实,即我歪曲了连续数据以及过多的零。我也考虑过Tobit模型,但是由于它假设检查范围是下限,而不是真正的零(计量经济学家可能会说这是没有意义的),因此它看起来很差。 问题:通常来说,什么时候使用零膨胀伽玛模型合适?也就是说,有什么假设?以及如何解释其推论?如果您有任何讨论此文章的链接,我将不胜感激。 我在SAS-L上找到了一个链接,其中Dale McLerran为零膨胀的伽马模型提供了NLMIXED代码,因此这似乎是可能的。尽管如此,我还是不想盲目地充电。

3
如何在R中制作华夫饼图?
已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 如何在R中使用饼图来绘制华夫饼图呢? help.search("waffle") No help files found with alias or concept or title matching ‘waffle’ using fuzzy matching. 我发现在Google上搜索得最近的是镶嵌图。

7
如果相关性并不意味着因果关系,那么知道两个变量之间的相关性有什么价值?
假设某位企业主(或市场营销人员或了解散点图的任何人)显示了两个变量的散点图:过去5年(或其他时间范围)的广告数量与每月产品销售数量的比较还有更多样本。我只是制作了一个)。 现在,他/她看到了散点图,并被告知相关系数(corr)为: 1或 0.5或 0.11或 0或 -0.75或 -1 基本上任何有效值 corr 问题:这甚至对散点图的决策者或任何消费者意味着什么?仅以此为基础就可以做出哪些决定? 即:看到任何两个变量之间的相关性有什么用?一个人可以孤立地处理这些信息吗?仅仅是看什么而不考虑将其包括在回归分析中还是有更实际的用途? 很好奇,我一直都在使用这种技术,但是有人告诉我,关联本身并没有多大用处-那么“ IS”有什么用?

2
在与威尔克斯定理的有限混合中找到高斯数?
假设我有一组独立的,均匀分布的单变量观测值以及关于x是如何产生的两个假设:xxxxxx : x是从均值和方差未知的单个高斯分布中得出的。H0H0H_0xxx : x是由两个均值,方差和混合系数未知的高斯混合而成的。HAHAH_Axxx 如果我理解正确,则这些是嵌套模型,因为如果将两个高斯的参数约束为相同或将两个高斯之一的混合系数约束为零,则可以用H A来描述表示的模型。。 H0H0H_0HAHAH_A 因此,看来您应该能够使用EM算法来估计的参数,然后使用Wilks定理来确定H A下数据的可能性是否明显大于H 0下。假设EM算法将在此处收敛到最大可能性,这是一个小小的信念飞跃,但这是我愿意做的。HAHAH_AHAHAH_AH0H0H_0 我在蒙特卡洛模拟中对此进行了尝试,假设比H 0(第二个高斯和混合参数的均值和方差)多3个自由度。当我从H 0模拟数据时,我得到的P值分布基本上是不均匀的,并且丰富了较小的P值。(如果EM不能收敛到真正的最大似然,则可以预期正好相反。)我对产生这种偏差的Wilks定理的应用有什么问题?HAHAH_AH0H0H_0H0H0H_0


8
囚犯悖论
我进行了一次锻炼,但还不太清楚。 囚犯悖论三名被单独监禁的囚犯A,B和C在同一天被判处死刑,但由于有法定假日,州长决定对一名囚犯予以赦免。囚犯已被告知这一点,但被告知他们直到预定执行死刑的那一天才知道要解救其中一名。 囚犯A对囚犯说:“我已经知道至少有另外两名囚犯将被处决,因此,如果您告诉我将被处决的人的名字,您将不会给我任何有关我自己被处决的信息” 。 狱卒接受了这一点,并告诉他C肯定会死。 当时的原因是:“在我知道要执行C之前,我有三分之一的机会得到赦免。现在我知道无论是B还是我本人都将被赦免,赔率已提高为2分之1。” 但是狱卒指出:“如果我说过B会死,那么我可能会得出类似的结论,而我肯定会回答B或C,那么为什么要问呢?”。 A获得赦免的机会是什么,为什么?构造一个可以说服他人正确的解释。 您可以通过贝叶斯定理,绘制信念网络或通过常识来解决此问题。无论选择哪种方法,都应加深您对条件概率这个看似简单的概念的理解。 这是我的分析: 这看起来像是Monty Hall问题,但并非完全如此。如果A告诉I change my place with B他C会死后说,他有2/3的机会被保存。如果他不这样做,那么我想说他活着的机会是1/3,就像您在Monty Hall问题中没有改变选择时一样。但同时,他是一个由2个人组成的小组,一个人应该死,所以很容易说他的机率是1/2。 因此,矛盾仍然存在,您将如何处理这个问题。另外,我不知道如何建立对此的信任网络,所以我很感兴趣。

2
我应该为每个社区运行单独的回归,还是社区可以简单地作为聚合模型中的控制变量?
我正在运行带有连续资产索引变量作为DV的OLS模型。我的数据来自三个相似的社区,彼此之间的地理位置非常接近。尽管如此,我认为使用社区作为控制变量很重要。事实证明,社区在1%的水平(-4.52的t评分)上具有重要意义。社区是3个不同社区中的1个的名义/类别变量,编码为1,2,3。 我的问题是,这种高度的意义是否意味着我应该对社区进行个别回归,而不是作为一个整体。否则,使用社区作为控制变量是否可以做到这一点?


3
为什么
有一个回归模型,其中且且,其相关系数为。Y=a+bXY=a+bXY = a + bXa=1.6a=1.6a = 1.6b=0.4b=0.4b=0.4r=0.60302r=0.60302r = 0.60302 如果随后将和切换,并且等式变为,其中和,则值为。XXXYYYX=c+dYX=c+dYX = c + dYc=0.4545c=0.4545c=0.4545d=0.9091d=0.9091d=0.9091rrr0.603020.603020.60302 我希望有人能解释为什么(d×b)0.5(d×b)0.5(d\times b)^{0.5}也是0.603020.603020.60302。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.