统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


5
适当的时间数据聚类技术?
我有活动频率的时间数据。我想识别数据中的群集,这些群集指示具有相似活动级别的不同时间段。理想情况下,我想在不先验指定集群数量的情况下识别集群。 什么是合适的聚类技术?如果我的问题没有足够的信息来回答,那么确定适当的聚类技术需要提供哪些信息? 以下是我正在想象的数据/集群类型的说明:

1
导出负熵。被卡住
因此,这个问题有些牵连,但我一直在努力使之尽可能简单。 目标:长话短说,负向性的派生不涉及高阶累积量,我正试图了解它是如何产生的。 背景:(我理解所有这些) 我正在自学这本书的“独立组件分析”书。(如果您有一本书-“非多项式函数的熵近似”,则该问题来自第5.6节)。 我们有,它是一个随机变量,我们希望从一些观察中估计出其负熵。的PDF 由。负熵只是一个标准化高斯随机变量的微分熵与的微分熵之间的差。此处的微分熵由给出,使得:x p x(ζ )x 高xxxxxxpx(ζ)px(ζ)p_x(\zeta)xxxHHH H(x)=−∫∞−∞px(ζ)log(px(ζ))dζH(x)=−∫−∞∞px(ζ)log(px(ζ))dζ H(x) = -\int_{-\infty}^{\infty} p_x(\zeta) \: log(p_x(\zeta)) \: d\zeta 因此,负熵由 J(x)=H(v)−H(x)J(x)=H(v)−H(x)J(x) = H(v) - H(x) 其中是标准化的高斯rv,PDF由ϕ (ζ )给出。vvvϕ(ζ)ϕ(ζ)\phi(\zeta) 现在,作为这种新方法的一部分,我的书得出了的PDF的估算值,其估算公式为:xxx px(ζ)=ϕ(ζ)[1+∑iciFi(ζ)]px(ζ)=ϕ(ζ)[1+∑iciFi(ζ)] p_x(\zeta) = \phi(\zeta) [1 + \sum_{i} c_i \; F^{i}(\zeta)] (其中。顺便说,我是不是一个电源,但索引代替)。ci=E{Fi(x)}ci=E{Fi(x)}c_i = \mathbb{E}\{F^i(x)\}iii 现在,我“接受”这个新的PDF公式,并在第二天询问。这不是我的主要问题。不过,他现在所做的是将的PDF版本重新插入负熵方程,最后得到:xxx J(x)≈12∑iE{Fi(x)}2J(x)≈12∑iE{Fi(x)}2 J(x) \approx \frac{1}{2}\sum_i\mathbb{E} \{F^i(x)\}^2 请记住,sigma(在此以及在本帖子的其余部分)只是在索引周围循环。例如,如果我们只有两个函数,则信号将在i = …

3
PCA的成分真的代表方差百分比吗?它们的总和是否可以超过100%?
奥赖利(O'Reilly)的“黑客机器学习”说,每个主成分代表方差的百分比。我引用了以下页面的相关部分(第8章,第207页)。在与另一位专家交谈时,他们同意这是百分比。 但是,这24个组件的总和为133.2095%。这个怎么可能? 在说服自己可以使用PCA之后,我们如何在R中做到这一点?同样,这是R发挥作用的地方:整个PCA可以在一行代码中完成。我们使用princomp函数运行PCA: pca <- princomp(date.stock.matrix[,2:ncol(date.stock.matrix)]) 如果仅在R中键入pca,我们将看到主要组成部分的快速摘要: Call: princomp(x = date.stock.matrix[, 2:ncol(date.stock.matrix)]) Standard deviations: Comp.1 Comp.2 Comp.3 Comp.4 Comp.5 Comp.6 Comp.7 29.1001249 20.4403404 12.6726924 11.4636450 8.4963820 8.1969345 5.5438308 Comp.8 Comp.9 Comp.10 Comp.11 Comp.12 Comp.13 Comp.14 5.1300931 4.7786752 4.2575099 3.3050931 2.6197715 2.4986181 2.1746125 Comp.15 Comp.16 Comp.17 Comp.18 Comp.19 Comp.20 Comp.21 1.9469475 …
13 r  pca 

3
衡量结块的标准方法?
我有很多数据,我想做一些看起来很简单的事情。在大量数据中,我对特定元素的聚集量感兴趣。假设我的数据是这样的有序集合:{A,C,B,D,A,Z,T,C ...}。假设我想知道A是否趋于彼此相邻,而不是随机(或更均匀)分布在整个集合中。这就是我所说的“笨拙”属性。 现在,是否有一些简单的数据“堆积”度量方法?也就是说,一些统计信息将告诉我距离随机分布的距离有多远?如果没有简单的方法可以做到,那么困难的方法大概是什么?任何指针,不胜感激!

5
估计百分比作为回归中的因变量
我将38项考试中学生的排名百分比作为我研究中的因变量。排名百分比由(学生的等级/考试中的学生人数)计算得出。这个因变量具有几乎均匀的分布,我想估计一些变量对因变量的影响。 我使用哪种回归方法?

2
如何在多元回归分析中使用
下图是回归测试的残留散点图,对于这些测试,可以肯定已经满足“正态性”,“均方差性”和“独立性”的假设!为了测试“线性”假设,尽管通过查看图表可以推测出该关系是曲线的,但是问题是:“ R2线性”的值如何用于测试线性假设?“ R2线性”值确定该关系是否为线性的可接受范围是什么?如果不满足线性假设并且对IV进行转换也无济于事怎么办? 这是测试完整结果的链接。 散点图:

6
学习如何实现集成方法的资源
我从理论上了解了它们的工作方式(但有一定的了解),但不确定如何实际使用集成方法(例如投票,加权混合等)。 有什么好的资源可以实现集成方法? 是否有关于Python实现的特殊资源? 编辑: 为了根据讨论的讨论清理一些内容,我不是在寻找诸如randomForest等的集成算法。而是,我想知道如何组合不同算法的不同分类。 例如,假设某人使用逻辑回归,SVM和其他一些方法来预测某个观测值的类别。根据这些预测来获取班级的最佳估计的最佳方法是什么?

1
帮助我了解贝叶斯glm中的
我正在尝试对此处的数据运行贝叶斯logit 。我在R bayesglm()中的arm包中使用。编码非常简单: df = read.csv("http://dl.dropbox.com/u/1791181/bayesglm.csv", header=T) library(arm) model = bayesglm(PASS ~ SEX + HIGH, family=binomial(link="logit"), data=df) summary(model) 给出以下输出: Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 0.10381 0.10240 1.014 0.311 SEXMale 0.02408 0.09363 0.257 0.797 HIGH -0.27503 0.03562 -7.721 1.15e-14 *** --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 …
13 r  bayesian  p-value 

4
寻求费舍尔关于能源部的报价的真实例证
我和我的团队想向公司的非统计学家介绍实验设计的实用性。这些非统计人员也是我们的客户,在收集数据之前,他们通常不咨询我们。您是否知道一些真实的例子,可以很好地说明费舍尔的名言:“在实验完成后打电话给统计学家,可能只不过是要求他进行验尸检查:他只能说出实验死了什么的。” ?优选地,我们正在工业/制药/生物环境中寻找例证。我们想到一个无定论的统计分析示例,如果初步设计合理,它可能会成功,但也许还有其他可能的例证。

2
为什么混乱的问题对于大样本量来说很棘手?
假设我们有一组点。每个点y i是使用分布 p (y i | x )= 1生成的y ={ y1个,ÿ2,… ,yñ}y={y1,y2,…,yN}\mathbf{y} = \{y_1, y_2, \ldots, y_N \}ÿ一世yiy_i 为了获得后为X我们写 p(X|Ý)αp(Ý|X)p(X)=p(X) ñ Π我=1个p(ÿ我|X)。 根据Minka的关于期望传播的论文,我们需要2N计算以获得后验p (ÿ一世| x)= 12ñ(x ,1 )+ 12ñ(0 ,10 )。p(yi|x)=12N(x,1)+12N(0,10). p(y_i| x) = \frac12 \mathcal{N}(x, 1) + \frac12 \mathcal{N}(0, 10). Xxxp (x | y)∝ p (y | x )p …


1
在R中使用glmnet进行预测
我正在尝试使用glmnetR中的包对一些数据进行建模。假设我有以下数据 training_x <- data.frame(variable1 = c(1, 2, 3, 2, 3), variable2 = c(1, 2, 3, 4, 5)) y <- c(1, 2, 3, 4, 5) (这是一种简化;我的数据要复杂得多。)然后,我使用以下代码创建了glmnet模型。 x <- as.matrix(training_x) library(glmnet) GLMnet_model_1 <- glmnet(x, y, family="gaussian", alpha=0.755, nlambda=1000, standardize=FALSE, maxit=100000) 我正在使用,standardize=FALSE因为我的现实生活数据已经标准化。然后,我要对一组新数据进行预测。假设我的新数据是: newdata <- as.matrix(data.frame(variable1 = c(2, 2, 1, 3), variable2 = c(6, …
13 r  glmnet 

1
有趣的统计考试答案[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 7年前关闭。 改正考试可能是老师最无聊的任务。 但这对于我们收集有趣的统计数据考试答案可能很有趣。 每个答案一个条目。
13 teaching  humor 


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.