统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
k折叠交叉验证的网格搜索
我有一个10倍交叉验证设置的120个样本的数据集。目前,我选择第一个保持的训练数据,并对其进行5倍交叉验证,以通过网格搜索选择gamma和C的值。我正在将SVM与RBF内核一起使用。由于我正在做十个10交叉验证以报告精度,请问,我是否在每个保留的训练数据中执行此网格搜索(有10个保留,每个包含10%的测试和90%的训练数据)?那不是很费时间吗? 如果我使用第一个保留项的gamma和C并将其用于k折交叉验证的9个保留项的其余部分,那是违反规定,因为我本来会使用火车数据获取gamma和C并再次使用火车数据的一部分作为第二次验证中的测试?

1
解析解为的位数
我有两个随机变量,αi∼iid U(0,1),i=1,2αi∼iid U(0,1),i=1,2\alpha_i\sim \text{iid }U(0,1),\;\;i=1,2,其中是均匀的分布0-1。U(0,1)U(0,1)U(0,1) 然后,这些产生一个过程,说: P(x)=α1sin(x)+α2cos(x),x∈(0,2π)P(x)=α1sin⁡(x)+α2cos⁡(x),x∈(0,2π)P(x)=\alpha_1\sin(x)+\alpha_2\cos(x), \;\;\;x\in (0,2\pi) 现在,我想知道对于给定的,的理论上75%的分位数是否存在的闭式表达式。 -我想我可以用计算机和许多实现来做到这一点,但我更喜欢封闭形式-。F−1(P(x);0.75)F−1(P(x);0.75)F^{-1}(P(x);0.75)P(x)P(x)P(x)x∈(0,2π)x∈(0,2π)x\in(0,2\pi)P(x)P(x)P(x)

1
Wishart矩阵的对数行列式的期望值
让Λ∼WD(ν,Ψ)Λ∼WD(ν,Ψ)\Lambda \sim \mathcal W_D(\nu, \Psi),即分布式根据D×DD×DD \times D,平均维威沙特分布νΨνΨ\nu \Psi和自由度νν\nu。我想要一个的表达式,E(log|Λ|)E(log⁡|Λ|)E(\log |\Lambda|)其中|Λ||Λ||\Lambda|是决定因素。 我已经用谷歌寻求答案,并得到了一些相互矛盾的信息。本文明确指出 E(log|Λ|)=Dlog2+log|Ψ|+∑i=1Dψ(ν−i+12)E(log⁡|Λ|)=Dlog⁡2+log⁡|Ψ|+∑i=1Dψ(ν−i+12) E(\log|\Lambda|) = D \log 2 + \log |\Psi| + \sum_{i = 1} ^ D \psi\left(\frac{\nu - i + 1} 2\right) 其中ψ(⋅)ψ(⋅)\psi(\cdot)表示数字函数; 据我所知,本文没有提供这一事实的消息来源。这也是Wishart在Wikipedia页面上使用的公式,其中包含Bishop的模式识别文本。ddxlogΓ(x)ddxlog⁡Γ(x)\frac d {dx} \log \Gamma(x) 在另一方面,谷歌打开了这个讨论与链接文件,指出 他们推断指出, Ë (日志| Λ |)= d 日志2 - d 日志ν + 日志| …

1
概率单纯形有哪些分布?
让是维度的概率单纯ķ - 1,即,X ∈ Δ ķ是这样的,X 我 ≥ 0和Σ 我X 我 =ΔKΔK\Delta_{K}K−1K−1K-1x∈ΔKx∈ΔKx \in \Delta_{K}xi≥0xi≥0x_i \ge 0。∑ixi=1∑ixi=1\sum_i x_i = 1 什么分派是频繁地(或公知的,或在过去的定义)在存在吗?ΔKΔK\Delta_{K} 显然,存在Dirichlet和Logit-Normal分布。在这种情况下,自然会有其他分布吗?

2
GBM分类是否遭受班级规模不平衡的困扰?
我正在处理有监督的二进制分类问题。我想使用GBM软件包将个人分类为未感染/已感染。我的未感染人数是感染者的15倍。 我想知道GBM模型在班级规模不均衡的情况下是否会受到影响?我没有找到回答该问题的参考文献。 我尝试通过为未感染的个体分配1的权重并为感染的个体分配15的权重来调整权重,但是结果却很差。

3
Auto.arima和autobox有何不同?
通过阅读该站点上的帖子,我知道有一个R 函数 auto.arima(在forecast 包中)。我也知道,IrishStat,这个网站的会员,建立了商业包装autobox在80年代初。由于这两个软件包已存在,并且会自动为给定的数据集选择Arima模型,它们有何不同之处?他们是否可能针对同一数据集产生不同的模型?

2
残差异方差的度量
该维基百科链接列出了多种检测OLS残差异方差性的技术。我想了解哪种动手操作技术在检测受异方差影响的区域时更有效。 例如,在这里,OLS“残差vs拟合”图中的中心区域的方差比图中侧面的高(我并不完全确定事实,但出于问题考虑,我们假设是这种情况)。作为确认,查看QQ图中的错误标签,我们可以看到它们与残差图中心的错误标签匹配。 但是我们如何量化方差明显更高的残差区域呢?

2
一目了然的R结构G结构是什么?
我最近一直在使用MCMCglmm包裹。我对文档中称为R结构和G结构的内容感到困惑。这些似乎与随机效应有关-特别是为它们的先验分布指定参数,但是文档中的讨论似乎假设读者知道这些术语是什么。例如: 具有3个可能元素的先验规范的可选列表:R(R结构)G(G结构)和B(固定效应).............方差结构(R和G)的先验)列出了具有逆Wishart的期望(协方差)(V)和置信度参数(nu)的列表 ...取自 这里取得。 编辑:请注意,我已经按照斯蒂芬的评论改写了其余的问题。 任何人都可以阐明什么R-结构和G-结构是光,在其中线性预测器是一个简单的方差分量模型的上下文中 β0+e0ij+u0jβ0+e0ij+u0j\beta_0 + e_{0ij} + u_{0j} 与e0ij∼N(0,σ20e)e0ij∼N(0,σ0e2)e_{0ij} \sim N(0,\sigma_{0e}^2)和u0j∼N(0,σ20u)u0j∼N(0,σ0u2)u_{0j} \sim N(0,\sigma_{0u}^2) 我用随附的一些数据制作了以下示例 MCMCglmm > require(MCMCglmm) > require(lme4) > data(PlodiaRB) > prior1 = list(R = list(V = 1, fix=1), G = list(G1 = list(V = 1, nu = 0.002))) > m1 <- MCMCglmm(Pupated ~1, random = …

1
高斯过程:函数逼近性质
我正在学习高斯过程,只听过一点点的内容。非常感谢您提出意见和答案。 对于任何数据集,高斯过程函数逼近在数据点处给出零或可忽略的拟合误差是真的吗?在另一个地方,我还听说过高斯过程对于嘈杂的数据特别有用。这似乎与任何观察到的数据的低拟合误差相冲突? 此外,离数据点越远,不确定性就越大(协方差更大)。如果是这样,它的行为是否类似于本地模型(RBF等)? 最后,是否有任何通用逼近性质?


3
MLE是否需要iid数据?还是只是独立的参数?
使用最大似然估计(MLE)估计参数涉及评估似然函数,该函数将样本(X)出现的概率映射为给定分布族(P(X = x |θ )超过θ的可能值(请注意:我对吗?)我看到的所有示例都涉及通过取F(X)的乘积来计算P(X = x |θ),其中F是局部分布θ和X的值是样本(向量)。 由于我们只是在乘以数据,因此数据是否独立?例如,我们不能使用MLE拟合时间序列数据吗?还是参数必须独立?

2
如何在R中既没有正态又没有方差相等的数据上进行双向ANOVA?
目前,我正在研究硕士论文,并计划使用SigmaPlot运行统计数据。但是,在花了一些时间处理数据后,我得出的结论是SigmaPlot可能不适合我的问题(我可能会误解了),因此我在R中开始了首次尝试,但并没有因此而变得更加容易。 计划是根据我的数据运行一个简单的TWO-WAY-ANOVA,该结果来自3种不同的蛋白质和对此进行8种不同的处理,所以我的两个因素是蛋白质和处理。我同时使用 > shapiro.test(time) 和 > ks.test(time, "norm", mean=mean(time), sd=sqrt(var(time))) 在这两种情况下(也许并不奇怪),我最终都得到了非正态分布。 哪一个给我留下了第一个问题,即哪个检验用于方差相等。我想出了 > chisq.test(time) 结果是,我的数据也没有方差相等。 我尝试了不同的数据转换(对数,中心,标准化),所有这些都不能解决我的方差问题。 现在我不知所措,如何进行ANOVA来测试哪些蛋白质和哪些治疗方法彼此之间有显着差异。我发现了有关Kruskal-Walis-Test的一些信息,但仅出于一个因素(?)。我还发现了有关排名或randamization的内容,但还没有找到如何在R中实现这些技术的方法。 有人建议我该怎么办吗? 编辑:谢谢您的回答,我对阅读有点不知所措(似乎越来越多而不是更少),但是我当然会继续前进。 根据建议,这是我的数据示例(对于格式,我感到非常抱歉,我无法找到其他解决方案或放置文件的地方。对于这一切我仍然是陌生的。): protein treatment time A con 2329.0 A HY 1072.0 A CL1 4435.0 A CL2 2971.0 A CL1-HY sim 823.5 A CL2-HY sim 491.5 A CL1+HY mix 2510.5 A CL2+HY mix …

4
在R中清洗格式不一致的数据?
我经常处理凌乱的调查数据,这需要大量清理才能完成任何统计数据。我曾经在Excel中“手动”执行此操作,有时使用Excel公式,有时一个接一个地检查条目。我开始通过编写脚本在R中完成这些任务来做越来越多的任务,这是非常有益的(好处包括记录已完成的操作,减少出错的机会以及在数据集为更新)。 但是我仍然无法有效处理某些类型的数据。例如: > d <- data.frame(subject = c(1,2,3,4,5,6,7,8,9,10,11), + hours.per.day = c("1", "2 hours", "2 hr", "2hr", "3 hrs", "1-2", "15 min", "30 mins", "a few hours", "1 hr 30 min", "1 hr/week")) > d subject hours.per.day 1 1 1 2 2 2 hours 3 3 2 hr 4 4 …
16 r  data-cleaning 

2
计算加权均值估计中的标准误差
假设w1,w2,…,wnw1,w2,…,wnw_1,w_2,\ldots,w_n和x1,x2,...,xnx1,x2,...,xnx_1,x_2,...,x_n分别从某些分布中得出iid,wiwiw_i独立于xixix_i。该wiwiw_i是严格为正。您观察到所有的wiwiw_i,但没有观察到xixix_i;相反,您观察到∑ixiwi∑ixiwi\sum_i x_i w_i。我有兴趣根据此信息估算。显然,估计 ˉ X = Σ 我瓦特我X 我E[x]E⁡[x]\operatorname{E}\left[x\right] 是无偏的,可以根据手头的信息进行计算。x¯=∑iwixi∑iwix¯=∑iwixi∑iwi \bar{x} = \frac{\sum_i w_i x_i}{\sum_i w_i} 如何计算此估算器的标准误差?对于其中副壳体只消值0和1,I天真地试图 小号Ë 听,说:√xixix_i 基本上忽略了的变化W¯¯我,却发现这个表现不佳的样本量250比周围小(这可能取决于的方差W¯¯我。)看来,也许我不有足够的信息来计算“更好”的标准误差。se≈x¯(1−x¯)∑iw2i−−−−−−−−−−−−√∑iwi,se≈x¯(1−x¯)∑iwi2∑iwi, se \approx \frac{\sqrt{\bar{x}(1-\bar{x})\sum_i w_i^2}}{\sum_i w_i}, wiwiw_iwiwiw_i

1
解释格兰杰因果关系检验的结果
我正在尝试对格兰杰因果关系进行自我教育。我已经阅读了该网站上的帖子以及在线上的几篇好文章。我还遇到了一个非常有用的工具,即“双变量Granger因果关系-免费统计计算器”,该工具可让您输入时间序列并计算Granger Stats。下面是站点中包含的示例数据的输出。我在解释结果方面也很努力。 我的问题: 我的解释方向正确吗? 我忽略了哪些关键见解? 另外,CCF图表的含义和解释是什么?(我假设CCF是互相关的。) 这是我已经解释的结果和图: Summary of computational transaction Raw Input view raw input (R code) Raw Output view raw output of R engine Computing time 2 seconds R Server 'Herman Ole Andreas Wold' @ wold.wessa.net Granger Causality Test: Y = f(X) Model Res.DF Diff. DF F p-value …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.