统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


2
什么是学习Emacs口语统计(带R)的良好参考/建议?
我已经使用R几年了,但是我一直使用GUI,例如Tinn-R,JGR和最近的R-Studio。 尽管我喜欢R-Studio的界面,但我觉得对于较长的程序,几乎没有/没有图形,我可以利用更基本的文本编辑器(如Emacs)提供的快捷方式来更有效地编码。 我安装了Emacs和ESS插件,一切正常,并且已经测试了一些代码,但是我很难适应它,并且找不到合适的参考手册。 Google搜索返回了一些过时的网站,这些网站的教程主要侧重于安装和配置插件,而官方网站上的手册对我来说有点过于繁琐。 我正在寻找一个相对简短的介绍(最好是带有屏幕快照和热键列表),以供熟悉R而不是Emacs的人士使用。 任何参考或其他入门提示将不胜感激。
9 r  software 

3
Boxplot有几种分布?
我需要在R中的单个图形中绘制20个分布,即使使用boxwex = 0.3,对于常规boxplot(20个框)来说,它看起来也不好(混乱)。您能否建议我如何在R中绘制20种分布的箱形图,用点表示中位数,而用线代替盒形,如下图所示。如果有任何R方法可以产生不错的箱形图,尤其是要在单个图形中显示多个分布的情况,也请提出建议。 -----0----
9 r  boxplot 

2
了解岭回归结果
我是岭回归的新手。当我应用线性岭回归时,我得到以下结果: >myridge = lm.ridge(y ~ ma + sa + lka + cb + ltb , temp, lamda = seq(0,0.1,0.001)) > select(myridge) modified HKB estimator is 0.5010689 modified L-W estimator is 0.3718668 smallest value of GCV at 0 问题: 可以得到零GCV吗? 这到底是什么意思? 我的模型有问题吗? 我如何找到 [R2[R2R^2值myridge?

4
非对称距离测度的聚类
如何将要素与非对称距离度量聚类? 例如,假设您要以星期几为特征对数据集进行聚类-从星期一到星期五的距离与从星期五到星期一的距离是不同的。 您如何将其纳入聚类算法的距离度量中?

1
如何在rpart()中选择分割数?
我已经使用rpart.control了minsplit=2,并得到了以下结果rpart()功能。为了避免数据过拟合,是否需要使用拆分3或拆分7?我不应该使用拆分7吗?请告诉我。 在树构造中实际使用的变量: [1] ct_a ct_b usr_a Root node error: 23205/60 = 386.75 n= 60 CP nsplit rel error xerror xstd 1 0.615208 0 1.000000 1.05013 0.189409 2 0.181446 1 0.384792 0.54650 0.084423 3 0.044878 2 0.203346 0.31439 0.063681 4 0.027653 3 0.158468 0.27281 0.060605 5 0.025035 4 0.130815 0.30120 0.058992 …
9 r  cart  rpart 

2
您希望LARS找到的模型与穷举搜索找到的模型有何不同?
更多信息;假设 您事先知道要选择多少个变量,并且您在LARS过程中设置了复杂度损失,例如要使具有不为0系数的变量恰好有多少, 计算成本不是问题(变量的总数很小,例如50), 所有变量(y,x)都是连续的。 在什么设置下,LARS模型(即LARS拟合中具有非零系数的那些变量的OLS拟合)与系数相同但通过穷举搜索找到的模型(la regsubsets())最大不同? 编辑:我使用的是50个变量和250个观测值,它们的真实系数是从标准高斯得出的,除了10个变量的“真实”系数为0(并且所有特征彼此之间具有很强的相关性)。这些设置显然不好,因为两组所选变量之间的差异很小。这实际上是一个问题,应该模拟哪种类型的数据配置以获得最大的差异。

1
如何对两个不同尺度的变量求和?
如果我有两个遵循两个不同分布且具有不同标准偏差的变量...我该如何转换两个变量,以便在求和时两个结果不会被波动更大的“驱动”。 例如...变量A的易失性低于变量B(范围从0到3000),并且变量B往返。300至350。 如果仅将两个变量加在一起,结果显然将由A驱动。

1
如何从先验和似然计算后验密度估计?
我试图了解如何使用贝叶斯定理来计算后验,但被计算方法所困扰,例如,在以下情况下,我不清楚如何获取先验和似然的乘积,然后计算出后: 对于此示例,我有兴趣计算的后验概率,并且在上使用标准正态先验,但是我想知道如何通过MCMC链表示的上的先验计算后验,因此我将使用1000个样本作为起点。μμ\muμμ\mu p (μ )〜Ñ(μ = 0 ,σ= 1 )p(μ)∼N(μ=0,σ=1)p(\mu)\sim N(\mu = 0, \sigma = 1)μμ\mu 从先前的样本1000。 set.seed(0) prior.mu <- 0 prior.sigma <- 1 prior.samples <- sort(rnorm(1000, prior.mu, prior.sigma)) 做一些观察: observations <- c(0.4, 0.5, 0.8, 0.1) 并计算可能性,例如:p (ÿ| μ,σ)p(y|μ,σ)p(y | \mu, \sigma) likelihood <- prod(dnorm(observations, mean(prior.samplse), sd(prior.samples))) 我不太了解的是: 什么时候/如何将先验乘以可能性? 什么时候/如何规范后验密度? …


1
使用二阶泰勒级数传播误差
我正在阅读John Rice的文章“数学统计和数据分析”。我们关注随机变量的期望值和方差的近似值。我们能够计算随机变量的期望值和方差,并且我们知道关系。因此,可以使用关于的泰勒级数展开来逼近的期望值和方差。YYYXXXY=g(X)Y=g(X)Y = g(X)YYYgggμXμX\mu_X 在第162页上,他列出了3个方程式。 使用一阶泰勒级数展开式的的期望值。它是:。这在我的问题后面称为。YYYμY≈g(μX)μY≈g(μX)\mu_Y \approx g(\mu_X)E(Y1)E(Y1)E(Y_1) 使用一阶泰勒级数展开式的的方差。它是:。这在我的问题后面称为。YYYσ2Y≈σ2X(g′(μX))2σY2≈σX2(g′(μX))2\sigma_Y^2 \approx \sigma_X^2 (g'(\mu_X))^2Var(Y1)Var(Y1)Var(Y_1) 使用二阶泰勒级数展开式的的期望值。它是。在我的问题中稍后将其称为E(Y_2)。YYYμY≈g(μX)+12σ2Xg′′(μX)μY≈g(μX)+12σX2g″(μX)\mu_Y \approx g(\mu_X) + \frac12 \sigma_X^2 g''(\mu_X)E(Y2)E(Y2)E(Y_2) 请注意,Y有两个不同的表达式,YYY因为我们在泰勒级数展开中使用了两个不同的阶数。等式1和2表示Y1=g(X)≈g(μX)+(X−μX)g′(μX)Y1=g(X)≈g(μX)+(X−μX)g′(μX)Y_1 = g(X) \approx g(\mu_X) + (X-\mu_X)g'(\mu_X)。等式3表示Y2=g(X)≈g(μX)+(X−μX)g′(μX)+12(X−μX)2g′′(μX)Y2=g(X)≈g(μX)+(X−μX)g′(μX)+12(X−μX)2g″(μX)Y_2 = g(X) \approx g(\mu_X) + (X-\mu_X)g'(\mu_X) + \frac12 (X-\mu_X)^2 g''(\mu_X)。 注意,没有具体给出Var(Y_2)的方程Var(Y2)Var(Y2)Var(Y_2)。后来,当作者实际上指的是Y_2的期望值(公式3)时,作者似乎将其用于Y_1的方差Y1Y1Y_1(公式2 )。这似乎暗示Var(Y_2)= Var(Y_1)。Y2Y2Y_2Var(Y2)=Var(Y1)Var(Y2)=Var(Y1)Var(Y_2) = Var(Y_1) 我尝试手动计算,但表达式却变得有些复杂。这是我的工作(我停了下来,因为最终我得到了期望的项): Var(Y2)Var(Y2)Var(Y_2)X3X3X^3Var(Y2)=E[(g(μX)+(X−μX)a+12(X−μX)2b−g(μX)−12σ2Xb)2]=E[((X−μX)a+(12(X−μX)2−12σ2X)b)2]=E[(ca+(12c2−12σ2X)b)2]=E[c2a2+ca(c2−σ2X)b+14(c2−σ2X)2b2]=E[(X2−2XμX+μ2X)a2+(X−μX)a((X2−2XμX+μ2X)−σ2X)b+14((X2−2XμX+μ2X)−σ2X)2b2]Var(Y2)=E[(g(μX)+(X−μX)a+12(X−μX)2b−g(μX)−12σX2b)2]=E[((X−μX)a+(12(X−μX)2−12σX2)b)2]=E[(ca+(12c2−12σX2)b)2]=E[c2a2+ca(c2−σX2)b+14(c2−σX2)2b2]=E[(X2−2XμX+μX2)a2+(X−μX)a((X2−2XμX+μX2)−σX2)b+14((X2−2XμX+μX2)−σX2)2b2] \begin{aligned} Var(Y_2) &= E[( g(\mu_X) + (X-\mu_X)a …

5
检测歌曲的一部分
希望这不是太主观... 无论音乐风格如何,我都在寻找某种方向来检测歌曲的不同“部分”。我不知道在哪里看,但是相信其他StackOverflow网站的强大功能,我认为这里有人可以帮助您指明方向。 用最基本的术语来说,只要将连续的重复模式分组并将其称为“部分”,就可以检测到歌曲的不同部分。这可能并不那么难-即使有很小的变化,计算机也可以很好地检测信号的重复。 但是,“部分”重叠时却很难,就像大多数音乐中那样。 很难说哪种音乐最适合这种系统。我猜想大多数古典风格的交响音乐都将最容易处理。 关于在该领域寻找研究的任何想法?

2
如何测试回归系数是否受分组变量影响?
我根据调节变量(例如性别)对两组样本进行了回归。我正在通过检查回归的显着性是否在一组中丢失而在另一组中保留,来对调节效果进行简单测试。 Q1:上述方法是有效的,不是吗? 问题2:我的研究的置信度设置为95%。对于一组,回归显着为.000。另一方面,它在0.038处是显着的。因此,我相信我必须接受两个回归都是显着的,并且没有缓和作用。通过接受回归在显着性不是0.01时很重要,是否会导致I型错误(接受伪造的论点)?

3
发现数据新知识的准则
我策划一些事情来指出自己或其他人。通常,一个问题开始这个过程,并且经常有人问一个特定答案的希望。 如何以较少偏见的方式学习有关数据的有趣事情? 现在,我大致遵循此方法: 摘要统计。 带状图。 散点图。 也许重复一个有趣的数据子集。 但这似乎还不够系统或科学。 是否有可遵循的准则或程序来揭示我不想问的有关数据的信息?我怎么知道做完足够的分析之后?

1
面板研究中时间序列中缺失计数数据的多重估算
我正在尝试解决一个涉及面板数据研究中缺失数据的估算的问题(不确定我是否正确使用了“面板数据研究”,正如我今天所学到的那样。)我拥有2003年的总死亡计数数据到2009年,所有8个地区和4个年龄段的男性和女性的所有月份。 数据框看起来像这样: District Gender Year Month AgeGroup TotalDeaths Northern Male 2006 11 01-4 0 Northern Male 2006 11 05-14 1 Northern Male 2006 11 15+ 83 Northern Male 2006 12 0 3 Northern Male 2006 12 01-4 0 Northern Male 2006 12 05-14 0 Northern Male 2006 12 15+ 106 …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.