统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
随机森林(或其他分类器)的分层分类
因此,我得到了大约60 x 1000的矩阵。我将其视为具有1000个特征的60个对象。这60个对象分为3类(a,b,c)。每个类别20个对象,我们知道真正的分类。我想在这60个训练示例集上进行有监督的学习,并且我对分类器的准确性(和相关指标)以及对1000个特征的特征选择都感兴趣。 首先,我的命名方式如何? 现在真正的问题是: 如我所述,我可以在上面添加随机森林,或者其他任何数量的分类器。但是有一个微妙之处-我真的只关心区分c类与a类和b类。我可以合并类a和b,但是有一种很好的方法来使用先验知识,即所有非c对象都可能形成两个不同的集群吗?我更喜欢使用随机森林或其变体,因为事实证明它对类似于我的数据有效。但是我可以说服我尝试其他方法。





1
回归系数的多元正态分布?
在阅读有关回归的教科书时,我遇到了以下段落: 线性回归系数()向量的最小二乘估计为ββ\beta β^=(XtX)−1Xtyβ^=(XtX)−1Xty \hat{\beta} = (X^{t}X)^{-1}{X^t}y 当将其视为数据的函数(将预测变量视为常数)时,它是数据的线性组合。使用中心极限定理,可以证明如果样本量较大,的分布将近似为多元正态。yyyXXXββ\beta 我肯定在文本中缺少某些内容,但是我不明白单个值如何具有分布?如何生成多个值以获得文本中提到的分布?ββ\betaββ\beta

2
当Spearman相关性比Pearson小一定数量时,它表示什么?
我有一堆相关的数据集。它们之间成对的皮尔逊相关性通常肯定比斯皮尔曼相关性大。这表明任何相关都是线性的,但是即使皮尔逊和斯皮尔曼是相同的,也可能期望这样。当皮尔逊和斯皮尔曼相关性之间存在一定的差距并且皮尔逊更大时,这意味着什么?这似乎是我所有数据集的一致特征。

1
如何使用nlmer()对重复测量数据拟合非线性混合效应模型?
我正在尝试分析重复测量的数据,并努力使其在R。我的数据基本上如下,我有两个治疗组。每组中的每个主题每天都要接受测试,并给出分数(测试正确率)。数据为长格式: Time Percent Subject Group 1 0 GK11 Ethanol 2 0 GK11 Ethanol 3 0 GK11 Ethanol 4 0 GK11 Ethanol 5 0 GK11 Ethanol 6 0 GK11 Ethanol 数据类似于对数曲线,受试者在几天内表现很差,随后迅速改善,随后达到平稳状态。我想知道这种处理方法是否会对测试性能曲线产生影响。我的想法是在中使用nlmer()该lme4软件包R。我可以使用以下方法为每个组拟合线条: print(nm1 <- nlmer(Percent ~ SSlogis(Time,Asym, xmid, scal) ~ Asym | Subject, salinedata, start = c(Asym =.60, xmid = 23, scal …

3
两个时间序列之间的关系:ARIMA
给定以下两个时间序列(x,y;见下文),在此数据中长期趋势之间的关系建模的最佳方法是什么? 当作为时间的函数进行建模时,两个时间序列都具有显着的Durbin-Watson检验,而且都不是平稳的(据我所知,这是否意味着它只需要在残差中保持平稳?)。有人告诉我,这意味着我应该先取每个时间序列的一阶差(至少,甚至是二阶),然后才能将一个模型建模为另一个函数,本质上是利用arima(1,1,0 ),arima(1,2,0)等。 我不明白为什么您需要在建模之前就下降趋势。我知道需要对自相关建模,但我不明白为什么需要进行微分。对我而言,似乎通过差分进行的去趋势消除了我们感兴趣的数据中的主要信号(在这种情况下为长期趋势),并留下了高频“噪声”(宽松地使用噪声)。确实,在模拟中,我在一个时间序列与另一个时间序列之间建立了几乎完美的关系,并且没有自相关关系,对时间序列求差使我得到的结果对于关系检测而言是违反直觉的,例如, a = 1:50 + rnorm(50, sd = 0.01) b = a + rnorm(50, sd = 1) da = diff(a); db = diff(b) summary(lmx <- lm(db ~ da)) 在这种情况下,b与a密切相关,但是b具有更多的噪声。对我来说,这表明在检测低频信号之间的关系的理想情况下,差分并不起作用。我了解到,差分通常用于时间序列分析,但是对于确定高频信号之间的关系似乎更有用。我想念什么? 示例数据 df1 <- structure(list( x = c(315.97, 316.91, 317.64, 318.45, 318.99, 319.62, 320.04, 321.38, 322.16, 323.04, 324.62, 325.68, …


4
Bootstrap,蒙特卡洛
作为作业的一部分,我被设置了以下问题: 设计并实施模拟研究,以检查引导程序的性能,以获取单变量数据平均值的95%置信区间。您的实现可以采用R或SAS。 您可能要查看的性能方面是置信区间覆盖率(即,置信区间包含真实均值的几率)和蒙特卡洛变化(即,模拟之间的上下置信限有多少变化)' 有谁知道该怎么做蒙特卡洛变化方面?我似乎什至无法解决算法或其他问题。与蒙特卡洛积分有关吗?谢谢!

3
如何在R中重新采样而不重复排列?
在R中,如果我先set.seed(),然后使用样本函数将列表随机化,是否可以保证不会生成相同的排列? 即... set.seed(25) limit <- 3 myindex <- seq(0,limit) for (x in seq(1,factorial(limit))) { permutations <- sample(myindex) print(permutations) } 这产生 [1] 1 2 0 3 [1] 0 2 1 3 [1] 0 3 2 1 [1] 3 1 2 0 [1] 2 3 0 1 [1] 0 1 3 2 …

2
随机森林是否表现出预测偏差?
我认为这是一个直截了当的问题,尽管为什么或为什么不是背后的原因可能不是。我问的原因是,我最近编写了自己的RF实施,尽管它的性能很好,但性能却不如我预期(根据Kaggle照片质量预测比赛数据集,获胜得分以及一些有关使用了哪些技术的后续信息)。 在这种情况下,我要做的第一件事是模型的图形预测误差,因此对于每个给定的预测值,我都确定了偏离正确目标值的平均偏差(或偏差)。对于我的RF,我得到以下图: 我想知道这是否是RF的常见偏差模式(如果不是,则可能是数据集和/或我的实现所特有的)。我当然可以使用该图通过补偿偏差来改善预测,但我想知道RF模型本身是否存在更基本的误差或缺点,需要解决。谢谢。 ==附录== 我的初步调查是在此博客条目随机森林偏见-更新

5
如何从二元正态分布数据中获取椭圆区域?
我有看起来像的数据: 我尝试在其上应用正态分布(内核密度估计效果更好,但我不需要这么高的精度),并且效果很好。密度图为椭圆形。 我需要获取该椭圆函数来确定一个点是否位于椭圆区域内。怎么做? 欢迎使用R或Mathematica代码。
12 r  regression  pdf  bivariate 

5
您建议使用哪种编程语言来原型化机器学习问题?
当前在Octave中工作,但是由于文档不佳,进度非常慢。 哪种语言易于学习和使用,并且有充分的文献记载来解决机器学习问题?我希望在一个小的数据集(成千上万的示例)上建立原型,因此速度并不重要。 编辑:我正在开发一个推荐引擎。因此,我对使用正则化线性回归,神经网络,SVN或协作过滤感兴趣。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.