统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


1
距离相关性有直观的表征吗?
我一直在注视着维基百科页面上的距离相关性,该距离相关性似乎由如何计算来表征。虽然我可以进行计算,但仍在努力寻找距离相关量度以及为什么计算看起来像它们一样。 是否存在(或许多)更直观的距离相关特征,可以帮助我理解其测量结果? 我意识到要求直觉有点含糊,但是如果我知道我要的是哪种直觉,我可能一开始就不会要求。对于两个随机变量之间的距离相关情况(即使在两个随机向量之间定义了距离相关)的情况,我也很满意。

1
为DBSCAN选择eps和minPts的例程
根据一些文献,DBSCAN是最常被引用的聚类算法,它可以基于密度找到任意形状的聚类。它有两个参数eps(作为邻域半径)和minPts(作为将一个点视为核心点的最小邻居),我认为这很大程度上取决于它们。 是否有任何常规或常用方法来选择这些参数?


3
密度估算在哪里有用?
在经过一些简短的数学之后,我认为我对内核密度估计有一点直觉。但是我也知道,就其估计量的统计特性而言,估计三个以上变量的多元密度可能不是一个好主意。 那么,在哪种情况下我应该使用非参数方法来估计双变量密度?是否有足够的价值开始担心要针对两个以上的变量进行估算? 如果您可以指向一些有关多元密度估计应用的有用链接,那就太好了。

3
使用R计算多元回归中每个预测变量所解释的方差
我进行了一次多元回归分析,该模型作为一个整体是有意义的,并解释了约13%的方差。但是,我需要找到每个重要预测变量所解释的方差量。如何使用R做到这一点? 以下是一些示例数据和代码: D = data.frame( dv = c( 0.75, 1.00, 1.00, 0.75, 0.50, 0.75, 1.00, 1.00, 0.75, 0.50 ), iv1 = c( 0.75, 1.00, 1.00, 0.75, 0.75, 1.00, 0.50, 0.50, 0.75, 0.25 ), iv2 = c( 0.882, 0.867, 0.900, 0.333, 0.875, 0.500, 0.882, 0.875, 0.778, 0.867 ), iv3 = c( …
14 r  regression  variance 

2
R中是否有一个函数可以获取找到的簇的中心并将簇分配给新数据集
我有一个多维数据集的两个部分,我们称它们为train和test。我想基于火车数据集构建一个模型,然后在测试数据集上对其进行验证。簇数是已知的。 我试图在R中应用k-means聚类,但得到了一个包含聚类中心的对象: kClust <- kmeans(train, centers=N, nstart=M) R中是否有一个功能可以获取找到的簇的中心并将簇分配给我的测试数据集? 我可以尝试其他哪些方法/算法?
14 r  clustering  k-means 


4
应用ARMA-GARCH是否需要平稳性?
我将对金融时间序列使用ARMA-GARCH模型,并想知道在应用上述模型之前该序列是否应该是固定的。我知道要应用ARMA模型,该序列应该是平稳的,但是我不确定ARMA-GARCH,因为我包括了GARCH错误,这意味着波动性聚类和非恒定方差,因此无论如何进行变换,其序列都是非平稳的。 金融时间序列通常是固定的还是非固定的?我尝试将ADF测试应用于一些易失性序列,并得到p值<0.01,这似乎表明了平稳性,但易失性序列本身的原理告诉我们该序列不是平稳的。 有人可以帮我清理一下吗?我真的很困惑


1
R中的Wilcoxon秩和检验
我将同一测试的结果应用于两个独立样本: x <- c(17, 12, 13, 16, 9, 19, 21, 12, 18, 17) y <- c(10, 6, 15, 9, 8, 11, 8, 16, 13, 7, 5, 14) 我想计算一个Wilcoxon秩和检验。 当我手动计算统计量,我得到: T W = ∑ rank (X i)= 156.5TWTWT_{W}TW=∑rank(Xi)=156.5TW=∑rank(Xi)=156.5 T_{W}=\sum\text{rank}(X_{i}) = 156.5 当我让R执行a时wilcox.test(x, y, correct = F),我得到: W = 101.5 这是为什么?统计不应仅在我执行带符号秩检验时返回吗?还是我误解了等级总和测试?W+W+W^{+}paired = …

3
机器学习的维数诅咒解释了吗?
我无法理解维数的诅咒。具体来说,我scikit-learn在用python编写教程时遇到了它。有人可以以更简单的方式解释以下内容吗?抱歉,我一直在试图理解最长的时间,无法理解他们是如何提出训练样本数量的计算以实现高效KNN估算器的? 这里是解释: 为了使估算器有效,您需要相邻点之间的距离小于某个值d,这取决于问题。在一个维度上,这平均需要n〜1 / d个点。在上述KNN示例的上下文中,如果仅由一个值在0到1之间且具有n个训练观测值的特征描述数据,则新数据的距离不会超过1 / n。因此,与类间特征变化的规模相比,只要1 / n小,最近的邻居决策规则将非常有效。 如果特征数量为p,则现在需要n〜1 / d ^ p个点。假设我们在一维中需要10个点:现在在p维中需要10 ^ p个点才能铺平[0,1]空间。随着p变大,一个好的估计量所需的训练点数呈指数增长。 在这里链接 编辑:~在该示例中,波浪号()是否也应表示近似值?还是python波浪号运算符?

1
了解不对称提案分配的都市人
我一直试图理解Metropolis-Hastings算法,以便编写代码来估计模型的参数(即)。根据参考书目,Metropolis-Hastings算法具有以下步骤:F(x )= a ∗ xf(x)=a∗xf(x)=a*x 生成ÿŤ〜q(y| XŤ)Yt∼q(y|xt)Y_t \sim q(y|x^t) Xt + 1= { YŤ,XŤ,很有可能ρ (xŤ,YŤ),很有可能1 - ρ (XŤ,YŤ),Xt+1={Yt,with probabilityρ(xt,Yt),xt,with probability1−ρ(xt,Yt),X^{t+1}=\begin{cases} Y^t, & \text{with probability} \quad \rho(x^t,Y_t), \\ x^t, & \text{with probability} \quad 1-\rho(x^t,Y_t), \end{cases} 其中ρ (x ,y)= 分钟(f(y)F(x )* q(x | y)q(y| X),1 )ρ(x,y)=min(f(y)f(x)∗q(x|y)q(y|x),1)\rho(x,y)=\min \left( \frac{f(y)}{f(x)}*\frac{q(x|y)}{q(y|x)},1 \right) 我想问几个问题: 参考书目指出,如果是对称分布,则比率变为1,该算法称为Metropolis。那是对的吗?Metropolis和Metropolis-Hastings之间的唯一区别是,第一个使用对称分布吗?那么“随机漫步”都会区(Hastings)呢?它与其他两个有何不同?q (x …

1
随机森林和预测
我正在尝试了解随机森林的工作原理。我对树木的构建方式有所了解,但无法理解“随机森林”如何对袋装样本进行预测。有人可以给我一个简单的解释吗?

3
比例差异的置信区间
我想知道是否有人可以正确地计算出两个比例之间的差异的置信区间。 样本大小为34,其中女性为19,男性为15。因此,比例差异为0.1176471。 我计算出95%的置信区间为-0.1183872和0.3536814之间的差异。当置信区间经过零时,差异在统计上并不显着。 以下是我在R中所做的工作,并给出了注释结果: f <- 19/34 # 0.5588235 m <- 15/34 # 0.4411765 n <- 34 # 34 difference <- f-m # 0.1176471 lower <- difference-1.96*sqrt((f*(1-f))/n+(m*(1-m))/n) # -0.1183872 upper <- difference+1.96*sqrt((f*(1-f))/n+(m*(1-m))/n) # 0.3536814

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.