4
通过数据集的随机子样本初始化K均值中心吗?
如果我有某个数据集,那么使用该数据集的随机样本来初始化聚类中心有多么聪明? 例如,假设我要5 clusters。我可以5 random samples说size=20%是原始数据集。然后,我可以对这5个随机样本中的每个样本取平均值,然后将这些均值用作我的5个初始聚类中心吗?我不知道我在哪里读这本书,但我想知道你们对这个想法的看法。 更新:请参阅此线程初始化K-means聚类:现有的方法有哪些?有关各种初始化方法的一般讨论。