1
稀疏的训练集是否会对SVM产生不利影响?
我正在尝试使用SVM将消息分类为不同的类别。我已经从训练集中汇编了一些理想的单词/符号列表。 对于表示消息的每个矢量,我将相应行设置为1是否存在该单词: “语料库”是:[玛丽,小羊羔,星星,闪烁] 第一条消息:“玛丽有只小羊羔”-> [1 1 1 0 0] 第二条消息:“闪烁的小星星”-> [0 1 0 1 1] 我认为这在SVM中是相当常见的设置,但是我的问题是,如果集合中包含成千上万个单词,那么实际上每条消息仅显示1-2个单词会怎样?我的训练向量集的线性相关性是否会对算法的收敛能力产生不利影响?