-
题名基于图核算法的文本分类
被引量:3
- 1
-
-
作者
蒋强荣
宋烈金
-
机构
北京工业大学信息学部
-
出处
《计算机与现代化》
2017年第11期13-16,61,共5页
-
文摘
在文本分类研究中,向量空间模型具有表示形式简单的特点,但只能表示特征词的词频信息而忽视了特征词间的结构信息和语义语序信息,所以可能导致不同文档被表示为相同向量。针对这种问题,本文采用图结构模型表示文本,把文本表示成一个有向图(简称文本图),可有效解决结构化信息缺失的问题。本文将图核技术应用于文本分类,提出适用于文本图之间的相似度计算的图核算法——间隔通路核,然后利用支持向量机对文本进行分类。在文本集上的实验结果表明:与向量空间模型相比,间隔通路核相比于其他核函数的分类准确率更高,所以间隔通路核是一种很好的图结构相似性计算算法,能广泛应用于文本分类中。
-
关键词
图结构
向量空间模型
间隔通路核
支持向量机
文本分类
-
Keywords
graph structure
vector space model
gap walk kernel
support vector machine
text categorization
-
分类号
TP391
[自动化与计算机技术—计算机应用技术]
-