摘要:【目的】通过融合单个文档内部结构信息和文档整体的词向量关系进行关键词抽取。【方法】利用Word2vec将文档集中所有词汇进行向量表征,并且通过词向量计算词汇之间的相似度,进而对Text Rank算法进行改进,将候选关键词的权重按照词汇之间的相似度和邻接关系进行非均匀分配,并构建对应的概率转移矩阵用于词汇图模型的迭代计算以及关键词抽取。【结果】实现Word2vec与Text Rank的有效融合,且当训练文档集词汇分布合理时,关键词抽取效果较明显。【局限】需要进行成本较高的文档集训练,获取词向量以及词关系矩阵。【结论】文档集中的词关系有助于修正单文档内部的词关系,提升单文档的关键词抽取准确性。
分类:期刊> 自然科学与工程技术> 信息科技> 计算机软件及计算机应用
收录:CSSCI 南大期刊(含扩展版) > 北大期刊(中国人文社会科学期刊) > CSCD 中国科学引文数据库来源期刊(含扩展版) > 知网收录(中) > 维普收录(中) > 万方收录(中) > 国家图书馆馆藏 > 上海图书馆馆藏
关键词:抽取 word2vec textrank 图模型 词向量
注:因版权方要求,不能公开全文,如需全文,请咨询杂志社