摘要:Web信息抽取技术一直是信息技术领域的研究热点。而且,近年来,DIV+CSS的网页布局方法开始普遍应用于网页设计中。基于此,提出了一种较为简单和实用的基于正文特征和网页结构的新闻网页正文抽取方法。首先识别和提取网页正文内容块,然后利用正则表达式滤除内容块中的HTML标记并提取网页正文。实验结果表明,该方法对正文抽取具有较高的通用性与准确率。
分类:期刊> 自然科学与工程技术> 信息科技> 无线电电子学
收录:CSCD 中国科学引文数据库来源期刊(含扩展版) > 知网收录(中) > 维普收录(中) > 万方收录(中) > CA 化学文摘(美) > SA 科学文摘(英) > JST 日本科学技术振兴机构数据库(日) > 国家图书馆馆藏 > 上海图书馆馆藏
关键词:信息抽取 正文特征 网页结构 正文内容块 正则表达式
注:因版权方要求,不能公开全文,如需全文,请咨询杂志社