Institute of Computing Technology, Chinese Academy IR
基于自动机理论的PDF文本内容抽取 | |
王晓娟1; 谭建龙2; 刘燕兵3; 刘金刚1 | |
2012 | |
发表期刊 | 计算机应用 |
ISSN | 1001-9081 |
卷号 | 32.0期号:009页码:2491 |
摘要 | 现有的从PDF文档抽取文本内容的方法(如PDFBox类库采用的方法)处理速度较低,无法满足高速网络中内容分析的需求,也不能对网络中部分到达的PDF数据包进行流式的处理。为此,提出了基于自动机理论的PDF文本内容抽取方法。该方法通过建立具有层次的关键字自动机,可以快速地抽取完整PDF文档和不完整PDF文档中的文本内容。在中文和英文PDF文档数据集下的实验结果表明,基于自动机理论的PDF文本内容抽取方法耗时仅为PDFBox方法的17%~37%。 |
关键词 | 文本内容抽取 自动机 确定的有穷自动机 不完整文档 |
语种 | 英语 |
文献类型 | 期刊论文 |
条目标识符 | http://119.78.100.204/handle/2XEOYT63/34956 |
专题 | 中国科学院计算技术研究所期刊论文_中文 |
作者单位 | 1.首都师范大学 2.中国科学院计算技术研究所 3.中国科学院大学 |
推荐引用方式 GB/T 7714 | 王晓娟,谭建龙,刘燕兵,等. 基于自动机理论的PDF文本内容抽取[J]. 计算机应用,2012,32.0(009):2491. |
APA | 王晓娟,谭建龙,刘燕兵,&刘金刚.(2012).基于自动机理论的PDF文本内容抽取.计算机应用,32.0(009),2491. |
MLA | 王晓娟,et al."基于自动机理论的PDF文本内容抽取".计算机应用 32.0.009(2012):2491. |
条目包含的文件 | 条目无相关文件。 |
个性服务 |
推荐该条目 |
保存到收藏夹 |
查看访问统计 |
导出为Endnote文件 |
谷歌学术 |
谷歌学术中相似的文章 |
[王晓娟]的文章 |
[谭建龙]的文章 |
[刘燕兵]的文章 |
百度学术 |
百度学术中相似的文章 |
[王晓娟]的文章 |
[谭建龙]的文章 |
[刘燕兵]的文章 |
必应学术 |
必应学术中相似的文章 |
[王晓娟]的文章 |
[谭建龙]的文章 |
[刘燕兵]的文章 |
相关权益政策 |
暂无数据 |
收藏/分享 |
除非特别说明,本系统中所有内容都受版权保护,并保留所有权利。
修改评论