中国科学院计算技术研究所机构知识库

Institute of Computing Technology, Chinese Academy IR

图片搜索

粘贴图片网址

CSpace > 中国科学院计算技术研究所期刊论文 > 中文

	基于自动机理论的PDF文本内容抽取
	王晓娟 1; 谭建龙2 ; 刘燕兵 3; 刘金刚 1
	2012
发表期刊	计算机应用
ISSN	1001-9081
卷号	32.0 期号:009 页码:2491
摘要	现有的从PDF文档抽取文本内容的方法（如PDFBox类库采用的方法）处理速度较低,无法满足高速网络中内容分析的需求,也不能对网络中部分到达的PDF数据包进行流式的处理。为此,提出了基于自动机理论的PDF文本内容抽取方法。该方法通过建立具有层次的关键字自动机,可以快速地抽取完整PDF文档和不完整PDF文档中的文本内容。在中文和英文PDF文档数据集下的实验结果表明,基于自动机理论的PDF文本内容抽取方法耗时仅为PDFBox方法的17%～37%。
关键词	文本内容抽取自动机确定的有穷自动机不完整文档
语种	英语
文献类型	期刊论文
条目标识符	http://119.78.100.204/handle/2XEOYT63/34956
专题	中国科学院计算技术研究所期刊论文_中文
作者单位	1.首都师范大学 2.中国科学院计算技术研究所 3.中国科学院大学
推荐引用方式 GB/T 7714	王晓娟,谭建龙,刘燕兵,等. 基于自动机理论的PDF文本内容抽取[J]. 计算机应用,2012,32.0(009):2491.
APA	王晓娟,谭建龙,刘燕兵,&刘金刚.(2012).基于自动机理论的PDF文本内容抽取.计算机应用,32.0(009),2491.
MLA	王晓娟,et al."基于自动机理论的PDF文本内容抽取".计算机应用 32.0.009(2012):2491.

条目包含的文件
条目无相关文件。

个性服务

保存到收藏夹

查看访问统计

导出为Endnote文件

谷歌学术

谷歌学术中相似的文章

[王晓娟]的文章

[谭建龙]的文章

[刘燕兵]的文章

百度学术

百度学术中相似的文章

[王晓娟]的文章

[谭建龙]的文章

[刘燕兵]的文章

必应学术

必应学术中相似的文章

[王晓娟]的文章

[谭建龙]的文章

[刘燕兵]的文章

相关权益政策

收藏/分享

所有评论 (0)

[发表评论/异议/意见]

暂无评论

评论
权益异议
反馈意见

评注功能仅针对注册用户开放，请您登录

您对该条目有什么异议，请向管理员反馈。
内容：
Email：	*
单位:
验证码：	刷新

您在知识库使用过程中有什么好的想法或者建议可以反馈给我们。
标题：	*
内容：
Email：	*
验证码：	刷新

除非特别说明，本系统中所有内容都受版权保护，并保留所有权利。

条目量16415
全文量1330
访问量807430
下载量9