Institute of Computing Technology, Chinese Academy IR
基于结构驱动的网络论坛采集路径研究 | |
李恒训1; 李南波2; 邱泳钦3; 徐燕3; 刘金刚1 | |
2011 | |
发表期刊 | 计算机应用研究 |
ISSN | 1001-3695 |
卷号 | 28.0期号:009页码:3284 |
摘要 | 网络论坛中蕴涵着大量具有实用价值和商业价值的信息,是搜索引擎和问答系统信息的重要来源。针对论坛结构复杂、链接种类繁多,以及容易陷入采集陷阱等问题,提出了一种基于结构驱动的采集路径选择方法。首先根据用户标注的少量类型数据,利用DOM树对采样网页基于网页结构进行结构聚类;其次根据各节点的评价进行采集路径选择;最后对翻页链接进行有效的识别和处理。实验表明,该方法采集的覆盖率和有效率明显优于传统算法,并且应用在中国科学院计算所舆情监测平台上取得了良好的效果。 |
关键词 | 信息检索 论坛采集 结构驱动 聚类 路径选择 |
语种 | 英语 |
文献类型 | 期刊论文 |
条目标识符 | http://119.78.100.204/handle/2XEOYT63/37808 |
专题 | 中国科学院计算技术研究所期刊论文_中文 |
作者单位 | 1.首都师范大学计算机联合研究院 2.湘潭大学信息工程学院 3.中国科学院计算技术研究所 |
推荐引用方式 GB/T 7714 | 李恒训,李南波,邱泳钦,等. 基于结构驱动的网络论坛采集路径研究[J]. 计算机应用研究,2011,28.0(009):3284. |
APA | 李恒训,李南波,邱泳钦,徐燕,&刘金刚.(2011).基于结构驱动的网络论坛采集路径研究.计算机应用研究,28.0(009),3284. |
MLA | 李恒训,et al."基于结构驱动的网络论坛采集路径研究".计算机应用研究 28.0.009(2011):3284. |
条目包含的文件 | 条目无相关文件。 |
个性服务 |
推荐该条目 |
保存到收藏夹 |
查看访问统计 |
导出为Endnote文件 |
谷歌学术 |
谷歌学术中相似的文章 |
[李恒训]的文章 |
[李南波]的文章 |
[邱泳钦]的文章 |
百度学术 |
百度学术中相似的文章 |
[李恒训]的文章 |
[李南波]的文章 |
[邱泳钦]的文章 |
必应学术 |
必应学术中相似的文章 |
[李恒训]的文章 |
[李南波]的文章 |
[邱泳钦]的文章 |
相关权益政策 |
暂无数据 |
收藏/分享 |
除非特别说明,本系统中所有内容都受版权保护,并保留所有权利。
修改评论