[发明专利]一种及时高效的互联网信息爬取方法有效
申请号: | 201110430997.0 | 申请日: | 2011-12-20 |
公开(公告)号: | CN103176985A | 公开(公告)日: | 2013-06-26 |
发明(设计)人: | 杨风雷;黎建辉;杨俊峰;虞路清;周园春 | 申请(专利权)人: | 中国科学院计算机网络信息中心 |
主分类号: | G06F17/30 | 分类号: | G06F17/30 |
代理公司: | 北京君尚知识产权代理事务所(普通合伙) 11200 | 代理人: | 余长江 |
地址: | 100190 *** | 国省代码: | 北京;11 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | 本发明公开了一种及时高效的互联网信息爬取方法,属于信息技术领域。本方法为:1)设定种子地址,爬取保存网页信息并确定导航页面;2)对每一导航页面进行多次爬取,并对爬取的网页进行分析标注;4)建立每一网站的主题判断模型和导航页面变更时间序列预测模型;5)预测每一网站导航页面下一次变更时间,确定下一爬取时间,爬取导航页面并提取未爬取过的子页面地址和锚文本;6)利用所建主题判断模型对上一步提取的子页面地址和锚文本进行判断,并据判断结果分别处理;7)基于新爬取的主题相关页面,形成或更新每一网站导航页面的当前变更时间序列,确定下一爬取时间进行网页爬取。本发明能在较小负载下,保证所采集信息的新颖性和主题性。 | ||
搜索关键词: | 一种 及时 高效 互联网 信息 方法 | ||
【主权项】:
一种及时高效的互联网信息爬取方法,其步骤为:1)将设定信息源作为种子地址进行网页信息爬取并保存,确定所爬取网页所属网站及网站的导航页面;2)将确定出的每一网站导航页面作为一爬取对象进行多次爬取,并对其子页面爬取保存;3)将步骤2)所爬取的网页进行主题相关判断和标注,将爬取的每一网站的页面分别标注为:主题相关页面、主题不相关页面、后续页面;4)基于标注的页面集合及形成的无标注样本集合,建立每一网站的页面主题相关判断模型、页面主题不相关判断模型、后续页面判断模型及基于内容和链接的通用主题相关判断模型;根据每次爬取时网站导航页面的主题相关子页面的发布时间建立一导航页面变更时间序列,创建每一网站的导航页面变更时间序列预测模型;5)利用所述导航页面变更时间序列预测模型预测每一网站导航页面下一次变更时间,然后利用该变更时间预测值确定每一网站导航页面的下一爬取时间,爬取网站导航页面并提取其中未爬取过的子页面地址和锚文本;6)利用所建页面主题相关判断模型、页面主题不相关判断模型、后续页面判断模型和通用主题相关判断模型对上一步提取的子页面地址和锚文本进行判断:如果子页面属于后续页面类别,则继续进行爬取;如果子页面属于主题相关页面,则爬取保存;如果子页面属于主题不相关页面类别,则放弃;7)基于新爬取的主题相关页面,形成或更新每一网站导航页面的当前变更时间序列,采用步骤5)方法确定每一网站导航页面下一爬取时间进行网页爬取。
下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于中国科学院计算机网络信息中心,未经中国科学院计算机网络信息中心许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/patent/201110430997.0/,转载请声明来源钻瓜专利网。
- 信息记录介质、信息记录方法、信息记录设备、信息再现方法和信息再现设备
- 信息记录装置、信息记录方法、信息记录介质、信息复制装置和信息复制方法
- 信息记录装置、信息再现装置、信息记录方法、信息再现方法、信息记录程序、信息再现程序、以及信息记录介质
- 信息记录装置、信息再现装置、信息记录方法、信息再现方法、信息记录程序、信息再现程序、以及信息记录介质
- 信息记录设备、信息重放设备、信息记录方法、信息重放方法、以及信息记录介质
- 信息存储介质、信息记录方法、信息重放方法、信息记录设备、以及信息重放设备
- 信息存储介质、信息记录方法、信息回放方法、信息记录设备和信息回放设备
- 信息记录介质、信息记录方法、信息记录装置、信息再现方法和信息再现装置
- 信息终端,信息终端的信息呈现方法和信息呈现程序
- 信息创建、信息发送方法及信息创建、信息发送装置