[发明专利]一种基于浏览器扩展的数据抓取方法及系统在审

专利信息
申请号: 201810495217.2 申请日: 2018-05-22
公开(公告)号: CN108932285A 公开(公告)日: 2018-12-04
发明(设计)人: 何泾沙;于聪;杨镇宁;王亚芹;段梦园;杜晋辉;葛加可 申请(专利权)人: 北京工业大学
主分类号: G06F17/30 分类号: G06F17/30
代理公司: 北京路浩知识产权代理有限公司 11002 代理人: 王莹;吴欢燕
地址: 100022 *** 国省代码: 北京;11
权利要求书: 查看更多 说明书: 查看更多
摘要:
搜索关键词: 浏览器 扩展插件 网页地址 预设 目标网页地址 目标数据 配置文件 数据抓取 预设规则 网页 抓取 模拟浏览器 可扩展性 匹配成功 特性开发 用户使用 整体开发 可扩展 解析 匹配 页面 数据库
【说明书】:

发明提供一种基于浏览器扩展的数据抓取方法及系统,其中方法包括:获取浏览器中当前网页对应的当前网页地址,将当前网页地址与预设配置文件中的目标网页地址进行匹配,预设配置文件中包含至少一个目标网页地址;当匹配成功时,从预设数据库中获取当前网页地址对应的预设规则,根据预设规则从当前网页中抓取目标数据。该方法及系统无需模拟浏览器,仅需利用浏览器可扩展的特性开发浏览器扩展插件,利用浏览器扩展插件从浏览器解析好的页面中提取目标数据,降低了整体开发难度,且可扩展性强;同时对于普通用户来说,仅需安装和操作浏览器的扩展插件即可,是一种类似于“所见即所得”的体验,有效提高了用户使用友好度。

技术领域

本发明涉及网络数据抓取技术领域,更具体地,涉及一种基于浏览器扩展的数据抓取方法及系统。

背景技术

进入大数据时代,信息以“爆炸”的方式增长——以新浪微博为例,其日均微博更新多达1.2亿条。这种“爆炸”式增长的信息使互联网上的数据以几何倍数增长,也促使数据以更快的速度进入海量时代。海量数据在未来将体现出其巨大价值,对人们的生活和学习产生了巨大影响,同时也增加了人们有效获取数据的难度。

目前,以网络爬虫技术为基础从Web页面中抓取数据成为热门,网络爬虫的热门造成网络爬虫技术种类繁多,简单的从功能上可以划分为通用网络爬虫和聚焦网络爬虫,不论是这两类网络爬虫还是其他方式划分的网络爬虫,现有的爬虫技术的核心思想均是相同的,且核心思想都是模拟浏览器的方式下载网页和解析网页,从中采集数据。然而其中模拟浏览器功能的过程增加了网络爬虫开发的难度,也是最容易发生bug的地方,当模拟不完善时最容易触发采集对象服务器的反爬虫策略,无形中大幅度提高了开发网络爬虫系统人员的要求。同时,设计和实现网络爬虫系统还要考虑用户有计算机相关背景和知识,导致用户使用友好度差。

有鉴于此,亟待提供一种开发难度小且用户使用友好度高的数据抓取方法及系统。

发明内容

本发明为了克服现有技术中的网络爬虫系统开发难度大且用户使用友好度差的问题,提供一种基于浏览器扩展的数据抓取方法及系统。

一方面,本发明提供一种基于浏览器扩展的数据抓取方法,包括:

获取浏览器中当前网页对应的当前网页地址,将所述当前网页地址与预设配置文件中的目标网页地址进行匹配,所述预设配置文件中包含至少一个目标网页地址;

当匹配成功时,从预设数据库中获取所述当前网页地址对应的预设规则,根据所述预设规则从所述当前网页中抓取目标数据。

优选地,所述将所述当前网页地址与预设配置文件中的目标网页地址进行匹配,之前还包括:

根据用户需求获取所有所述目标网页地址,将所有所述目标网页地址配置在所述预设配置文件中。

优选地,所述从预设数据库中获取所述当前网页地址对应的预设规则,之前还包括:

根据用户需求配置每个所述目标网页地址对应的预设规则,将每个所述目标网页地址与对应的预设规则关联存储在所述预设数据库中。

优选地,所述从预设数据库中获取所述当前网页地址对应的预设规则,之前还包括:

向所述当前网页发送数据抓取请求,以使得用户对所述数据抓取请求进行确认;

相应地,当接收到用户的确认操作时,从预设数据库中获取所述当前网页地址对应的预设规则,根据所述预设规则从所述当前网页中抓取目标数据。

优选地,所述根据所述预设规则从所述当前网页中抓取目标数据,之后还包括:

当接收到用户的页面跳转请求时,根据所述预设规则从所述当前网页的下一网页中抓取所述目标数据。

优选地,所述根据所述预设规则从所述当前网页中抓取目标数据,之后还包括:

下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。

该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于北京工业大学,未经北京工业大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服

本文链接:http://www.vipzhuanli.com/pat/books/201810495217.2/2.html,转载请声明来源钻瓜专利网。

×

专利文献下载

说明:

1、专利原文基于中国国家知识产权局专利说明书;

2、支持发明专利 、实用新型专利、外观设计专利(升级中);

3、专利数据每周两次同步更新,支持Adobe PDF格式;

4、内容包括专利技术的结构示意图流程工艺图技术构造图

5、已全新升级为极速版,下载速度显著提升!欢迎使用!

请您登陆后,进行下载,点击【登陆】 【注册】

关于我们 寻求报道 投稿须知 广告合作 版权声明 网站地图 友情链接 企业标识 联系我们

钻瓜专利网在线咨询

周一至周五 9:00-18:00

咨询在线客服咨询在线客服
tel code back_top