[发明专利]基于关联规则挖掘的涉及个人信息公示网页判定方法、电子设备及存储介质在审

专利信息
申请号: 202210055121.0 申请日: 2022-01-18
公开(公告)号: CN114462081A 公开(公告)日: 2022-05-10
发明(设计)人: 于佳华;刘琨;常远;张光耀;孙巍 申请(专利权)人: 国家计算机网络与信息安全管理中心黑龙江分中心
主分类号: G06F21/62 分类号: G06F21/62;G06F16/9035;G06F16/951;G06F16/2458;G06F40/289
代理公司: 哈尔滨市晨晟知识产权代理有限公司 23219 代理人: 宫晓平
地址: 150001 黑龙江省哈*** 国省代码: 黑龙江;23
权利要求书: 查看更多 说明书: 查看更多
摘要:
搜索关键词: 基于 关联 规则 挖掘 涉及 个人信息 公示 网页 判定 方法 电子设备 存储 介质
【说明书】:

一种基于关联规则挖掘的涉及个人信息公示网页判定方法、电子设备及存储介质,属于个人信息的公示公告网页的分析判定领域,是针对依赖人工进行工作效率低的问题,以及控制个人信息的泄露问题所提出。主要包括:爬取公示公告网页,形成网页集合W,通过人工标注,形成个人信息网页集合WP,非个人信息网页集合WN;对个人信息网页集合WP中的每一个网页Webpage进行中文分词,并标注词性,形成个人信息公示网页分词集合WPP等步骤,最终应用频繁项集集合FI对新公示公告网页进行是否涉及个人信息判定。通过计算机关联规则挖掘技术实现涉及个人信息的公示公告网页的自动化发现,大幅提升工作效率。

技术领域

发明涉及网页的分析判定技术领域,特别是涉及基于关联规则挖掘的涉及个人信息公示网页判定方法、电子设备及存储介质。

背景技术

当前,通过网站公示公告成为预告群众周知,用以征询意见、改善工作的一种常用工作方法,大多单位的门户网站都已经单独开辟公示公告栏目集中展示本单位的公示公告信息。各类公示公告信息包括权利事项目录公示、项目环境影响评价公示、收费标准公示、考试成绩公示、获奖名单公示等,其中部分公告公示就包括了姓名、手机号码、身份证号码、家庭住址等个人信息,如果这些个人信息未经脱敏处理即公布在网站上,极易发生个人信息的泄露。为此,通过一种技术方法自动化发现互联网上的涉及个人信息的公示公告页面,成为监测个人信息泄露风险的一项重要的基础性工作。

关联规则挖掘是从数据集中发现频繁出现的多个相关联数据项的一种技术,在个性化推荐、零售销售策略等领域具有良好应用,本发明将关联规则挖掘应用于涉及个人信息的公示公告网页判定场景,发现与此类网页高度相关的关键词序列集合,研判某一网页是否为涉及个人信息的公示公告网页。

目前涉及个人信息的公示公告网页判定主要采取人工判断的方法,对公示网页的标题、内容、附件标题和附件内容等进行分析,包括姓名、手机号码、身份证号码和家庭住址等个人信息的判断,该方式主要依靠工作人员的经验,效率低下。

发明内容

为了克服上述现有技术存在的缺陷,本发明提供了基于关联规则挖掘的涉及个人信息公示网页判定方法、电子设备及存储介质,可以解决依赖人工进行工作效率低的问题,以及控制个人信息的泄露问题。

本发明采用的技术方案一在于:

基于关联规则挖掘的涉及个人信息公示网页判定方法,包括以下步骤:

步骤S1,爬取公示公告网页,形成网页集合W,通过人工标注,形成个人信息网页集合WP,非个人信息网页集合WN;

步骤S2,对个人信息网页集合WP中的每一个网页Webpage进行中文分词,并标注词性,形成个人信息公示网页分词集合WPP;

步骤S3,对个人信息公示网页分词集合WPP进行过滤,形成个人信息公示网页分词过滤集合WPPS;

步骤S4,对个人信息公示网页分词过滤集合WPPS进行关联规则挖掘计算,得到频繁项集集合FI;

步骤S5,验证频繁项集集合FI判定公示公告网页涉及个人信息的误报率、漏报率指标是否满足要求;

步骤S6,根据验证结果调整步骤S3的词性黑名单、词语黑名单和步骤S4的支持度support,并重新执行步骤S3至步骤S6,直到频繁项集集合FI判定公示公告网页涉及个人信息的误报率、漏报率满足要求;

步骤S7,应用频繁项集集合FI对新公示公告网页进行是否涉及个人信息判定。

进一步地,所述步骤S1,爬取公示公告网页,形成网页集合W,通过人工标注,形成个人信息网页集合WP,非个人信息网页集合WN,具体过程如下:

步骤S11,爬取网站上的所有公示公告网页,解析网页的TITLE、网页内容、附件名称和附件内容,将公示公告内容包含对个人信息有帮助的网页元素形成网页集合W;

下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。

该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于国家计算机网络与信息安全管理中心黑龙江分中心,未经国家计算机网络与信息安全管理中心黑龙江分中心许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服

本文链接:http://www.vipzhuanli.com/pat/books/202210055121.0/2.html,转载请声明来源钻瓜专利网。

×

专利文献下载

说明:

1、专利原文基于中国国家知识产权局专利说明书;

2、支持发明专利 、实用新型专利、外观设计专利(升级中);

3、专利数据每周两次同步更新,支持Adobe PDF格式;

4、内容包括专利技术的结构示意图流程工艺图技术构造图

5、已全新升级为极速版,下载速度显著提升!欢迎使用!

请您登陆后,进行下载,点击【登陆】 【注册】

关于我们 寻求报道 投稿须知 广告合作 版权声明 网站地图 友情链接 企业标识 联系我们

钻瓜专利网在线咨询

周一至周五 9:00-18:00

咨询在线客服咨询在线客服
tel code back_top