[发明专利]一种人物属性抽取训练数据集构建方法有效
申请号: | 201810636331.2 | 申请日: | 2018-06-20 |
公开(公告)号: | CN109033166B | 公开(公告)日: | 2022-01-07 |
发明(设计)人: | 赵忠华;孙小宁;李欣;万欣欣;袁钟怡;张小明 | 申请(专利权)人: | 国家计算机网络与信息安全管理中心 |
主分类号: | G06F40/211 | 分类号: | G06F40/211 |
代理公司: | 北京慧泉知识产权代理有限公司 11232 | 代理人: | 李娜 |
地址: | 100029*** | 国省代码: | 北京;11 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 一种 人物属性 抽取 训练 数据 构建 方法 | ||
1.一种人物属性抽取训练数据集构建方法,其特征在于:所述方法具体步骤如下:
步骤一:网络数据采集
在中文维基百科网站中,下载中文人物页面,然后解析页面的内容,保存页面中左侧和右侧信息框里的两部分文本数据,页面左侧的文本数据是描述人物详细信息的正文内容,右侧信息框描述人物的各种属性及相应的属性值内容,然后将左侧正文内容数据全部以UTF-8格式进行编码,并以句子为单位进行切分;
步骤二:人物属性语料产生
针对步骤一中切分后的语句,选取包含人物名称的句子作为候选语句,然后遍历信息框中各行的属性值内容,如果候选语句包含有信息框中的任何一条属性值内容,则该候选语句被选取出来作为人物属性语料的一条语句;
步骤三:人物属性语料过滤
针对步骤二中得到的人物属性语料中的语句,提取数据集中所有语句中的动词,根据动词在训练数据集中的出现情况进行排序,选取排名靠前的动词作为属性触发词,然后删除掉人物属性语料中不包含属性触发词的语句,剩下的语句就组成了人物属性抽取训练数据集;
在步骤三中所述的动词排序中,利用哈工大信息检索实验室的LTP语言技术平台对语句中的词语进行词性标注,提取出所有的动词进行排序,排序方法采用基于熵的排序技术,该技术根据词语在人物属性语料数据集中的分布情况来进行排序,如果一个词语在许多的语句中都出现,则该词语的排名靠后,其中,人物属性语料过滤过程为:
1)对构建的训练语料数据集中的每一条语句,利用哈工大信息检索实验室的LTP语言技术平台对语句中的词语进行词性标注,提取出所有语句中所有的动词组成词语集合W={w1,w2,…,wn},其中wi表示集合里的第i个动词,n表示所有动词的个数;
2)针对每个词语wi,0in+1,i为整数,为训练语料数据集中每条语句pj构建一个向量表示0jm+1,j为整数,其中里面每个元素xk的取值为0或1,0kn+1,k为整数,如果词语集合W中第k个词语wk语句pj中出现且wk不等于词语wi,则xk取值为1,否则xk取值为0;然后基于构建的语句向量,计算词语wi的熵值Ei,计算公式如下
其中Si,j表示两条语句pi和pj之间的相似度,α表示人物属性语料中所有语句对之间相似度的平均值;
3)依据熵值Ei大小对词语集合W里所有的动词进行排序,选取前5%的动词作为人物属性触发词;然后对训练语料数据集P的语句进行过滤,如果一条语句不包含任何一个触发词,则该条语句从训练语料数据集P中被删除掉;最后,训练语料数据集P剩下的语句就组成了人物属性抽取训练数据集。
2.根据权利要求1所述的一种人物属性抽取训练数据集构建方法,其特征在于:在步骤一中所述的信息框位于网页HTML代码中的class里包含infobox的table标签中,而描述人物详细信息的正文内容位于网页HTML代码中id为mw-content-text的div标签下的段落里,采用开源工具哈工大语言技术平台LTP对人物正文内容进行句子切分。
3.根据权利要求1所述的一种人物属性抽取训练数据集构建方法,其特征在于:在步骤二中所述的信息框属性遍历中,信息框为一个包含两列的数据表格,表格中每一行对应一个属性,第一列表示属性类别名称,第二列表示属性值内容,如果信息框中的属性值内容所在单元格中的语句包含标点符号,则按照标点符号对该语句进行切分,切分后的每个部分称为该行所表示的属性类别的一个属性值。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于国家计算机网络与信息安全管理中心,未经国家计算机网络与信息安全管理中心许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/201810636331.2/1.html,转载请声明来源钻瓜专利网。
- 上一篇:一种数据展示方法、计算机可读存储介质及终端设备
- 下一篇:电影分类方法和系统
- 数据显示系统、数据中继设备、数据中继方法、数据系统、接收设备和数据读取方法
- 数据记录方法、数据记录装置、数据记录媒体、数据重播方法和数据重播装置
- 数据发送方法、数据发送系统、数据发送装置以及数据结构
- 数据显示系统、数据中继设备、数据中继方法及数据系统
- 数据嵌入装置、数据嵌入方法、数据提取装置及数据提取方法
- 数据管理装置、数据编辑装置、数据阅览装置、数据管理方法、数据编辑方法以及数据阅览方法
- 数据发送和数据接收设备、数据发送和数据接收方法
- 数据发送装置、数据接收装置、数据收发系统、数据发送方法、数据接收方法和数据收发方法
- 数据发送方法、数据再现方法、数据发送装置及数据再现装置
- 数据发送方法、数据再现方法、数据发送装置及数据再现装置