[发明专利]一种复杂中文文本中的实体消歧方法有效
申请号: | 202110603755.0 | 申请日: | 2021-05-31 |
公开(公告)号: | CN113283236B | 公开(公告)日: | 2022-07-19 |
发明(设计)人: | 王玉龙;王闯;刘同存;王纯;张乐剑;王晶 | 申请(专利权)人: | 北京邮电大学 |
主分类号: | G06F40/279 | 分类号: | G06F40/279;G06F40/216;G06F40/30;G06N3/04;G06N3/08 |
代理公司: | 暂无信息 | 代理人: | 暂无信息 |
地址: | 100876 *** | 国省代码: | 北京;11 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 一种 复杂 中文 文本 中的 实体 方法 | ||
一种复杂中文文本中的实体消歧方法,包括:从待消歧中文文本中提取所有待消歧实体指称;采用实体检索技术,从实体知识库中为每个待消歧实体指称选取若干个实体作为预候选实体,然后计算每个待消歧实体指称和每个预候选实体的第一相似度,并根据第一相似度挑选若干个实体作为候选实体;计算每个待消歧实体指称和每个候选实体的消歧相似度,并判断每个待消歧实体指称和所有候选实体的消歧相似度的最大值是否大于消歧相似度阈值,如果是,则待消歧实体指称是可链接实体,将待消歧实体指称链接至实体知识库中消歧相似度最大值对应的候选实体。本发明属于信息技术领域,能有效解决复杂中文文本领域的实体歧义问题,并提高实体召回率和实体链接准确率。
技术领域
本发明涉及一种复杂中文文本中的实体消歧方法,属于信息技术领域。
背景技术
自然语言广泛存在着歧义和不规范性问题,例如词汇的简写、缩写以及语言使用习惯等不规范性都会造成不同语言环境中相同的词汇表示不同的含义或者不同的词汇表示相同的含义。而汉语言文化博大精深,具有更丰富的语义和表现形式,特别像小说这样的文学作品,文本中往往具有大量的出场人物、繁多的场景和错综复杂的组织结构。这些小说中的人物、场景、组织等实体也带来了诸多歧义问题,给许多基于小说的自然语言处理下游任务带来了很大挑战。
尽管在通用领域,实体消歧已经有了很多研究,但是在小说等复杂中文文本领域,歧义问题依然依赖低效的人工处理来解决,缺乏系统性的解决方案。传统的实体消歧包括基于聚类的实体消歧和基于知识库的实体链接方法。基于聚类的实体消歧方法一般只能利用浅层语义信息,所以现在一般采用实体链接的方法实现消歧。实体链接方法包括实体指称识别、候选实体生成、候选实体排序三个部分。实体链接方法会受制于知识库规模和更新速度,而且传统的实体链接方法在生成候选实体时依赖别名表的构建,面对小说文本这种复杂环境,往往实体召回率会比较低。同时,通用知识库中的小说域实体一般缺乏有效可以利用的别名信息、统计信息等。另外,对于偏冷门的小说或者更新状态的小说,会存在大量不可链接实体,实体链接方法并不能很好解决消歧问题。
因此,如何有效解决小说等复杂中文文本领域的实体歧义问题,并提高实体召回率和实体链接准确率,已成为技术人员急需解决的技术问题。
发明内容
有鉴于此,本发明的目的是提供一种复杂中文文本中的实体消歧方法,能有效解决复杂中文文本领域的实体歧义问题,并提高实体召回率和实体链接准确率。
为了达到上述目的,本发明提供了一种复杂中文文本中的实体消歧方法,包括有:
步骤一、从待消歧的中文文本中提取所有待消歧的实体指称;
步骤二、采用实体检索技术,从实体知识库中为每个待消歧实体指称选取若干个实体作为预候选实体,并由所有预候选实体构成每个待消歧实体指称的预候选实体集,然后计算每个待消歧实体指称和其预候选实体集中的每个预候选实体的第一相似度,并根据第一相似度挑选若干个预候选实体作为候选实体,由所有候选实体构成每个待消歧实体指称的候选实体集,其中,实体知识库中保存有实体名称和描述文本两部分信息,待消歧实体指称和预候选实体的第一相似度是各自表示向量之间的余弦相似度;
步骤三、计算每个待消歧实体指称和其候选实体集中的每个候选实体的消歧相似度,并判断每个待消歧实体指称和其所有候选实体的消歧相似度中的最大值是否大于消歧相似度阈值,如果是,则表示待消歧实体指称是可链接实体,将待消歧实体指称链接至实体知识库中消歧相似度最大值对应的候选实体,然后继续判断下一个待消歧实体指称和其所有候选实体的消歧相似度中的最大值,当判断完所有待消歧实体指称后,继续步骤四;如果否,则表示待消歧实体指称是不可链接实体,然后继续判断下一个待消歧实体指称和其所有候选实体的消歧相似度中的最大值,当判断完所有待消歧实体指称后,继续步骤四;其中,消歧相似度用于描述待消歧实体指称和候选实体的相似程度;
步骤四、对所有不可链接实体进行聚类以分成若干个分组,并设定每个分组的序号,然后将每个不可链接实体按照其分组序号进行标记。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于北京邮电大学,未经北京邮电大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/202110603755.0/2.html,转载请声明来源钻瓜专利网。
- 上一篇:一种可回吸乳液的乳液瓶
- 下一篇:文件导出方法、装置及计算机可读介质