[发明专利]一种基于机器翻译的中文语义知识库的构建方法有效
申请号: | 201610111365.0 | 申请日: | 2016-02-29 |
公开(公告)号: | CN105677913B | 公开(公告)日: | 2019-04-26 |
发明(设计)人: | 曹海龙;李晓倩;赵铁军;杨沐昀;徐冰 | 申请(专利权)人: | 哈尔滨工业大学 |
主分类号: | G06F16/36 | 分类号: | G06F16/36;G06F17/27;G06F17/28 |
代理公司: | 哈尔滨市松花江专利商标事务所 23109 | 代理人: | 牟永林 |
地址: | 150001 黑龙*** | 国省代码: | 黑龙江;23 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | 一种基于机器翻译的中文语义知识库的构建方法,本发明涉及中文语义知识库的构建的方法。本发明是要解决中文语义知识库匮乏的问题、现有技术昂贵的人力及时间的问题,和提高基于跨语言映射的语义知识库翻译的性能的问题,而提出的一种基于机器翻译的中文语义知识库的构建方法。该方法是通过一、得到标注了实体的源语言端语料;二、根据主题模型计算得到实体的主题分布;三、根据源语言端实体词表从短语翻译表中抽取源语言端语义知识库中实体的翻译概率,记为p(tj|si);四、构建基于源语言端语义知识库图结构信息的实体翻译模型等步骤实现的。本发明应用于中文语义知识库的构建领域。 | ||
搜索关键词: | 一种 基于 机器翻译 中文 语义 知识库 构建 方法 | ||
【主权项】:
1.一种基于机器翻译的中文语义知识库的构建方法,其特征在于一种基于机器翻译的中文语义知识库的构建方法具体是按照以下步骤进行的:步骤一、利用源语言语义知识库中实体对源双语语料中源语言端语料进行命名实体识别,得到标注了实体的源语言端语料;步骤二、利用步骤一得到的标注了实体的源语言端语料构建主题模型,根据主题模型计算得到实体的主题分布;步骤三、将标注了实体的源语言端语料和源双语语料的目的语言端语料构成源语言端标注了实体的双语语料,利用源语言端标注了实体的双语语料构建基于短语的统计机器翻译模型,利用基于短语的统计机器翻译模型生成短语翻译表,根据源语言端实体词表从短语翻译表中抽取源语言端语义知识库中实体的翻译概率,记为p(tj|si),其中tj属于si的候选翻译集,si表示标注了实体的源语言端语料中的单词;步骤四、根据步骤二建立的源语言端主题模型和步骤三建立的p(tj|si)构建基于源语言端语义知识库图结构信息的实体翻译模型,其中,源语言端语义知识库图结构信息即实体的上下文信息,其具体过程为;步骤四一、利用步骤二得到的源语言端的主题模型,得到上下文下的实体主题分布:
其中,C是实体si的上下文信息,即其相连节点和边的集合;p(zk|si)代表每个实体的主题分布;zk是第k个主题;K是主题的总个数;步骤四二、利用步骤三得到的源语言端语义知识库中实体的翻译概率及步骤四一得到的上下文的实体主题分布,计算上下文信息的实体翻译概率:步骤四三、利用步骤四二得到的上下文下的实体翻译概率,计算上下文信息下的实体翻译结果;![]()
下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于哈尔滨工业大学,未经哈尔滨工业大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/patent/201610111365.0/,转载请声明来源钻瓜专利网。
- 上一篇:一种本地搜索结果展示方法、装置及电子设备
- 下一篇:恶意用户检测方法及装置