[发明专利]基于自然语言的多表格检索方法及装置有效
申请号: | 202310042299.6 | 申请日: | 2023-01-28 |
公开(公告)号: | CN116049354B | 公开(公告)日: | 2023-06-20 |
发明(设计)人: | 张俊祺;张正;吴永宇 | 申请(专利权)人: | 北京原子回声智能科技有限公司 |
主分类号: | G06F16/33 | 分类号: | G06F16/33;G06F16/332 |
代理公司: | 北京八月瓜知识产权代理有限公司 11543 | 代理人: | 秦莹 |
地址: | 100107 北京*** | 国省代码: | 北京;11 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 基于 自然语言 表格 检索 方法 装置 | ||
本说明书实施例提供了一种基于自然语言的多表格检索方法及装置,其中,方法包括:将表格内容进行语义表示,获取表格的表头序列和与所述表头序列对应的类型序列;获取用户输入的查询语句,对所述查询语句进行清洗和分词,通过预训练的多层感知机预测分词对应的类型,生成分词序列和与所述分词序列对应的类型序列;针对所述查询语句和每一个表格,计算分词序列和表头序列的相似度矩阵,计算与所述表头序列对应的类型序列和与所述分词序列对应的类型序列的掩码矩阵,分别将各个表格的所述相似度矩阵和所述掩码矩阵相乘,得到各个表格的打分矩阵,根据所述各个表格的打分矩阵获取所述查询语句的检索结果。
技术领域
本文件涉及计算机技术领域,尤其涉及一种基于自然语言的多表格检索方法及装置。
背景技术
企业中海量的数据存在于结构化的表格当中,包括Excel表格、数据库表格等形式。表格具有特定的结构,一般来说,第一行定义表头字段,每个字段是一串字符,代表该列数据存储的内容。接下来每一行代表一条数据,具体的内容可以包含:文本、数值、邮箱、时间、编号、网址等。
传统的表格检索只会利用关键词进行匹配,用户输入查询词,根据表格中查询词出现的频次进行搜索,既没有考虑表头的语义信息,也没有考虑表格内容的类型信息。同时,企业对于数据的保密性要求极高,一般不会将数据表的内容直接用于检索。因此,在企业要求数据保密的情况下,如何实现准确的表格检索,并最大程度保护企业数据隐私信息是亟需解决的问题。
发明内容
本发明的目的在于提供一种基于自然语言的多表格检索方法及装置,旨在解决现有技术中的上述问题。
本发明提供一种基于自然语言的多表格检索方法,包括:
将表格内容进行语义表示,获取表格的表头序列和与所述表头序列对应的类型序列;
获取用户输入的查询语句,对所述查询语句进行清洗和分词,通过预训练的多层感知机预测分词对应的类型,生成分词序列和与所述分词序列对应的类型序列;
针对所述查询语句和每一个表格,计算分词序列和表头序列的相似度矩阵,计算与所述表头序列对应的类型序列和与所述分词序列对应的类型序列的掩码矩阵,分别将各个表格的所述相似度矩阵和所述掩码矩阵相乘,得到各个表格的打分矩阵,根据所述各个表格的打分矩阵获取所述查询语句的检索结果。
本发明提供一种基于自然语言的多表格检索装置,包括:
表格表示模块,用于将表格内容进行语义表示,获取表格的表头序列和与所述表头序列对应的类型序列;
查询分词模块,用于获取用户输入的查询语句,对所述查询语句进行清洗和分词,通过预训练的多层感知机预测分词对应的类型,生成分词序列和与所述分词序列对应的类型序列;
检索匹配模块,用于针对所述查询语句和每一个表格,计算分词序列和表头序列的相似度矩阵,计算与所述表头序列对应的类型序列和与所述分词序列对应的类型序列的掩码矩阵,分别将各个表格的所述相似度矩阵和所述掩码矩阵相乘,得到各个表格的打分矩阵,根据所述各个表格的打分矩阵获取所述查询语句的检索结果。
本发明实施例还提供一种电子设备,包括:存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序,所述计算机程序被所述处理器执行时实现上述基于自然语言的多表格检索方法的步骤。
本发明实施例还提供一种计算机可读存储介质,所述计算机可读存储介质上存储有信息传递的实现程序,所述程序被处理器执行时实现上述基于自然语言的多表格检索方法的步骤。
采用本发明实施例,通过自然语言处理技术,只利用表头字段的字段描述信息和表格内容数据类型信息,在企业要求数据保密的情况下,实现更加精准的表格搜索,既可以实现准确的表格检索,也可以最大程度保护企业数据隐私信息。
附图说明
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于北京原子回声智能科技有限公司,未经北京原子回声智能科技有限公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/202310042299.6/2.html,转载请声明来源钻瓜专利网。
- 上一篇:一种基于工业互联网的智能制造生产线
- 下一篇:一种半导体器件图形化的方法