[发明专利]一种标签语义增强的弱监督文本分类方法及系统在审
申请号: | 202310520566.6 | 申请日: | 2023-05-10 |
公开(公告)号: | CN116628199A | 公开(公告)日: | 2023-08-22 |
发明(设计)人: | 王雷;林呈宇;薛聪 | 申请(专利权)人: | 中国科学院信息工程研究所 |
主分类号: | G06F16/35 | 分类号: | G06F16/35;G06F16/33;G06F40/30;G06F18/2415;G06F18/22;G06N3/0455;G06N3/047;G06N3/0895 |
代理公司: | 北京君尚知识产权代理有限公司 11200 | 代理人: | 李文涛 |
地址: | 100085*** | 国省代码: | 北京;11 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | 本发明公开一种一种标签语义增强的弱监督文本分类方法及系统,属于机器学习领域,基于BERT弱监督文本分类框架,在类别词表构建阶段,基于Zipf定律加权类别表示实现类别词去噪,利用了语义相似度递减特性去除类别词表中的无关词;在样本标注阶段,基于MASK机制的词类别标注,然后基于自训练模块进行优化分类模型,以样本中的类别指示性单词为桥梁,建立“样本句‑指示词‑类别标签”跨层级语义关联。本发明在词表构建与样本弱标注生成阶段引入了更多降低标签噪声的算法,以达到标签语义增强的效果,在不同语种环境中显著提升文本分类效果。 | ||
搜索关键词: | 一种 标签 语义 增强 监督 文本 分类 方法 系统 | ||
【主权项】:
暂无信息
下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于中国科学院信息工程研究所,未经中国科学院信息工程研究所许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/patent/202310520566.6/,转载请声明来源钻瓜专利网。