[发明专利]一种数据的聚类方法和聚类装置在审
申请号: | 201611032182.6 | 申请日: | 2016-11-22 |
公开(公告)号: | CN106776751A | 公开(公告)日: | 2017-05-31 |
发明(设计)人: | 谢瑜;张昊;朱频频 | 申请(专利权)人: | 上海智臻智能网络科技股份有限公司 |
主分类号: | G06F17/30 | 分类号: | G06F17/30 |
代理公司: | 北京布瑞知识产权代理有限公司11505 | 代理人: | 孟潭 |
地址: | 201803 上海市嘉*** | 国省代码: | 上海;31 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 一种 数据 方法 装置 | ||
技术领域
本发明涉及一种数据处理方法和装置,特别是涉及一种语料数据的处理方法和装置。
背景技术
在语言处理的自动问答领域中,需要对以语言为载体的问题进行确定,进而建立问题与答案的对应关系,建立相似问题的问题集,即问题集的聚合是确定“问题-答案”业务逻辑的基础技术和重要步骤。
在问题集的聚合处理过程中,现有技术采用自动聚类,对相似问题语句进行聚类形成不同的问题集。在聚类过程中需要确定聚类中心的数量和初始位置,以反映聚类中心的类间相异度。然后进行聚类的迭代过程,直至聚类中心位置确定或达到预设精度或迭代次数。
由于问题集中存在一些特征分布稀疏不均匀的问题语句数据,使得聚类区域的大小和形状不规整,因此使得类间相异度量难于确定,聚类中心数量和初始位置无法优化。这就造成进行大样本的问题集的聚类时,对噪声问题和离群孤立问题语句数据较敏感,使得少量数据对聚类结果产生较大影响,往往不能形成问题集的最优聚类。
发明内容
有鉴于此,本发明实施例提供了一种数据的聚类方法和聚类装置,用于解决现有问题集聚类过程中,受初始条件影响聚类效果差的技术问题。
本发明实施例的数据的聚类方法包括:
获取待处理数据,所述待处理数据包括测试数据和非测试数据;
对测试数据进行第一分类处理,得到第一分类结果;
采用初始预设值对测试数据进行第二分类处理,得到第二分类结果,所述第二分类处理包括:分别获取第M句数据的句向量与已聚类的L个信息组的句向量平均值之间的最大相似度值,当所述最大相似度值大于所述初始预设值时,将第M句数据聚类到所述最大相似度值对应的信息组中;当所述最大相似度值小于所述初始预设值时,将第M句数据作为第L+1个信息组,所述L小于或等于M-1;
比较所述第二分类结果和所述第一分类结果,当以第一分类结果为标准得到第二分类结果的准确率大于或等于阈值时,将所述初始预设值作为目标预设值;当以第一分类结果为标准得到第二分类结果的准确率小于阈值时,不断调整所述初始预设值,直至将所述初始预设值调整为目标预设值时得到新的第二分类结果的准确率大于或等于阈值;
采用目标预设值对非测试数据进行第二分类处理。
本发明实施例的数据的聚类装置包括:
数据获取模块,用于获取待处理数据,将待处理数据划分为测试数据和非测试数据;
第一分类模块,用于对测试数据进行第一分类处理,得到第一分类结果;
第二分类模块,用于采用初始预设值对测试数据进行第二分类处理,得到第二分类结果,用于采用目标预设值对非测试数据进行分类处理;进一步用于分别获取第M句数据的句向量与已聚类的L个信息组的句向量平均值之间的最大相似度值,当所述最大相似度值大于所述初始预设值时,将第M句数据聚类到所述最大相似度值对应的信息组中;当所述最大相似度值小于所述初始预设值时,将第M句数据作为第L+1个信息组,所述L小于或等于M-1;
参数确定模块,用于比较第二分类结果和第一分类结果,当以第一分类结果为标准得到第二分类结果的准确率大于或等于阈值时,将初始预设值作为目标预设值;当以第一分类结果为标准得到第二分类结果的准确率小于阈值时,不断调整初始预设值,直至将初始预设值调整为目标预设值时得到新的第二分类结果的准确率大于或等于阈值。
本发明的聚类方法和聚类装置将向量化的语料数据中的测试数据用于半监督学习的聚类和自动聚类,并根据半监督学习的聚类结果调整自动聚类算法的初始预设值形成目标预设值,使得自动聚类算法的聚类结果与半监督学习的聚类结果满足趋同。这样利用采用目标预设值的自动聚类算法对向量化的语料数据中的非测试数据进行聚类,可以有效提高初始分类数据的准确性,改善聚类模型的聚类中心的初始参数,使得类间相异度获得保证,聚类中心位置也可以很好的确定聚类模型的稳定性。使得实际应用中问题集的聚类效果准确,问题有效分组。
附图说明
图1为本发明的数据的聚类方法一实施例的流程图。
图2为本发明的数据的聚类方法一实施例的第二分类处理的流程图。
图3为本发明的数据的聚类装置一实施例的架构示意图。
具体实施方式
下面将结合本发明实施例中的附图,对本发明实施例中的技术方案进行清楚、完整地描述,显然,所描述的实施例仅是本发明一部分实施例,而不是全部的实施例。基于本发明中的实施例,本领域普通技术人员在没有作出创造性劳动前提下所获得的所有其他实施例,都属于本发明保护的范围。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于上海智臻智能网络科技股份有限公司,未经上海智臻智能网络科技股份有限公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/201611032182.6/2.html,转载请声明来源钻瓜专利网。
- 数据显示系统、数据中继设备、数据中继方法、数据系统、接收设备和数据读取方法
- 数据记录方法、数据记录装置、数据记录媒体、数据重播方法和数据重播装置
- 数据发送方法、数据发送系统、数据发送装置以及数据结构
- 数据显示系统、数据中继设备、数据中继方法及数据系统
- 数据嵌入装置、数据嵌入方法、数据提取装置及数据提取方法
- 数据管理装置、数据编辑装置、数据阅览装置、数据管理方法、数据编辑方法以及数据阅览方法
- 数据发送和数据接收设备、数据发送和数据接收方法
- 数据发送装置、数据接收装置、数据收发系统、数据发送方法、数据接收方法和数据收发方法
- 数据发送方法、数据再现方法、数据发送装置及数据再现装置
- 数据发送方法、数据再现方法、数据发送装置及数据再现装置