[发明专利]一种基于Hadoop平台的改进并行KNN网络舆情分类算法在审

专利信息
申请号: 201811594517.2 申请日: 2018-12-25
公开(公告)号: CN109739984A 公开(公告)日: 2019-05-10
发明(设计)人: 杜少波;李静;杨露;袁华 申请(专利权)人: 贵州商学院
主分类号: G06F16/35 分类号: G06F16/35
代理公司: 贵阳中工知识产权代理事务所 52106 代理人: 刘安宁
地址: 550014 贵*** 国省代码: 贵州;52
权利要求书: 查看更多 说明书: 查看更多
摘要: 一种基于Hadoop平台的改进并行KNN网络舆情分类算法,进行次迭代,迭代执行第二步和第六步;从整体数据集中按随机采样方法抽取相同数量个对象得到样本数据集;在数据集上调用PAM算法找到数据集最优个中心点集合;根据得到的找到整个数据集中每一个对象 在中欧氏距离最近中心点;返回步骤1,开始下次迭代;所有迭代都完成后以平均相异度作为评价标准衡量聚类效果,平均相异度最小的即是最优聚类;统计数据集与个聚类平均相异度。本发明首先使用CLARA聚类算法对数据集中相似度或距离较低部分进行剪裁处理,然后使MapReduce将kNN算法进行并行化在Hadoop平台上进行数据分类,有较低时间复杂度和较好分类准确率。
搜索关键词: 迭代 聚类 相异 分类算法 数据集中 网络舆情 数据集 中心点 并行 分类准确率 时间复杂度 迭代执行 聚类算法 距离最近 评价标准 数据分类 随机采样 统计数据 样本数据 整体数据 并行化 相似度 算法 调用 剪裁 抽取 改进 集合 返回 衡量
【主权项】:
1.一种基于Hadoop平台的改进并行KNN网络舆情分类算法,其特征在于,CLARA算法的步骤如下:S1:进行m次迭代,迭代执行S2‑S6;S2:从整体数据集D中按照随机采样的方法抽取相同数量r个对象得到样本数据集Si,Si=(s1,s2,…,sr);S3:在样本数据集Si上调用PAM算法找到样本数据集的最优k个中心点集合Ci,Ci=(c1,c2,…,ck);S4:根据得到的Ci找到整个数据集D中的每一个对象Oj∈D在Ci中欧氏距离最近的中心点,将Oj划分为相应的簇中;S5:根据公式计算数据集D中的每一个对象Oj∈D的平均相异度,作为评价标准;S6:返回步骤S1,开始下一次迭代;S7:所有迭代都完成后以平均相异度作为评价标准衡量聚类效果,平均相异度最小的即是最优聚类;S8:统计样本数据集与k个聚类的平均相异度,如果Sim(D,Oi)小于给定的阈值则将其从样本数据集中裁剪掉,否则将该簇内包含的样本添加到样本集中。
下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。

该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于贵州商学院,未经贵州商学院许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服

本文链接:http://www.vipzhuanli.com/patent/201811594517.2/,转载请声明来源钻瓜专利网。

×

专利文献下载

说明:

1、专利原文基于中国国家知识产权局专利说明书;

2、支持发明专利 、实用新型专利、外观设计专利(升级中);

3、专利数据每周两次同步更新,支持Adobe PDF格式;

4、内容包括专利技术的结构示意图流程工艺图技术构造图

5、已全新升级为极速版,下载速度显著提升!欢迎使用!

请您登陆后,进行下载,点击【登陆】 【注册】

关于我们 寻求报道 投稿须知 广告合作 版权声明 网站地图 友情链接 企业标识 联系我们

钻瓜专利网在线咨询

周一至周五 9:00-18:00

咨询在线客服咨询在线客服
tel code back_top