[发明专利]分布式流式数据处理的方法和装置在审
申请号: | 201610447125.8 | 申请日: | 2016-06-20 |
公开(公告)号: | CN106874320A | 公开(公告)日: | 2017-06-20 |
发明(设计)人: | 冯成林;罗亮 | 申请(专利权)人: | 阿里巴巴集团控股有限公司 |
主分类号: | G06F17/30 | 分类号: | G06F17/30 |
代理公司: | 北京博思佳知识产权代理有限公司11415 | 代理人: | 林祥 |
地址: | 英属开曼群岛大开*** | 国省代码: | 暂无信息 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 分布式 数据处理 方法 装置 | ||
技术领域
本申请涉及数据处理技术领域,尤其涉及一种分布式流式数据处理的方法和装置。
背景技术
随着各种网络应用日渐深入人们的日常生活,很多应用系统每天会产生数以TB(Terabyte,百万兆字节)级计的业务数据。对这些海量数据的实时分析能够提供对应用系统极有价值的信息,例如,对交通监管系统采集的海量视频数据流的实时分析能够为交通疏导提供帮助,对社交网站用户访问行为的实时分析能够及时发现关注热点并推送给更多的用户。
海量的实时业务数据通常保存在不同地点、不同软硬件平台、和/或不同类型的数据库中,由实时数据采集系统将数据库中实时变化的业务数据以流的方式源源不断的收集起来,以进行实时数据处理。实时数据采集系统可以采用单线程实现;也可以采用分布式实现,由多个线程并发进行实时数据的采集。
由于应用系统的业务数据随时可能发生更新,尤其是一个业务数据可能在极短的时间内发生多次更新,单线程实现的实时数据采集系统能够确保先更新的业务数据实时值在流式数据中先于后更新的业务数据实时值,但是单线程实现的低性能在绝大多数情况下无法满足海量实时数据的处理需求。而分布式实现的实时数据采集系统则可能出现在其生成的分布式流式数据中,业务数据实时值的先后顺序与更新发生的先后顺序不同的情形。
现有技术中,依照业务数据在流式数据中的先后顺序对业务数据的实时 值进行数据处理。这样,当分布式流式数据中业务数据实时值的先后顺序与更新发生的先后顺序不同时,更新在先的实时值会覆盖更新在后的实时值,导致数据处理的结果错误。
发明内容
有鉴于此,本申请提供一种分布式流式数据处理的方法,包括:
获取流式数据中某一条数据记录的业务数据标识信息、待处理实时值和待处理实时值时序特征;所述标识信息唯一代表一个或一组业务数据;
根据存储的业务数据标识信息与已处理实时值时序特征的对应关系,获取所述业务数据的已处理实时值时序特征;
比较所述业务数据的待处理和已处理的实时值时序特征,当待处理实时值的时序晚于已处理实时值的时序时,采用待处理实时值进行业务运算并将存储的所述已处理实时值时序特征更新为待处理实时值时序特征。
本申请还提供了一种分布式流式数据处理的装置,包括:
待处理信息获取单元,用于获取流式数据中某一条数据记录的业务数据标识信息、待处理实时值和待处理实时值时序特征;所述标识信息唯一代表一个或一组业务数据;
已处理信息获取单元,用于根据存储的业务数据标识信息与已处理实时值时序特征的对应关系,获取所述业务数据的已处理实时值时序特征;
数据处理单元,用于比较所述业务数据的待处理和已处理的实时值时序特征,当待处理实时值的时序晚于已处理实时值的时序时,采用待处理实时值进行业务运算并将存储的所述已处理实时值时序特征更新为待处理实时值时序特征。
由以上技术方案可见,本申请的实施例中,在数据处理时保存数据记录的已处理实时值时序特征,与流式数据中同一数据记录的待处理实时值时序特征进行比较,只对时序晚于已处理实时值的待处理实时值进行业务运算,从而实现了按照数据更新的顺序来进行数据处理,避免了因先处理更新在后 的实时值导致的处理结果错误,提高了数据处理的准确度。
附图说明
图1是本申请实施例应用场景的一种网络结构图;
图2是本申请实施例中一种分布式流式数据处理的方法的流程图;
图3是本申请实施例所在设备的一种硬件结构图;
图4是本申请实施例中一种分布式流式数据处理的装置的逻辑结构图。
具体实施方式
本申请的实施例提出一种新的分布式流式数据处理的方法,在流式数据中携带数据记录的待处理实时值时序特征,保存已进行数据处理的数据记录的已处理实时值时序特征,通过比较待处理和已处理的实时值时序特征来得知待处理和已处理实时值的相对时序,并且在待处理实时值的时序较晚时才对其进行数据处理,从而能够避免后处理时序较早的实时值导致的数据处理结果错误,以解决现有技术中存在的问题。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于阿里巴巴集团控股有限公司,未经阿里巴巴集团控股有限公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/201610447125.8/2.html,转载请声明来源钻瓜专利网。