[发明专利]一种用于机群容错的系统和方法有效
申请号: | 200810211566.3 | 申请日: | 2008-09-19 |
公开(公告)号: | CN101377750A | 公开(公告)日: | 2009-03-04 |
发明(设计)人: | 霍志刚 | 申请(专利权)人: | 中国科学院计算技术研究所 |
主分类号: | G06F11/00 | 分类号: | G06F11/00;G06F11/14 |
代理公司: | 北京律诚同业知识产权代理有限公司 | 代理人: | 梁挥;王金宝 |
地址: | 100080北京*** | 国省代码: | 北京;11 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | 本发明公开了一种用于机群容错的系统和方法。该系统包括:检查点服务器,其网络连接到所述多个结点,用于收集并行应用的所有进程的信息,向结点发送监控请求,并响应来自结点的检查点操作请求,并将检查点文件保存于检查点文件服务器上;在检查点切取操作完成后,执行检查点恢复操作;检查点文件服务器,其网络连接到所述多个结点,用于存储检查点文件,并在进程恢复过程中提供检查点文件访问支持;故障监测模块,位于所述结点上,用于根据所述监控请求来监测本地结点的操作系统的运行状态和所述监控请求指定进程的指定运行状态,以及所述监控请求指定的硬件部件的指定状态,并在监测到故障时向所述检查点服务器发送检查点操作请求。 | ||
搜索关键词: | 一种 用于 机群 容错 系统 方法 | ||
【主权项】:
1、一种用于机群容错的系统,所述机群包括网络连接的多个结点,其特征是,该系统包括:检查点服务器,其网络连接到所述多个结点,用于收集并行应用的所有进程的信息,根据进程信息,向结点发送监控请求,并响应来自结点的检查点操作请求,执行远程检查点切取操作,并将检查点文件保存于检查点文件服务器上;在检查点切取操作完成后,执行检查点恢复操作;检查点文件服务器,其网络连接到所述多个结点,用于存储检查点文件,并在进程恢复过程中提供检查点文件访问支持;故障监测模块,位于所述结点上,用于根据所述监控请求来监测本地结点的操作系统的运行状态和所述监控请求指定进程的指定运行状态,以及所述监控请求指定的硬件部件的指定状态,并在监测到故障时向所述检查点服务器发送检查点操作请求和向被监测的并行应用的其他进程广播通知该进程正在进行检查点操作。
下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于中国科学院计算技术研究所,未经中国科学院计算技术研究所许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/patent/200810211566.3/,转载请声明来源钻瓜专利网。
- 上一篇:一种具有电子琴谱的音乐钢琴
- 下一篇:显示面板、显示装置