VMM 集群冻结服务停摆:虚拟机强制故障转移与重新保护全流程
场景:集群冻结了,业务等不起
Virtual Machine Manager(VMM)的集群被冻结,里面的虚拟机跟着停摆。集群的问题可能一时修不好,但业务不能一直停——这种局面下的正确姿势不是死磕集群,而是绕开它:手动对集群执行故障转移,先把服务救回来。
强制创建新集群
用当前这台还活着的主机,强制创建一个新的独立集群,用它来接管虚拟机的管理。原集群虽然冻结,虚拟机本体还在盘上,缺的只是一个能管它们的集群框架。
故障转移虚拟机
进入 VMM 的保护页面,选中要救的虚拟机,单击管理 > 故障转移,按屏幕上的说明一步步走完。虚拟机会在新集群下重新跑起来,业务先恢复,集群的修复另找时间窗慢慢来。
主机恢复后,重新保护
离线那台主机的服务修好之后,还有收尾要做——把它重新纳管,让虚拟机回到受保护状态:
- 先强制用这台恢复的主机创建另一个新集群;
- 进入主机页面,把它导入之前创建的那个单主机集群;
- 回到保护页面选中虚拟机,单击管理 > 重新保护,按屏幕指引完成。
重新保护做完,虚拟机又有了完整的保护关系,下次再出状况才有得切换。
小结
- 集群冻结先救业务:强制建新集群加故障转移,两步恢复服务;
- 修复主机后别忘收尾:建新集群、导入主机、重新保护三件事;
- 故障转移是应急动作,做完把保护关系补回来才算闭环。
诚鑫致达科技给客户上虚拟化双机时立过一条制度:每半年挑一台非核心虚拟机,真做一次这样的故障转移演练——这条路平时走没走过,出事那天的差距是按小时算的。