HA 集群建好只是开始:群晖计划性切换与自动故障转移运维实操
HA 集群建好只是开始:群晖计划性切换与自动故障转移运维实操
引言
Synology High Availability 集群搭建完成、数据复制完毕,只等于「双机」就位;真正的功课从日常运维开始:主服务器要换硬盘、要升级、要挪机柜,这些维护动作都要求先让服务离开这台机器——这就需要「切换」。而另一头,半夜断电、硬盘损毁时集群自己会做什么,管理员也必须心里有数,否则告警响起时无从判断。这篇讲清楚计划性切换怎么做、自动故障转移什么时候触发、以及两者共同的行为边界。
两个词先分清:切换与故障转移
服务从集群的主服务器转移到备用服务器,统称「切换」;自动发生的场景下也称「故障转移」。切换完成后角色互换——原来的主服务器成为备用服务器,备用服务器则成为主服务器。理解角色互换是运维的前提:切换不是「临时借调」,而是彻底换位,主机名、监控视角、后续维护计划都要跟着换边。
操作步骤:计划性切换
-
确认集群处于健康状态:数据复制已完成、备用服务器无异常。为什么:官方明确列出切换失败的情形——数据复制不完整(首次建立集群时数据尚在复制中)、备用服务器上的存储空间损毁、备用服务器电源故障、DSM 更新期间。这四种状态下发起切换,轻则失败,重则服务回不来;切换前的第一件事永远是看集群健康度。
-
向业务方公告停机窗口。为什么:切换进行时,主服务器先变为备用服务器、备用服务器之后才成为主服务器,期间两台都处于备用服务器状态、无法正常提供服务;停机时长取决于存储空间与 iSCSI LUN(块级)的数量大小,或服务数量与总负载。这不是零中断操作,按窗口管理,比事后解释体面得多。
-
在集群页面单击「管理」,再单击「切换」启动。为什么:计划性切换是管理员主动发起的受控动作,入口在集群管理里而不是电源管理里;顺序上先公告后操作,把「受控」落在流程上。
-
切换完成后验证服务再放行业务。为什么:角色互换后,共享、套件、虚拟化负载都要在新主服务器上确认恢复;验证清单跑完再通知业务方,避免「服务切过去了、某项依赖没起来」的半恢复状态。
-
对原主服务器执行维护,完成后决定是否切回。为什么:维护后的切回是又一次完整的切换,同样有停机窗口;是否切回取决于哪台硬件更新、哪台位置更合理,而不是「习惯上主机在那边」。
-
配置 UPS 联动:前往 DSM 控制面板 > 硬件和电源 > UPS,勾选「启用 UPS 支持」,选择 UPS 类型和进入待机模式前的时间(与服务器相同或自定义);支持本地和 SNMP UPS 设备。为什么:主服务器连接的 UPS 低电量运行时,系统会尝试将服务切换至备用服务器——这是官方定义的电源场景联动;仅主服务器连 UPS 时,断电后两台都会进入待机模式,服务停止、存储空间卸载以防数据丢失,UPS 耗尽后系统安全关闭。
自动故障转移:三个触发条件
- 存储空间损毁:主服务器上的存储空间、硬盘组、RAID Group、SSD 缓存等损毁,而备用服务器上对应空间正常时触发。注意边界:若损毁的空间上没有存储空间或 iSCSI LUN(块级),不会触发——空故障不切换,避免无意义的角色抖动。
- 服务错误:受监控的服务出现错误时触发。
- 电源故障:主服务器关机/重启、两个电源设备故障或断电时触发。
供电拓扑要一并设计:两台都连 UPS 且同一电源时,可能同时进入待机;备用服务器接不同电源时,主服务器电源不足可触发切换。若使用网络交换机,官方建议服务器与所连交换机使用相同电源(同一交换机时),或各自对应交换机的电源——别让「电源冗余」被一台交换机的单电源吃掉。
切换失败怎么办
手动切换失败时,系统会尝试将服务切回主服务器;若故障转移后两台服务器都无法成为主服务器,集群无法提供服务——此时需按两台服务器上的「重置」按钮恢复默认设置,之后重新合并并重建集群。这是最后手段,动之前确保数据备份体系独立于集群存在。
结语
HA 的价值不在「永不停机」,而在「故障时的接管速度」与「维护时的有序换位」。计划性切换按窗口走流程,自动故障转移的三个触发条件背熟,UPS 供电拓扑与集群行为对齐,这三件事构成了双机运维的基本功。贵州诚鑫致达科技做高可用交付时,会把「切换演练」排进验收流程——切换这件事,平时练过和没练过,出事那天是两种结果。