一分钟内接班的底气:群晖 SA3200D 双控制器高可用总览切换与监控实操

一分钟内接班的底气:群晖 SA3200D 双控制器高可用总览切换与监控实操

引言

两台 NAS 组高可用集群是常见的容灾形态,但它有个天然短板:两台独立整机之间靠网络复制数据,切换时长和数据一致性都受链路制约。群晖还有另一条路——把两颗控制器装进同一台机箱、共享同一批硬盘。SA3200D 就是这个形态:2U 机架式、双存储控制器、12 个盘位(可通过两台 RXD1219sas 扩充设备扩到 36 盘),官方对这套双控冗余的说法是把停机时间尽可能控制在一分钟内。这套系统的日常管理入口是一个专属套件:Synology High Availability(适用于 SA3200D)。它和「两台整机组的经典 High Availability」是两套东西,页面结构、切换逻辑都不一样。这篇按总览、控制器、监控、设置、日志五个页签的顺序,把日常运维要盯什么、手动切换怎么走、自动故障转移什么时候触发讲清楚。

操作步骤

  1. 打开套件先看总览页的系统状态灯,认全五种状态。为什么:状态分良好、正在处理、正在更新、警告、严重五档。关键在后面四种都带着同一句话——切换服务已暂停(严重档是服务可能已不可用)。也就是说系统在修复存储空间、装更新、或者报错的时候,手动切换按钮点了也不会执行兜底动作。看到「警告」就想靠切换避开风险是行不通的,必须先把错误本身解决掉。

  2. 对照异常状态表定位问题级别。为什么:总览页把常见异常分了五档——监控的服务错误(SMB、AFP、FTP、NFS、iSCSI LUN 这类被监控服务出故障,有时重启可解)、存储空间已降级、存储空间已损毁、无法检测到备用服务器、系统中没有备用服务器。注意系统同时存在多个错误时只显示最需要注意的那一个,修完一个刷新再看下一个,别指望一屏看全。

  3. 在系统信息区确认两颗控制器当前的角色。为什么:这个区域用示意图标出哪颗是主控制器、哪颗是备用,还有服务器名称。日常维护前的头一件事就是确认角色——要动主控的硬件、要规划维护窗口,都得以「当前谁在干活」为基准,凭上次的记忆判断角色很容易踩错边。

  4. 手动切换:点总览页的「切换」按钮,并接受一个事实——切换期间两颗控制器都短时无法提供服务。为什么:角色互换的过渡期里两边都处于不可用状态,完成时间不固定,官方列出的三个变量是存储空间或 iSCSI LUN 的数量和大小、共享文件夹的数量和大小、服务的数量和总负载。库越大、服务越多,切换窗口越长。所以切换要放在业务低峰期做,并且提前告知使用方「会有几分钟不可用」,而不是把它当成无感操作。

  5. 平时盯主机利用率的两条红线:CPU 利用率低于 80%,内存始终保留 20% 给系统监控。为什么:双控系统的监控与切换机制本身要吃资源,官方明确建议为系统相关监控保留余量。把资源压满的代价是关键时刻切换动作变慢甚至失败——高可用系统最忌讳的就是长期满载运行。

  6. 到控制器页核对硬件明细:每颗控制器的名称与主/备角色、连接状态、序列号、物理内存、CPU 温度、风扇状态、当前 DSM 版本。为什么:这里有两个实用点——风扇状态显示「错误」代表风扇已故障需要更换,是硬件报修的前置证据;两颗控制器必须安装相同版本的 DSM,版本核对就是这页最日常的用途。

  7. 到监控页挑服务与网络接口,只勾高优先级的。为什么:可监控的服务包括 Windows 文件服务、iSCSI Target、光纤通道、FTP、Mac 文件服务、NFS 服务、Synology Directory Server、网页服务。任何一个被监控对象不可用都会触发自动故障转移,而切换本身要中断服务——让一个低优先级的 FTP 服务故障把整个系统切一遍,得不偿失。网络接口监控还有个硬前置:先到控制面板把该接口设成静态 IP,动态地址的接口没法稳定监控。

  8. 理解网络接口故障转移的触发条件,别误判。为什么:官方规则是只有当备用服务器拥有更多正常连接时才触发切换——主控三条连接坏了一条、备控至少三条正常,才会切换;做了链路聚合的连接算一条,聚合口里断一根线但另一根还在,这条连接就算正常。排障时按这个规则推,就不会奇怪「坏了一条线为什么没切」。

  9. 到设置页决定两个开关:快速更新、内存缓存数据镜像。为什么:快速更新启用后,系统更新过程中会执行切换,更新完成时两颗控制器角色互换,用这种机制压缩更新停机时间——代价是每次升级都伴随一次切换动作,要跟维护窗口一起排。内存缓存数据镜像让缓存数据在两颗控制器的内存之间实时同步,主控不可用时备控接手不丢缓存数据;代价是整体写入性能可能受影响。这是典型的「性能换可靠」选择项,跑重要业务的机器建议开,跑可重算业务(如缓存型读负载)的可以权衡。

  10. 日志页做留痕:按关键字、日期范围、日期、层级搜索,导出时选 HTML 或 CSV。为什么:切换、故障转移、状态变化都要有据可查,CSV 是 UTF-8 编码,用不支持 UTF-8 的程序打开会乱码——交给审计或厂商排障前先确认打开工具。

三条边界先知道

  • 警告态没有切换兜底:正在处理、正在更新、警告三种状态下切换服务都是暂停的,自动故障转移指望不上,先修错误再谈切换。
  • 接口监控先改静态 IP:动态获取地址的接口不具备监控条件,这一步不做,监控页勾了也白勾。
  • 镜像选项是性能换可靠:内存缓存数据镜像保证故障接管时不丢缓存写入,但官方明确提示整体写入性能可能下降,按业务重要性取舍。

结语

双控制器把「备机」装进了同一台机箱,切换不再依赖整机间的网络复制,但运维逻辑反而更细:状态五档各有含义、切换窗口有大有小、监控对象要挑着勾。贵州诚鑫致达科技在为企业客户规划高可用存储时,双控机型的监控清单与切换演练是交付必做项——高可用不是买回来的,是管出来的。