两台群晖组高可用:Synology High Availability 集群创建向导,从硬件对齐到集群 IP 落地

两台群晖组高可用:Synology High Availability 集群创建向导,从硬件对齐到集群 IP 落地

核心业务最怕单点:一台 NAS 扛着文件共享、监控存储、虚拟机盘库,机器一宕全线停摆。群晖 Synology High Availability(SHA)的解法是双机热备——两台配置一致的存储设备组成集群,主服务器跑业务、向备用服务器实时复制数据,故障时自动转移到备机接管。这套机制的价值,一半在向导点完之后,另一半在点下去之前:两台机器对齐得越干净,切换那天越体面。

什么场景值得上双机

一是停机代价高的生产存储:ERP 文件库、设计文件、监控录像,宕机一小时损失比第二台机器贵。二是没法接受恢复窗口的业务:单机备份恢复要小时级,双机故障转移是分钟级接管。三是机房验收把双机当门槛的行业客户。

操作步骤

  1. 对齐两台机器的硬件与软件。两台为相同型号且支持 Synology High Availability,LAN 端口数量一致(含额外网卡);DSM 版本相同,SHA 与存储管理器套件版本相同;两台硬盘数量相同、装在完全相同的插槽,每个插槽的硬盘类型和容量与对端一致。为什么:官方在向导前列明的硬性前提——注意是每槽对齐而非总量对齐,槽位错一格向导验证就会拦下来,先对齐再开向导,省得来回搬机器。

  2. 清理主服务器的存储形态。创建集群前,主服务器不得包含 SHR 存储池或基于 M.2 SSD 构建的存储池,未在块级 LUN 上挂载 SSD 缓存,未运行 SSD Cache Advisor 分析;两台所有存储池和硬盘均为良好状态。为什么:这些形态集群不支持,带着进向导只会在验证环节报错,先自查等于把验证页变成走流程。

  3. 统一网络配置。两台用同一子网的静态 IP;没有防火墙规则阻止高可用性集群端口;禁用 IPv6、PPPoE 和 Wi-Fi;数据网络与 Heartbeat 的 Link Aggregation 设置相同(集群创建后无法修改),Open vSwitch 状态相同。为什么:集群复制与心跳都跑在这些通道上,任何一处两台不一致,轻则验证不过,重则运行期心跳抖动——那是最难查的一类故障。

  4. 给两台主机起不同的主机名,避免包含 active、passive 这类角色词。为什么:切换或自动故障转移后角色会互换,名字里带角色会让运维排障时被自己的命名误导,官方专门提示了这一点。

  5. 规划两条关键连接:集群连接与 Heartbeat 连接。选最大带宽的网口:四个 1Gbps 口可为两条连接设 2 接口链路聚合;有两个 10Gbps 口则一个做集群连接、一个做 Heartbeat;Heartbeat 不得慢于集群连接,要求两主机间 Ping 少于 1 ms、传输速度最小 500 Mbps、必须是两台上最快的网口,经交换机则需支持多播。为什么:Heartbeat 是双机判断「对方还活着」的生命线,慢了会误判死机触发不必要的切换,这两条网线值得用最好的口。

  6. 启动 Synology High Availability,单击创建高可用集群进入向导,为两条连接选择两台主机上相同的网络接口。向导会为 Heartbeat 生成两组 IP(如 169.254.1.1 和 169.254.1.2)用于数据复制。为什么:两端必须选相同接口(一端用 LAN 1,另一端也得是 LAN 1),生成的地址须确认未被网内占用,否则同步通道起不来。

  7. 输入备用服务器信息:用属于备用服务器管理员群组的帐户登录,确认备用服务器上没有重要数据再继续。为什么:官方明示——创建集群后备用服务器上的所有数据都将被删除,这是全流程唯一不可逆的删除动作,必须当着提示面确认一次。

  8. 设置集群主机名与集群 IP:主机名不超过 15 个字符且与两台主机都不同;集群 IP 从向导显示的可用范围里选一个未被占用的静态地址。为什么:集群 IP 是虚拟 IP,故障时自动从主机漂移到备机,业务侧只认这一个地址;直连主备机地址的连接切换后会断,这是上线后最常见的「切了但没完全切」。

  9. 通过验证要求并应用。向导检查系统信息、存储空间、网络服务、网络设置、Heartbeat 接口五类要求,未满足项连解决方案一起显示,修复后继续,最后确认设置单击应用。为什么:验证页是官方替你做的上线前体检,把每条红项当正式故障对待,比上线后翻日志快得多。

建成之后的运营边界

集群不是建完就撒手:存储空间与块级 LUN 总容量上限 400 TB,超 200 TB 要求两台全新安装 DSM 7.1 以上;存储空间与 LUN 总数上限 64。降级盘无论坏在哪台,都必须在主服务器上修复;配了热备盘的系统自动修复后,另一台对应槽位也要换盘保持一致。日常盯集群页 CPU 利用率(建议低于 80%)与内存(建议保留 20% 给系统监控);split-brain 发生时系统会停所有服务防数据不一致,是最高优先级事件。

双机热备买的是「故障那一刻的从容」。硬件对齐、心跳专线、集群 IP 统一入口,三件事在向导里一次做对,切换之夜就只是值班记录里的一行。贵州诚鑫致达科技在双机存储交付里,把向导前的对齐清单当作立项文档先评审再动手,返工成本远低于现场排查。