24 盘位 NAS 只组一个大 RAID 5 为什么不稳妥?RAID Group 拆阵列思路
痛点场景
上了一套 24 盘位的机器,建存储池时随手选了一个大 RAID 5——所有盘进一个阵列,容量最大化,看起来很美。但跑起来才想明白一件事:这个池子整体只有 1 块盘的容错,24 块盘里任何一块故障,池子就进入降级状态;降级期间再坏一块,全池崩。盘越多,潜在的故障点越多,“较大的阵列同时发生多块硬盘故障的风险更高”——这是官方的原话。大盘位存储的正确打开方式,是 RAID Group。
RAID Group 是什么:多个小阵列,捆成一个存储项
RAID Group 由多个 RAID 阵列组合成一个存储项,例如存储池或双存储池。它的工作方式是:
- 用硬盘创建多个 RAID 阵列——把一大把盘拆成若干个小阵列;
- 通过 Logical Volume Manager(LVM)把它们组合为一个存储项——对上层来说,依然是一个统一的池子。
效果是:单个 RAID 阵列的容错能力受所选 RAID 类型限制,而 RAID Group 的容错能力随着 RAID 阵列数量的增加而提升。虽然容量可能会减少,但可靠性换来的是实打实的抗故障能力。
在支持的型号上,可以使用 RAID 5、RAID 6、RAID TP 或 RAID F1 阵列来设置 RAID Group;是否支持 RAID Group,请参考您的型号产品规格。
官方算的这笔账:1 块容错 vs 4 块容错
示例 1:单一 RAID 5 的做法
一个包含 24 块硬盘的存储项采用 RAID 5(1 块硬盘容错)创建:
- 总容量 = 单块硬盘容量 × 23;
- 但只有当有 2 块硬盘故障时才会发生 RAID 故障——这 2 块可能是 24 块里的任何两块,盘越多风险窗口越大。
示例 2:RAID Group 的拆法
同样 24 块硬盘组成 RAID Group,采用 RAID 5,每个 RAID 阵列的最大硬盘数为 6:
- 拆出 4 个阵列,每个阵列具有 1 块硬盘的容错能力;
- 该 RAID Group 总共可实现 4 块硬盘的容错;
- 总容量 = 每个阵列的可用硬盘数 × RAID 阵列数 = (6 − 1) × 4 = 20 块硬盘;
- 发生 RAID 故障的条件收紧为:同一个阵列中有 2 块硬盘故障。第 1 块故障落在 A 阵列、第 2 块落在 B 阵列,都只是各自降级,不会全池崩。
结论很直白:总容量从 23 块降到 20 块,换来的是容错从 1 块提到 4 块,故障判定从"任意两块"收紧到"同一阵列内两块"。对存关键业务的池子,这笔账怎么算都划算。
各版本每阵列最大硬盘数规则
每个 RAID 阵列的最大硬盘数,会根据您的型号是否支持 RAID Group 而有所不同。
DSM 7.0 及以上版本,支持 RAID Group 的型号:
- Basic:1
- RAID 1:4
- JBOD、RAID 0、RAID 10:24
- RAID 5、RAID 6、RAID F1:每个 RAID 阵列最多可有 6、12、16、20 或 24 块硬盘
DSM 7.0 及以上版本,不支持 RAID Group 的型号:
- Basic:1
- RAID 1:4
- JBOD、RAID 0、RAID 5、RAID 6、RAID F1、RAID 10、SHR:无限制
DSM 6.2 及以下版本,支持 RAID 组的机型分两套取向——“更佳性能”:JBOD、RAID 0、RAID 5、RAID 6、RAID F1、RAID 10 均为 24;“更高灵活性”:JBOD、RAID 0、RAID 10 为 24,RAID 5、RAID 6、RAID F1 为每阵列 6、12、16、20 或 24 块。Basic 与 RAID 1 两套均为 1 和 4;不支持 RAID 组的机型与 DSM 7.0 规则相同(无限制)。
DSM Enterprise,支持 RAID 组的机型:
- RAID 5、RAID 6、RAID TP:每个 RAID 阵列 24 块硬盘
一个容易踩的坑:新阵列不是想建就能建
官方注意事项:若要在 RAID 组中创建新的 RAID 阵列,请确保存储池中的每个现有阵列都已达到每个 RAID 的最大硬盘数量。否则,新硬盘将会被添加到现有阵列中,而不是组成新阵列。
换句话说,想拆成 4 个 6 盘阵列,就要按"填满一个阵列、再开下一个"的节奏加盘。而且每个 RAID 阵列的硬盘数上限(6、12、16、20 或 24)在创建存储时设置,之后无法修改——建池那一刻的阵列规划,就是这个池子一辈子的结构。
验证
- 创建后进入存储管理器,查看存储池详情:确认阵列数量、每个阵列的硬盘数与规划一致;
- 用官方算式核对总容量:每个阵列的可用硬盘数 × 阵列数量,与页面显示吻合即规划落地;
- 拔盘演练(可选但建议):在业务低峰期模拟单盘故障,确认只有对应阵列降级、池子整体仍在线,热备或换盘后阵列恢复。
预防与注意
- 大盘位机器建池前先查机型规格确认是否支持 RAID Group,别等池子建完才发现只能进一个大阵列;
- 做大规模存储方案时,诚鑫致达科技会先和客户确认业务重要级:能接受容量换可靠性的关键池,按小阵列拆分规划;纯归档冷数据池再考虑大阵列吃满容量——结构一旦定型无法修改,值得在图纸阶段多花半小时;
- 规划扩容路径时记住"现有阵列填满才会开新阵列"的规则,把未来要加的盘数和阵列上限一起排进采购计划,避免加盘时被并进现有阵列打乱结构。