RAID5 两块盘同时亮黄灯,能不能一次换两块:机房换盘的铁则是一次只动一盘
做机房运维的人,最难淡定的时刻大概就是巡检时发现 RAID5 阵列里两块盘同时亮了黄灯。一块盘故障尚在预期之内,两块一起出问题,脑子里立刻蹦出的念头是:能不能干脆一起拔了、一起换上新的,一次搞定?把结论说死:不能。降级状态下换盘的铁则就一条——一次只动一块盘,重建完成之后,再换第二块。这条纪律背后是 RAID5 的容错账,不是习惯偏好。
为什么一次只能换一块
RAID5 的设计容错是"允许同时失效一块盘"。一块盘故障后,阵列靠剩余成员盘上的分布式校验继续撑着:数据还都能读出来,写也能写,但此时阵列已经没有任何冗余了——再坏任何一块,数据就直接不可用了。理解了这个状态,“两块同换"的风险就一目了然:把第二块故障盘也拔出来的那一瞬间,阵列里的在线成员不足以再拼出完整数据,等于亲手把阵列推过了崩溃线。就算新盘立刻插回,那段窗口也足以让不少阵列卡把阵列标记为失效。
正确的顺序是把风险往后放:确认哪块盘先故障、先换这一块、重建恢复冗余、再处理第二块。多花一倍时间,但每一步阵列都保有恢复能力。
降级状态下的操作序
第一件事不是换盘,是备份。阵列已经处于无冗余状态,此刻最重要的资产是数据本身——趁阵列还能正常读,先把关键数据备出来,再开始动硬件。这一步在慌乱中最容易被跳过,也最不该被跳过。
然后确认故障顺序。阵列卡日志或管理界面里能看到状态:通常一块已失效离线,另一块是降级阵列下的预测性故障告警。先换已失效的那块,新盘插入后阵列自动(或手动)开始重建。
盯重建进度到百分之百。重建是整个阵列压力最大的窗口:所有成员盘要被完整读一遍,一块健康度本就在下滑的老盘,很可能就在这个窗口里撑不住。所以重建期间不要叠加其他大负载;进度条没走完前,第二块故障盘继续在线忍着——它只要还能读,就还在为数据可用性服务。
重建完成、阵列恢复最优状态后,再换第二块,再走一轮重建。两轮都结束,阵列才算真正安全。
几个顺带的取舍
换什么盘:优先同型号同容量;大容量新盘也能用,但多余容量在传统 RAID 里用不上(整阵列容量由最小成员决定)。也有企业趁此机会整阵列迁移换新盘,那是另一个工程,不在故障处置的讨论范围。
热备盘(Hot Spare):配了热备的阵列,第一块盘故障时它已自动顶上开始重建——用一块盘位的成本换响应速度;没配的,故障后就只能靠人工响应,这次的教训可以是下次配热备的理由。
为什么两块盘会"一起"出问题:同批盘服役年龄与负载相同,跑到寿命后段先后出事并不稀奇;第一块故障后的重建高强度读取,又会加速剩余老盘的衰退——这也是为什么换完盘要留意其他同批成员,该规划整批轮换就早点动手。
近邻话题划清边界:RAID1 拔盘恢复、重建进度反复归零,此前都单独聊过,属于另外的场景;本篇只回答一个决策——多块盘同时报障时按什么顺序动手。黄灯本身只是阵列卡对盘状态的指示,处置纪律比判断盘体哪里坏了更紧要。贵州诚鑫致达科技在做服务器运维交付时,把"先备份、再换盘、一次一块"写进换盘操作规范,也会帮客户把热备配置、批次轮换计划一并定好。你们机房上次换盘,是先备份还是先拔盘?评论区聊聊。