RAID5 要不要多插一张热备盘:建阵之前算清这笔账

机房里建阵列,最常见的纠结之一:业务实际需要四块盘的容量,机柜里明明还有空槽位,要不要顺手多插一张盘做热备?有人觉得多一张盘是浪费预算,有人觉得没热备睡觉都不踏实。这事没有标准答案,但有一套能算清的账——建阵之前把账算明白,比出了故障再补课强得多。

先说热备盘是干什么的

热备盘(Hot Spare)是一张通电待命、但不参与日常读写的盘。它存在的意义只有一个:阵列里某块盘坏了的那一刻,系统不等管理员到场,自动用这张待命盘顶上去,开始重建数据。没有热备时,从坏盘到人工换盘之间隔着的可能是几个小时(有人值守)也可能是几天(假期、异地、没人盯告警)——这段时间阵列处于降级状态,再坏一块就可能是数据全失。热备干的就是把这段"裸奔窗口"从"等人的时间"压缩成"机器反应的时间"。

热备的三种配法,取舍各不同

第一种,全局热备。一张热备盘对整机所有阵列开放——这台服务器上不管哪个阵列坏了盘,它都顶上。适合一台机器里建了多个阵列、盘位紧张的场合,一张盘保全体。代价是只有一张,同时坏两处就顾不过来。

第二种,局部热备。热备盘绑定给某个特定阵列专用。重要阵列(比如核心业务的 RAID)配专属热备,次要阵列不配——资源花在刀刃上。多阵列混部、重要度分层明显的机器适合这种配法。

第三种,不预配,留空槽应急。平时不留热备,坏了盘人工插入新盘顶替。省下一张盘的容量和功耗,但裸奔窗口取决于人到场的时间——异地机房、无人值守的场景不建议这么省。

RAID5+1 这套经典四盘配置

经典语境是这样的:三块盘做 RAID5,第四块做热备。四张盘的投入,换来的容错逻辑是:坏第一块盘,热备自动顶上重建,业务不停、数据不丢;重建完成前又坏一块才真正危险。相比同样四块盘做 RAID6(双校验、无热备),RAID5+热备的日常读性能更好,但重建期间依然只有单重容错——两种方案是取舍关系,不是谁碾压谁。盘数更多的场景(比如 RAID10 加热备)逻辑类似:先算清容错域,再决定热备放几张。

建阵时的账,和坏了盘的账不是一本

得把两条时间线分清。建阵前规划热备——就是本篇讲的,花一张盘买"自动顶上"的反应速度;而阵列出问题之后的换盘纪律——一次只换一块、换完看清重建状态再动下一块、别在降级状态里折腾——那是另一套铁则,之前聊两块盘同时亮黄灯时讲透过的。两条线一头一尾:规划得好,故障时的自动机制才有得用;纪律守得住,自动机制启动后才不会乱上加乱。贵州诚鑫致达科技给企业做服务器交付时,建阵方案里热备怎么配、槽位怎么留,都是按业务重要度和机柜余量一起算进交付方案的,不是拍脑袋插盘。

建阵之前算一遍:你的业务允许多长的降级窗口?机房有没有人值守?盘位和预算还有多少余量?这三个问题答完,热备该不该配、配几张,答案自然就出来了。