存储阵列换盘后设的备盘,为什么自己变成了成员盘

企业存储换了块离线盘,运维顺手把新插上的盘设置成热备(备盘),想着让它安静待命就行。结果过一阵再看,这块"备盘"的身份变成了成员盘——直接参与数据存放了,热备位空了。中间没有任何人工操作,它为什么自己"转正"了?

原因分析

在中高端存储这种带存储池的机型上,“热备"不是一个固定的盘位身份,而是池层面的一种角色分配。当池里有成员盘离线、冗余降级时,系统会马上征用手头可用的空盘顶上去参与重建——你刚插上并设为备盘的那块新盘,恰好就是当时唯一可用的候选。重建完成后,数据已经实实在在落在它上面,它自然就成了成员盘,而不会自动退出再变回备盘。换句话说:换盘后池还处于降级状态的那一刻,备盘的使命就已经被触发了。这是保护数据的设计行为,不是故障;理解了这一点就明白,备盘"消失"不是盘丢了,而是它的容量换了一种方式在为冗余服务。真正的问题是重建完成后,没人记得把热备补回来,阵列从此在"无备盘"的状态下裸奔。

分步解决

  1. 先确认重建状态:进存储管理界面,看该存储池是否已恢复健康状态,重建进度是否走完。没重建完之前,不要做任何盘位调整。
  2. 核对盘位角色清单:把当前每块盘的角色(成员/热备/候选/空闲)导出来或截图,确认原来那块离线盘是否已标记退役,新盘是否已列为成员,做到心里有账。
  3. 补一块新盘设为热备:既然原备盘已转正,就再插一块盘,显式设置为新的热备,让冗余水位恢复到设计值,容量不小于池内成员盘即可,不必刻意追求同批次。多池环境注意备盘归属是按池分配的,别补错了池。
  4. 给换盘流程立规矩:以后凡是换盘操作,流程里固定加两步——换完先看重建启动没有,重建完再确认备盘回位没。这两步写进操作单,比靠记性可靠。
  5. 设告警兜底:配置"热备数量不足"的告警阈值和通知,通知方式建议邮件加即时消息双通道,哪天备盘又被悄悄征用,当班就能收到提醒,而不是数月后再次降级了才发现无盘可用。

预防

备盘被"吃掉"本质是降级触发的自动重建,防不住,但可以防"忘了补”:把热备数量核对列进存储巡检的固定项目,每次巡检对一遍各池的备盘计数,缺了当班补齐。企业存储的冗余是动态的,盘的角色会随着每一次降级与重建流动,盯住备盘计数比盯着某个盘位靠谱得多。