说好的热备盘从列表里消失了?四种原因对号入座

痛点场景

上周刚把一块盘设成热备,今天例行巡检,热备列表里空了。查看位置没错——DSM 在 存储管理器 > 存储 > Hot Spare,DSM Enterprise 在 存储管理器 > Hot Spare——盘也还插在机器上,就是不在热备名单里了。是盘被偷了保护?还是系统出了毛病?官方知识库对这个问题给了明确答案:热备盘从列表消失,只有四种可能,逐一对号入座就行。

原因一:热备已经上岗,替换了故障硬盘

这是好事。当存储池或双存储池中的硬盘发生故障时,热备份会自动接管并修复存储池——这正是当初分配它的目的。接管之后,热备份会成为存储池的永久组成部分,不再被标记为热备份,自然也就从热备列表里消失了。

判别方法:查看存储池状态和历史日志,如果近期发生过硬盘故障、且池已完成修复,热备"消失"其实是转正了。

官方建议:分配新的热备份硬盘以维持数据保护——热备转正后保护层次就降了一级,要尽快补位。DSM Enterprise 用户还有更省心的选项:启用可回退热备份功能,使热备份在故障硬盘更换后自动恢复为待命状态,补位期间用不着人工再排班。

原因二:热备盘自己不再健康

如果系统检测到热备份硬盘故障或存在兼容性问题,该硬盘会自动从热备份列表中移除。热备位上放的是"消防员",消防员自己病了就不能继续值班——系统直接把它撤下来。

判别方法:到存储管理器里查看这块盘的健康状态,留意是否有故障记录或兼容性提示。

官方建议:用健康的硬盘替换,并将其分配为热备份。注意"健康"和"兼容"两个条件都要满足,一块偶尔报错的盘放在热备位上,等于没有热备。

原因三:存储池换了更大容量的盘,热备跟不上了

如果已将存储池或双存储池中的硬盘更换为更大容量的硬盘,现有的热备份可能不再满足保护该存储池的容量要求。热备的原理是故障时顶上去重建数据——池里的盘容量都升级了,热备盘比成员盘还小,顶上去也装不下,保护就不成立。

判别方法:核对热备盘与池内成员盘的容量,成员盘升级过、热备盘还是老容量,基本就是这一条。

官方建议:分配符合要求的硬盘作为新的热备份。给池子做"以小换大"式扩容时,热备盘要跟着一起升级,这条最容易被漏掉。

原因四:热备修复或回退过程中出现错误

热备的自动动作分"上去修"和"修完退"两段,两段都可能出错,出错后的去向不同:

  • 修复过程中出现错误:系统在使用热备份修复存储时发生错误,修复过程将停止,热备份会被标记为严重或故障,并自动从热备份列表中移除;
  • 回退过程中出现错误:系统将热备份硬盘回退为待命状态时发生错误,该热备份硬盘可能会成为存储池或双存储池的一部分——想退没退成,就地转正了。

判别方法:查看存储池事件日志中修复/回退任务的报错记录,再对照热备盘当前的状态标记和它是否出现在池成员里。

官方建议:分配新的热备份硬盘以维持数据保护。同时把修复/回退出错的上游原因(往往是盘的健康或兼容问题)一并查掉,否则新热备上去还会重演。

验证

  • 按四条原因定位后,对应动作完成(补新热备/换健康盘/升级容量热备/处理出错根因);
  • 回到 DSM 的 存储管理器 > 存储 > Hot Spare(或 DSM Enterprise 的 存储管理器 > Hot Spare),确认新分配的热备盘已出现在列表中、状态待命;
  • 有条件的话做一次受控演练:拔一块成员盘确认热备接管,再插回成员盘(DSM Enterprise 可回退热备份验证自动恢复待命),全程记录结果。

预防与注意

  • 热备纳入例行巡检清单:每周看一眼热备列表是否仍有待命盘、数量是否与池的保护要求匹配,“消失"越早发现越好;
  • 池内成员盘升级容量时,同步评估热备盘容量,别让保护配置在扩容后悄悄失效;
  • 启用 DSM Enterprise 的可回退热备份功能,把"故障盘换新后热备自动归位"交给系统,减少人为补位的时间窗;
  • 热备是池级保护的补位机制,不能替代备份——热备挡得住单盘故障,挡不住误删和整池灾难,两条线要并行。