硬盘不是坏了才知道:群晖 S.M.A.R.T. 检测计划与坏扇区告警实操

硬盘不是坏了才知道:群晖 S.M.A.R.T. 检测计划与坏扇区告警实操

引言

RAID 给了企业存储「坏一块盘不慌」的底气,但底气的成本是替换盘要来得及时——盘的衰退是渐进的,等到存储池降级、告警响起再找人,往往已经在深夜。存储管理器 > HDD/SSD 页面是 DSM 的硬盘健康中枢:驱动器状态一眼可读、S.M.A.R.T. 检测可以手动跑也可以排成计划、坏扇区与 SSD 寿命有独立告警开关。把这一页配置成「盘未坏、人先知」的预防性巡检体系,是存储运维里性价比最高的一件事。这篇从状态读懂到计划落地走一遍,顺带划清它与数据清理(scrubbing)的分工。

先会读驱动器状态

进入存储管理器 > HDD/SSD,选中一块盘点开展开图标,能看到位置、状态、分配角色、温度、固件版本;点状况信息还能看开机时间等统计。状态列的几个取值各有含义:状况良好;关键——遇到了关键错误、只读模式或 SSD 达到耐久性极限,官方建议立即更换驱动器;无法访问系统分区——需要点修复系统分区按钮处理;已检测——盘上有存储池数据,需要时用在线组装功能找回来;不兼容/未验证/无法识别——与机型兼容性相关,按提示更换兼容驱动器;必须更新固件——存在可通过固件更新解决的问题;已停用——盘被人为停用。状态之外还有分配角色列,标明这块盘属于存储池、可用池、SSD 缓存群组、热备份还是系统驱动器。

操作步骤

  1. 进入存储管理器 > HDD/SSD,逐块点开状况信息,建立全盘健康基线。为什么:巡检的前提是有基线——温度、开机时间、历史测试结果都记一遍,之后任何偏离才有参照。以前的测试结果显示在状况信息 > 历史纪录里,别只看最新一次。

  2. 手动跑一次 S.M.A.R.T. 检测:选中驱动器 > 状况信息 > S.M.A.R.T. 选项卡 > 选快速检测或完整检测 > 开始运行测试。为什么:先手动跑通流程、确认这批盘支持该测试——官方注明仅特定硬盘型号支持,如果驱动器型号不支持,S.M.A.R.T. 选项卡根本不会显示;同时注意 NVMe SSD 有自己的监控机制,不支持 S.M.A.R.T. 测试或坏扇区警告。测试时长随系统使用情况和驱动器容量而异,测试期间系统性能可能暂时受影响,第一次完整检测安排在业务低谷跑。

  3. Seagate 盘加跑 IronWolf Health 测试:选中 Seagate 驱动器 > 状况信息 > IronWolf 健康 > 开始运行测试。为什么:IronWolf Health Management 依赖比 S.M.A.R.T. 更丰富的额外驱动器遥测数据,输出代码直接给行动建议——100 是异常高温(查通风与环境温度)、101 是 NAS 与驱动器接口连接问题、102 是过度物理冲击、105 是过度振动、106 是过多主机重置、200/201/202/203 建议运行扩展测试并在持续异常时联系经销商或制造商。注意官方边界:此测试仅适用于某些型号和尺寸的驱动器,且仅适用于 22 系列之前发布的特定群晖机型。

  4. 把检测排成计划:存储管理器 > HDD/SSD > 设置 > 检测计划程序 > 创建。在常规标签页选任务类型(支持 S.M.A.R.T.、IronWolf Health 与 All,取决于盘的型号支持面)、输入任务名称、选 S.M.A.R.T. 测试类型(快速或扩展)与测试范围(所有支持的驱动器或某些驱动器)。为什么:手动检测靠自觉,计划检测靠制度;快速检测排每周、扩展检测排每月是常见的巡检节奏,范围先「所有支持的驱动器」,发现某块盘异常后再对它单独加密集度。

  5. 切到计划标签页定日期与时间:日期可选每周某些天(如工作日、周末)或特定日期,时间指定频率与首次、最后一次运行时间,点击 OK 完成。为什么:官方有一条容易被忽略的提醒——运行测试可能会影响系统休眠,测试按计划开始时,系统会从休眠中唤醒或被阻止进入休眠;对依赖硬盘休眠省电的环境,检测窗口要安排在不打扰休眠策略的时段,否则省电目标与巡检目标互相打架。计划建好后,检测状态与下次运行时间显示在存储管理器 > 总览 > 任务计划中,管理入口支持编辑、删除、立即运行三种动作。

  6. 开启坏扇区警告:存储管理器 > HDD/SSD > 设置 > 高级设置 > 勾选启用坏扇区警告 > 应用。为什么:S.M.A.R.T. 计划是周期性体检,坏扇区警告是常驻哨兵——检测到坏扇区即时提醒,不用等下一个巡检日。官方同时给了颗定心丸:坏扇区是相对常见的现象,数量增加到一定程度才触发警告,只有急剧增加才需要担心(可能预示硬盘即将失效),避免见着坏扇区就换盘的过度反应。注意此选项仅适用于某些型号。

  7. 有 SSD 的环境补上耐用性提醒:同在高级设置里,SSD 预估耐用性提醒对 Synology SSD 按月输入 1 到 3 之间的值,对其他 SSD 按百分比输入 1 到 5 之间的值。为什么:SSD 的寿命是写入量决定的,缓存盘这类高写入角色尤其需要盯。官方口径有三条:耐用性预估基于盘自身 S.M.A.R.T. 信息生成,不支持相应属性的 SSD 无此功能;Synology SSD 的预估值基于最近 I/O 工作负载,新装的要至少 24 小时才能估出来;即使禁用提醒,Synology SSD 达到极限或其他品牌低于 1% 时系统仍会通知——底线通知不可关,这是数据安全的兜底。

三条边界先知道

  • 巡检不等于清理:S.M.A.R.T. 检测看的是驱动器硬件健康,数据清理(scrubbing)校验的是数据一致性,两者互补不可互替——盘健康不等于数据无损,Btrfs 校验有自己的阵地。
  • 兼容性建议:官方建议使用兼容性列表内的硬盘,未列出的硬盘可能影响系统稳定性甚至导致数据丢失——巡检体系建立的前提是盘本身在企业级兼容范围内。
  • 性能影响是常态:S.M.A.R.T.、IronWolf Health、性能测试(调校)都注明测试期间系统性能可能暂时受影响;把检测窗口与备份窗口、业务高峰错开,是计划页存在的意义。

结语

硬盘健康管理的要义是把「坏了换」变成「衰退就看见」:状态列会说话、检测计划跑在夜里、坏扇区与 SSD 寿命哨兵常驻。贵州诚鑫致达科技在企业存储交付里,会把 S.M.A.R.T. 检测计划与坏扇区告警写进巡检手册的固定章节——盘的衰退从来都有前兆,缺的只是那双一直看着的眼睛。