日志报 INFO: task blocked for more than 120 seconds,指标正常也要紧吗?

这行日志是内核在替你「点名」:某个进程陷入 D 状态(不可中断的睡眠)超过 120 秒,内核打印一条 INFO 级告警,把进程名和 PID 报出来。它跟 CPU、内存指标正常不正常没有直接关系——D 状态的进程等的往往不是 CPU,而是 IO、锁、或者挂死的网络存储,所以「环境检查指标正常」与这条告警完全可能同时成立。

怎么判读

  1. 先对时间点。告警是否集中在备份窗口、大批量拷贝、数据导入的时段?大量 IO 把队列排满时出现单次告警,属于负载性现象,记录下来观察频率即可;
  2. 抓现行。告警还在刷时执行 ps -eo pid,stat,wchan:32,cmd,过滤 STAT 列带 D 的进程——wchan 字段指出它在内核里等什么,是判读的关键线索;
  3. 看伴随信息。dmesg 里同一时间窗有没有磁盘 IO 错误、SCSI 重置、存储链路报警——hung task 经常只是底层故障的「下游表现」;
  4. 排查三个来源:本地磁盘/阵列卡 IO 阻塞、数据库等锁争用、NFS 等网络文件系统服务端挂死。第三类有个典型特征:涉及 NFS 的进程成片挂 D,本机盘却毫无压力;
  5. 处置边界。把回写阈值这类内核参数调大只是缓冲,不是根治。反复出现的告警,优先查存储链路与业务锁,而不是急着调参。

相关提示

  • 一次告警、业务无感、之后不再出现——记入巡检日志观察即可;
  • 告警里的进程名本身也是线索:出现在报错里的若是 irqbalance 这类中断管理进程,方向往硬件中断与内核层查;若是业务进程或数据库进程,方向往锁与存储查;
  • 同一台机器同一批进程反复挂 D,基本可以判定存储侧有问题,按「链路—盘—负载」顺序查;
  • 虚拟机/云主机上的 hung task 还可能是宿主资源争抢的投影,先确认物理层再动应用。

生产服务器的日志判读与存储链路排查,需要帮企业做同类诊断可以联系我们。


企业存储选型参考|贵州诚鑫致达科技

企业数据存储与备份,可参考群晖在售机型:DS425+(4 盘位起步)· RS2423+(12 盘位机架式进阶)。企业存储规划与后续运维,搜「诚鑫致达」能找到我们。