记录一次分析[服务器SSD报故障随后自行恢复正常现象]

Labib Lv4

日常巡检时发现带外出现INTEL SSD故障告警,随后又自行恢复,间隔约30分钟,无人工介入。

smartctl -a /dev/sda

故障原因推测排障思路
硬盘背板接触问题检查smartctl中ID 199 UltraDMA CRC Error Count的值,是否存在CRC校验错误
NAND闪存寿命是否不足检查smartctl中ID 233 Media Wearout Indicator的值
是否存在坏扇区检查smartctl中ID 5 Reallocated sector ct的值
硬盘备用空间是否不足检查smartctl中ID 232 Available Reservd space的值

实例:

1
2
3
Media Wearout Indicator: 当前值0 临界值100 - 健康
Reallocated Sector Count: 当前值0 临界值75 - 健康
Available Reservd Spare: 当前值0 临界值100 - 健康
  • 标题: 记录一次分析[服务器SSD报故障随后自行恢复正常现象]
  • 作者: Labib
  • 创建于 : 2025-09-09 17:36:21
  • 更新于 : 2026-09-23 21:04:04
  • 链接: https://hackerbs.com/posts/cbb0c1a2.html
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
评论
目录
记录一次分析[服务器SSD报故障随后自行恢复正常现象]