标准答案

  1. 面向请求的服务可先看 RED:请求量是否异常、错误是否上升、延迟分位数是否恶化。
  2. 面向资源的组件可先看 USE:CPU、内存、磁盘、连接和队列的利用率、饱和度与错误。
  3. 黄金指标通常把延迟、流量、错误、饱和度作为核心入口,再按业务补充成功率、积压和成本等指标。
  4. 每张图都应能回答一个问题并对应下一步动作,例如“延迟升高来自哪层”“是否需要限流或扩容”。

题目解析

框架不是固定模板。消息系统除了吞吐和错误,还要看消费延迟;数据库除了 CPU,还要看锁等待和慢查询。关键是用同一逻辑建立服务画像。

仪表盘如果只供展示而没有阈值、对比基线或诊断链路,就会在故障时变成信息噪音。

常见误区

  • 把平均值当成主要体验指标,忽略尾延迟。
  • 只监控机器资源,不监控业务成功率。
  • 采集大量图表却没有告警规则和排查入口。

作者信息