标准答案

  1. 缓存重点看命中率、回源率、命中延迟、内存使用、淘汰、热 Key、大 Key 和错误率。
  2. 消息重点看生产失败、消费成功率、最老消息年龄、分区积压、重平衡、重试和死信数量。
  3. 搜索重点看查询延迟、拒绝、线程池、分片健康、段合并、磁盘、堆内存和索引延迟。
  4. 指标要关联业务结果,例如缓存错误导致的数据库负载、消息积压导致的任务延迟和搜索陈旧时间。

题目解析

组件监控要从流量、延迟、错误、饱和和数据正确性五个方面建立信号。缓存命中率下降、消息积压或搜索分片健康并不一定立刻影响用户,但与回源、最老任务和陈旧时间结合才可行动。

指标要能关联到业务结果,例如缓存回源导致数据库连接耗尽,消息积压导致订单状态延迟,搜索索引落后导致结果陈旧。告警应说明影响范围和下一步排查层。

高维度定位要控制成本,但至少要按租户、主题、队列、索引和分区识别异常来源。平均延迟会隐藏长尾和局部热点,必须保留 P95/P99 和最老年龄。

常见误区

  • 误区:只监控进程存活。改正:增加容量、等待、错误、积压、陈旧和业务对账指标。
  • 误区:只看平均延迟。改正:关注 P95/P99、最老消息、回源率和局部热点,平均值不能代表用户长尾。
  • 误区:异常无法按租户、主题、索引或分区定位。改正:为关键维度保留可控的标签和关联 ID,避免只看到集群总量。

作者信息