标准答案

  1. 先用指标判断影响范围、时间和资源趋势,再用 Pod/Node events 定位调度、挂载、探针和驱逐动作。
  2. 应用日志需要包含 Pod、版本、请求和 Trace 关联字段,平台日志要保留容器重启和终止原因。
  3. events 有保留和聚合限制,不能替代长期审计和告警;关键状态要进入稳定的观测系统。
  4. 排障结论应能解释业务错误率、延迟、资源、对象状态和发布时间线的对应关系。

题目解析

指标适合回答影响范围、趋势和资源变化,日志解释应用内部动作,events 说明调度器、kubelet、控制器和挂载等对象动作。三者必须用 Pod UID、节点、版本、请求 ID 和时间窗口关联,否则容易把相关现象误当因果。

events 会被聚合、过期或受保留策略限制,不能替代长期审计和告警。故障排查应先用业务错误率/P99确定窗口,再看对象 events、容器日志、节点指标和控制器日志,最后验证修复后业务、资源和对象状态是否一起恢复。

常见误区

  • 误区:只看应用日志。改正:同时对照指标、Pod/Node events、控制器和运行时日志。
  • 误区:把 events 当永久审计日志。改正:把关键状态和审计事件送入稳定的观测与审计系统。

作者信息