标准答案

  1. 先收集发生时间、请求路径、地区、客户端版本、请求标识、状态码、耗时和重试情况,确认是全部流量还是特定实例、租户或依赖受影响。
  2. 502 通常表示网关从上游拿到无效响应或无法建立有效连接,504 通常表示网关等待上游超时,连接重置则更偏向传输层主动断开或中间设备中断。
  3. 检查 DNS 解析、证书、TLS 握手、负载均衡健康状态、网关超时、连接复用、实例重启、CPU/内存、线程池和应用错误日志。
  4. 继续检查数据库、缓存、第三方 API、连接池、限流和重试是否导致排队或级联超时;不要只看最外层网关日志。
  5. 对比发布版本、配置变更、流量峰值、单实例差异和网络路径,必要时做安全采样、抓包或探针验证,再形成可回滚的修复。

题目解析

间歇性故障最需要相关性证据。单条错误日志常不足以说明问题,按 trace、实例、版本、地区和依赖耗时聚合更容易发现模式。

重试可能让原始短暂网络问题演变成全链路过载,因此排查时要同时看错误率和请求放大倍数。

常见误区

  • 看到 502 或 504 就直接把网关超时调大。
  • 只检查服务端业务日志,不检查负载均衡、网络、连接池和下游依赖。
  • 为了排查打印完整请求和凭据,造成二次安全事故。

作者信息