AI 应用的日志比传统应用更关键
传统应用出错有堆栈可以查,AI 应用的「错」是内容层面的:回答了错误信息、格式不对、越权、幻觉。不记录完整上下文,就无法定位。
每条 AI 请求都应该记录:输入、检索到的知识片段、提示词版本、模型版本、输出、耗时、成本和用户反馈。
指标分三层
基础设施层:延迟、成功率、token 用量、成本。质量层:完成率、重试率、转人工率、抽检合格率。业务层:任务完成数、用户留存、业务结果变化。
只有基础设施层没有质量层,等于只知道车没坏,不知道开没开对方向。
- 基础设施:延迟、错误率、token、成本
- 质量:完成率、重试、转人工、合格率
- 业务:留存、转化、可量化的业务收益
样本回放是调试利器
给每条会话一个唯一 ID,遇到问题可以直接回放完整交互:用户说了什么、检索了什么、模型怎么答、用户怎么反应。
这比看聚合指标更能帮助团队理解真实问题。
把异常做成主动告警
转人工率突然上升、同一问题反复重试、成本异常增长,都应该触发告警。
AI 应用的可观测性,最终是为了让每次改动都有据可依。
第一次告警演练
上线前做一次故障演练:模拟模型超时、检索服务不可用、回答质量骤降,确认团队能否在 30 分钟内定位问题。
告警不在多,而在每一条都能触发正确的动作。演练过一遍,团队才知道监控面板上的数字意味着什么。
从日志到复盘
每次线上质量问题,都做一次简短复盘:现象是什么、定位用了多久、根因在哪、如何防止再犯。复盘记录比告警规则更有长期价值。
复盘不追责,只问系统:日志够不够、告警准不准、流程要不要改。团队敢复盘,可观测性建设才会持续投入。
三个月后回头看,最有价值的往往不是某个指标,而是那几十条复盘里沉淀的检查清单。
可观测的预算
可观测性也要有预算:日志保留多久、指标存储多少天、追踪采样率多高,都提前定好,避免账单失控。
对高价值请求做全量追踪,对普通请求做采样,可以在成本和可观测性之间取得平衡。
可观测性的目标不是记录一切,而是能回答「出问题时我们找得到答案」。