智能体进阶之四:生产级智能体:观测、评估、审批与恢复
demo 里跑起来,不等于生产里跑得住。
生产级智能体的核心,不是多聪明,而是出问题时你能不能看见、管住、救回来。
先给结论
生产级 agent 至少要补上四层:
- 观测
- 评估
- 审批
- 恢复
如果少其中任何一层,系统都很难长期稳定。
观测:先让系统可见
你至少要知道:
- 模型什么时候被调用
- 调了哪些工具
- 参数是什么
- 哪一步失败了
- 整条链路耗时多少
OpenAI 现在的 Agents 相关文档已经把 tracing 放得很前。
这很合理,因为对 agent 来说,日志不是附属品,而是基本生存条件。
没有 trace,你很难判断到底是:
- prompt 问题
- 工具问题
- handoff 问题
- 状态问题
- 审批问题
评估:别只看“成功案例”
生产里的 agent 不能只看“完成了多少次”,还要看:
- 完成方式是否合理
- 工具调用是否必要
- 有没有走弯路
- 是否越权
- 是否在失败时做了正确降级
也就是说,对 agent 的评估,不只是看结果,还要看过程。
审批:高风险动作必须显式卡住
对 agent 来说,审批点尤其重要,因为它可能比单次调用更自主。
最值得加审批的通常是:
- 对外发送
- 写系统
- 改配置
- 删除数据
- 执行高成本动作
不要指望一句 prompt 就能永远阻止越权。
真正稳的是把审批做成系统机制。
恢复:失败后怎么继续
生产级 agent 最大的差别之一,是它不能一失败就“重来吧”。
更成熟的恢复策略包括:
- 对单步失败做有限重试
- 对不可恢复错误做降级
- 对高风险错误直接停机
- 对需要人工介入的问题保存现场
保存现场很重要。
因为一旦没有状态快照、没有 trace、没有工具结果记录,你连复盘都困难。
一个很好用的生产级判断标准
你可以问自己:
- 它出错时我能不能知道错在哪一层
- 它越权时我能不能拦下
- 它失败后我能不能从中间恢复
- 它变差时我能不能通过评估发现
如果四个问题里有两个答不上来,它就还不算生产级。
一句带走
生产级智能体的关键,不是让它更会做事,而是让它在做错、做慢、做偏时依然可见、可控、可恢复。