AI使用进阶之四:评估体系:不用感觉判断 AI,要靠样例和回归
AI 最危险的幻觉之一,不是模型在编,而是人以为它已经稳定了。
不做评估,你优化的往往不是质量,而是自己的错觉。
先给结论
AI 系统和传统功能最大的不同之一,是它会波动。
同一个任务、同一个模型、同一类输入,都可能出现不同表现。
所以判断 AI 质量,不能只靠:
- 自己试两次
- 同事说“好像还行”
- demo 看起来挺顺
真正稳的做法,是尽早建立评估体系。
什么叫评估
最朴素的说法就是:
- 给 AI 一个输入
- 定义你心里的“好结果”或“合格标准”
- 用规则、人审或模型打分,判断它到底好不好
评估不是炫技,它是防回退、防漂移、防自我欺骗的基本盘。
为什么很多团队越改越乱
因为他们没有回归集。
今天改 prompt,好了一点。
明天换模型,又好了两项。
后天加工具调用,结果之前能过的场景突然挂了。
如果没有一套稳定 case 去回放,你永远不知道:
- 这次改动到底提升了什么
- 这次改动又弄坏了什么
最少要有哪几类评估样例
1. 基础样例
最常见、最标准、最希望 AI 做对的场景。
2. 边界样例
资料不足、问题模糊、输入脏、歧义强的场景。
3. 反例样例
最容易诱发幻觉、误判、越权或乱答的输入。
4. 回归样例
曾经出过事故、翻过车、被用户投诉过的问题。
这些最值得永久留在测试集中。
评估不是只能打一个分
很多团队一上来就想找“总分”,但实战里更有价值的是分维度看:
- 准确不准确
- 格式稳不稳
- 有没有越权
- 有没有编造
- 有没有答非所问
- 工具调用是否合适
当你拆成维度,问题才容易定位。
最容易上手的一种评估方式
先别追求复杂平台,先从一个小表开始:
- 输入
- 期望结果
- 实际结果
- 是否通过
- 失败原因
只要能持续积累几十条高质量样例,你的掌控力就已经会比大多数人强很多。
日志,就是最真实的评估数据源
OpenAI 官方在评估最佳实践里反复强调:
开发阶段就要尽量记录日志,因为日志会反过来变成最好的评估样例来源。
这特别重要。
因为真正有价值的 case,往往不是你凭空想出来的,而是线上真实翻过车的。
关于平台和方法,要分开看
截至 2026-06-10,OpenAI 文档明确写明:
- Evals 平台会在
2026-10-31变为只读 - 并计划在
2026-11-30关闭
这件事反而提醒我们一件更重要的事:
不要把“评估能力”绑定在某一个平台按钮上,而要把它沉淀成方法论。
真正值钱的是:
- 你的 case 集
- 你的评分标准
- 你的回归流程
- 你的人工校准机制
这些不会因为某个平台下线就消失。
一句带走
没有评估,AI 优化就是碰运气。
有了评估,你才知道这次改动到底是在变好,还是只是在换一种方式出错。