AI使用进阶之五:Guardrails 与人工审批:哪些事必须卡权限、卡规则、卡人
聪明,不等于被允许。
真正可控的 AI,不是能做尽可能多的事,而是知道哪些事不能自动做。
先给结论
掌控 AI 使用,最容易被忽视的一步,就是边界。
你至少要回答这几个问题:
- 它能读什么
- 它能写什么
- 它能改什么
- 它能替人做什么决定
- 哪些动作必须先停下来给人看
如果这些边界没立起来,AI 越能干,风险越大。
Guardrails 到底是什么
可以把 Guardrails 理解成自动化护栏。
它的作用不是“让模型永远不出错”,而是:
- 提前拦截明显不该处理的输入
- 自动检查明显不该出现的输出
- 在工具调用前后加校验
- 在高风险动作前把流程停下来
它更像风控和校验层,不是魔法罩。
哪几层最该先做
1. 输入护栏
在模型开始工作前,先检查:
- 是否有越权请求
- 是否有注入指令
- 是否包含敏感信息
- 是否超出当前任务边界
尤其是 agent 场景下,要小心间接提示注入。
因为恶意指令不一定来自用户,也可能藏在网页、邮件、文档和工具返回结果里。
2. 输出护栏
模型生成完后,再检查:
- 是否编造事实
- 是否泄露敏感信息
- 是否超出允许表达范围
- 是否满足格式要求
很多时候不一定要“一票否决”,也可以:
- 退回重写
- 降级输出
- 转人工审核
3. 工具护栏
这层最关键。
因为一旦模型可以调用真实工具,风险就不再只是“说错”,而是“做错”。
最常见的控制方式包括:
- 参数校验
- 只读和可写权限分离
- 白名单资源范围
- 速率限制
- 幂等检查
4. 人工审批
有些动作,不该让模型自己决定放行。
例如:
- 发邮件
- 改数据库
- 下单付款
- 改服务器配置
- 删除文件
- 执行外部系统写操作
这时最稳的策略不是“增强提示词”,而是直接把流程停下来,请人批准。
一条很好用的判断线
你可以用这个问题来判断是否要人审:
这一步如果做错,是否会对钱、数据、权限、外部沟通或生产环境造成真实影响?
如果答案是会,那就默认加审批点。
为什么工程师特别容易在这里翻车
因为很多人看到 AI 能调用工具,会本能地想把链路打通。
但“能打通”和“该不该自动打通”是两回事。
工程上更稳的节奏应该是:
- 先只读
- 再半自动
- 再局部自动
- 高风险动作长期保留人工审批
这不是保守,这是成熟。
和治理框架怎么对上
如果你后面要把系统做成团队资产,就不能只停在“我自己觉得稳”。
NIST AI RMF 和它的 GenAI Profile 很值得当底层参考框架,因为它们会逼你系统地想这些问题:
- 风险是谁负责
- 什么叫可接受风险
- 哪些环节需要留痕
- 哪些环节需要持续监控
- 发生问题后怎么回溯
你不一定要一上来就做成合规体系,但这些问题越早想,后面越不容易返工。
一句带走
Guardrails 负责自动校验,人审负责高风险决策。
会用 AI 的人很多,但会给 AI 正确立边界的人,才是真的在掌控它。