光屿云霞科技
技术AI使用2026-05-27·1 分钟阅读

AI使用进阶之五:Guardrails 与人工审批:哪些事必须卡权限、卡规则、卡人

让 AI 更有用,不等于让 AI 什么都能做。把自动校验、越权拦截和人工审批接起来,才是真正的可控。

AI使用

AI使用进阶之五:Guardrails 与人工审批:哪些事必须卡权限、卡规则、卡人

聪明,不等于被允许。
真正可控的 AI,不是能做尽可能多的事,而是知道哪些事不能自动做。

先给结论

掌控 AI 使用,最容易被忽视的一步,就是边界。

你至少要回答这几个问题:

  • 它能读什么
  • 它能写什么
  • 它能改什么
  • 它能替人做什么决定
  • 哪些动作必须先停下来给人看

如果这些边界没立起来,AI 越能干,风险越大。

Guardrails 到底是什么

可以把 Guardrails 理解成自动化护栏。
它的作用不是“让模型永远不出错”,而是:

  • 提前拦截明显不该处理的输入
  • 自动检查明显不该出现的输出
  • 在工具调用前后加校验
  • 在高风险动作前把流程停下来

它更像风控和校验层,不是魔法罩。

哪几层最该先做

1. 输入护栏

在模型开始工作前,先检查:

  • 是否有越权请求
  • 是否有注入指令
  • 是否包含敏感信息
  • 是否超出当前任务边界

尤其是 agent 场景下,要小心间接提示注入。
因为恶意指令不一定来自用户,也可能藏在网页、邮件、文档和工具返回结果里。

2. 输出护栏

模型生成完后,再检查:

  • 是否编造事实
  • 是否泄露敏感信息
  • 是否超出允许表达范围
  • 是否满足格式要求

很多时候不一定要“一票否决”,也可以:

  • 退回重写
  • 降级输出
  • 转人工审核

3. 工具护栏

这层最关键。
因为一旦模型可以调用真实工具,风险就不再只是“说错”,而是“做错”。

最常见的控制方式包括:

  • 参数校验
  • 只读和可写权限分离
  • 白名单资源范围
  • 速率限制
  • 幂等检查

4. 人工审批

有些动作,不该让模型自己决定放行。

例如:

  • 发邮件
  • 改数据库
  • 下单付款
  • 改服务器配置
  • 删除文件
  • 执行外部系统写操作

这时最稳的策略不是“增强提示词”,而是直接把流程停下来,请人批准。

一条很好用的判断线

你可以用这个问题来判断是否要人审:

这一步如果做错,是否会对钱、数据、权限、外部沟通或生产环境造成真实影响?

如果答案是会,那就默认加审批点。

为什么工程师特别容易在这里翻车

因为很多人看到 AI 能调用工具,会本能地想把链路打通。
但“能打通”和“该不该自动打通”是两回事。

工程上更稳的节奏应该是:

  1. 先只读
  2. 再半自动
  3. 再局部自动
  4. 高风险动作长期保留人工审批

这不是保守,这是成熟。

和治理框架怎么对上

如果你后面要把系统做成团队资产,就不能只停在“我自己觉得稳”。

NIST AI RMF 和它的 GenAI Profile 很值得当底层参考框架,因为它们会逼你系统地想这些问题:

  • 风险是谁负责
  • 什么叫可接受风险
  • 哪些环节需要留痕
  • 哪些环节需要持续监控
  • 发生问题后怎么回溯

你不一定要一上来就做成合规体系,但这些问题越早想,后面越不容易返工。

一句带走

Guardrails 负责自动校验,人审负责高风险决策。
会用 AI 的人很多,但会给 AI 正确立边界的人,才是真的在掌控它。

继续深入

系列导航
AI使用进阶
5 / 8
返回总索引

评论功能需要配置 Giscus 环境变量

请访问 giscus.app 获取配置信息