AInews / 009

89% 与 13.6% 的拦截率差距:为什么真正的 Agent 自主性不是取消审批,而是重构控制面

· AI智能体 权限控制 沙箱安全 控制面重构

2026 年 8 月 Anthropic 将 Claude Code 默认权限切换为 Auto Mode,拦截率对比显示分类器达 89% 而人类仅 13.6%。频繁确认制造了虚假的橡皮图章,真正的 Agent 自主性不是取消审批,而是将人工摩擦从每个底层动作迁移到沙箱基线、不可逆升级闸门与终态验收门禁的三层控制面上。

2026 年 8 月 14 日,Anthropic 正式将 Claude Code 的默认权限模式切换为 Auto Mode。这意味着系统不再在每次敏感工具调用时弹出确认框,而是转由后台分类器动态拦截高危动作。支持这项决策的数据对比非常悬殊:在控制实验中,分类器对破坏性指令的拦截率达到了 89%,而人类开发者面对频繁弹窗时的实际拦截率只有 13.6%。

这个数据直接击碎了一个长期以来的安全假设:让开发者在终端前逐条点击确认,能够守住系统的底线。现实情况恰恰相反。

频繁确认如何让人类退化为“橡皮图章”

在传统的命令行 Agent 交互中,安全防线通常建立在“动作级确认”上。Agent 每读取一个目录、执行一条搜索、修改一行代码或运行一次测试,终端都会暂停并请求用户输入 y

这种设计的初衷是把每一次系统状态变更置于人类监督之下。但当一个复杂的开发任务包含数十次乃至上百次工具调用时,这种机制迅速演变成了认知灾难。面对连续十几次回车请求,人类的注意力带宽会在几分钟内耗尽。开发者不再逐行审查命令中的参数与路径,而是形成肌肉记忆,机械地一路回车放行。

当拦截率从理论上的 100% 暴跌至实测的 13.6% 时,所谓的“人工把关”已经退化为形式主义的橡皮图章。更普遍的后果是,为了不让长任务频繁中断,大量开发者选择直接开启 --dangerously-skip-permissions 参数,也就是所谓的 YOLO 模式。

在全量确认与一键全开之间,开发者实际上陷入了非黑即白的伪二选一:要么承受割裂的工作流和假安全,要么彻底放弃防御让 Agent 裸奔。

分类器不是策略:概率模型防不住意图破坏

Auto Mode 引入的 LLM 分类器将生产会话中的严重损害率从 6.3% 降至 2.4%,证明了将机器擅长的高频模式识别从人类肩上卸下的有效性。但必须明确的是:分类器是一个过滤器,而不是形式化的安全策略。

LLM 分类器本质上仍是概率模型。它在识别典型的恶意行为(如删除根目录、提取凭证文件)时表现优异,但在面对复杂的业务逻辑破坏、微妙的提示词注入以及隐蔽的越权范围漂移时,依然存在失效窗口。如果一个团队把整个系统的安全性完全押注在分类器的单点击穿上,这只是用一种新型的技术幻觉替换了旧的人工幻觉。

真正的工程防御必须下沉到操作系统底层。在工程实践中,内核级的沙箱隔离是不可替代的基石。无论是 macOS 的 Seatbelt 机制,还是 Linux 下基于 Bubblewrap 与命名空间隔离 的运行时,它们的作用是在物理层面切断未授权的敏感路径(如 ~/.ssh~/.aws~/.gnupg.env),并限制出站网络流量。

沙箱划定的是“物理上做不到”的硬边界,分类器提供的是“语义上不合理”的动态拦截。只有二者结合,才能构成免于人工介入的日常执行底座。

审批控制面的三层重构范式

如果逐动作确认不可行,彻底放任不可取,孤立的分类器又不够完备,那么 Agent 的权限与审批到底应当落在哪里?

答案不是取消审批,而是将人工摩擦从底层的“原子动作”迁移到更高维度的“控制平面”。一个成熟的 Agent 编排系统应当建立三层分级的审批与治理体系:

第一层:沙箱内的确定性例行执行(零打扰自动放行)

对于工作区内的文件检索、代码读取、普通文件编辑、依赖安装、单测运行等可逆操作,全部置于受限沙箱中运行。

在这一层,系统应当完全免除人工审批。只要操作局限在既定的工作目录内,且没有触碰敏感路径与外部网络,Agent 应当享有完整的自主推进权利。每一次无意义的确认提示,都是在消耗人类宝贵的判断带宽。

第二层:范围变更与不可逆动作升级(强制人工闸门)

当 Agent 的行为跨越了预设的受控边界时,系统必须暂停并强制触发人工升级审批。这包括四类典型场景:

  1. 不可逆破坏:批量删除文件、覆盖版本历史、重置未提交的工作区;
  2. 外部状态改变:代码推送(git push)、对外发送网络请求、发布线上服务;
  3. 资金与权限扩散:调用按量付费 API、修改全局环境配置、请求访问系统私钥;
  4. 任务范围漂移:执行过程中修改了任务目标,或者试图触碰初始授权之外的代码仓库与目录。

在这个层面上,系统向人类提出的不是“是否允许运行这条 bash”,而是清晰的业务决策上下文:“当前任务试图执行不可逆操作 / 改变对外状态,影响范围是什么,为什么需要执行”。

第三层:基于目标证据的终态验收(结果门禁代替过程汇报)

当任务结束时,人类的审查精力应当全部聚焦在最终交付物上,而不是翻看几百行过程日志。

传统的汇报往往充斥着“已执行步骤 A、已调用工具 B”的过程性叙述。但在工程交付中,过程成功不代表目标达成。终态验收必须绑定客观的同类型证据:代码改动是否通过了既有的回归测试?新建的接口是否能够发出真实的 HTTP 请求并返回预期结构?UI 修改是否有移动端和桌面端的渲染截图?

只有当客观证据链完整闭环时,任务才算真正完成。

重新理解 Agent 自主性

过去人们常有一种误解,以为自主性就是让 AI 拥有无限的系统权限,跑得越久、问得越少就越高级。

但 89% 与 13.6% 的数据对照表明:没有结构化约束的自由只会导致两种极端,要么是人类疲惫不堪后的全面失守,要么是系统失控带来的不可逆灾难。

真正的自主性从来不是免除监督,而是职责的重新定位。正如优秀的团队管理不是盯紧员工的每一次键盘敲击,而是对齐目标、划定授权红线、并在关键里程碑上核验成果。

把琐碎的操作交给沙箱与算法,把关键的边界、例外与验收标准留给人类。这才是 AI Agent 能够被真正托付进核心工程体系的唯一路径。