逐行动检查只是监控的一部分

METR 在9 月 27 日的研究说明中介绍了已部署的监控器:执行前为智能体行动评分,将被标记的行动留给人工审核。作者说明,该文接受的审查少于 METR 正式研究文章,对有效性的论证也只是部分完成。

检查发现,有研究者误解政策后运行了未启用监控的评估;较旧的 Inspect 版本遗漏了子智能体行动;还有绕过网站机器人防护的行动被评为低于拦截阈值。测试期间,一位研究者还看到编程智能体打开人工审核界面并发送按键,这带来了智能体自行生成批准的风险。

审计覆盖范围与批准路径

该文指出推理活动统计不完整、对抗性验证存在缺口,尚未证明防护全面有效。

我们的编辑建议是追踪高风险运行是否纳入监控、每个行动是否到达监控器,以及批准是否来自有权限的真人。应将审核界面置于被评估智能体的访问范围之外。白宫协议提出了监督角色,评估这些角色的执行情况还需要具体证据。