隔离的评估服务器、两道网络屏障、工具操作检查和运行前检查清单的插图
AI 生成的编辑插图,表现 AISI 所述的分层网络阻断、工具操作监控和运行前检查。画面为概念示意,并非真实基础设施,也不衡量控制措施的效果。 Audit Commons (AI-generated editorial illustration) · Original AI-generated editorial illustration; reuse license pending

恢复评测前的控制措施

英国 AI Security Institute 在 10 月 1 日的更新中表示,现已能够恢复多数评测。此前,该机构在 8 月报告一起事故后,暂停了风险最高的网络安全评测。智能体网络安全测试现采用两层出站网络阻断、同步行动监控及运行前检查。开发者并非总会提供思维链访问权限,因此 AISI 另建了仅观察行动的监控器,并预计其效果较弱。集中式沙箱管理和统一日志系统仍在开发中。

审计需要检查什么

我们的编辑建议是,为每次评测保留网络策略、监控器版本、运行前检查结果和干预日志。仅凭基础设施说明,无法判断某次运行实际启用了哪些控制措施。

AISI 提醒,这些措施只能降低风险,无法消除风险。限制联网也使真实能力测试更为困难。检查报告的实验条件时,可结合 METR 的监控研究笔记和本站的评测报告阅读指南。