
恢复评测前的控制措施
英国 AI Security Institute 在 10 月 1 日的更新中表示,现已能够恢复多数评测。此前,该机构在 8 月报告一起事故后,暂停了风险最高的网络安全评测。智能体网络安全测试现采用两层出站网络阻断、同步行动监控及运行前检查。开发者并非总会提供思维链访问权限,因此 AISI 另建了仅观察行动的监控器,并预计其效果较弱。集中式沙箱管理和统一日志系统仍在开发中。
审计需要检查什么
我们的编辑建议是,为每次评测保留网络策略、监控器版本、运行前检查结果和干预日志。仅凭基础设施说明,无法判断某次运行实际启用了哪些控制措施。
AISI 提醒,这些措施只能降低风险,无法消除风险。限制联网也使真实能力测试更为困难。检查报告的实验条件时,可结合 METR 的监控研究笔记和本站的评测报告阅读指南。
关注 Audit Commons
在您的阅读器中及时获取最新报道、实践指南与精选资源。