
基准得分与安全性论证之间的鸿沟
当一个团队发布智能体评估结果时,在能力基准上的高分或在安全相关基准上的低分,往往会引出证据可能并未充分支持的结论。理解这一鸿沟,对于任何需要判断评估证据是否足以支持部署或审计主张的人而言都至关重要。
评估得分是在特定条件下针对一组试验得出的汇总统计数据。而安全性论证则是一项明确主张,即系统符合指定的风险阈值,并且在明确定义的条件下适合部署。这两者并非同一种主张,基准得分绝非通用的安全评级。区分二者至少有三个原因。
第一,基准测试任务不等于实际部署条件。基准设计者对纳入哪些任务、如何措辞提示词以及何为成功制定了深思熟虑的选择。得分所反映的是模型在这些特定选择下的行为,而非部署后的智能体将面临的开放式输入分布。
第二,即使在试验集中出现了一些失败案例,罕见失败依然难以精确估计。AISI 关于 最优停止 的研究探讨了罕见成功的相关问题:过早停止可能会遗漏某种能力的证据。对于安全评估而言,在解读有限的试验集时,罕见失败同样需要类似的审慎态度。这一类比并不能证明 optstop 的防护机制可以直接验证安全主张。
第三,智能体评估得分对算力预算高度敏感。在2026年7月的一项分析中, AISI 研究人员改变了 Token 预算, 发现测得的能力随预算而变化,在某些基准上趋于平缓,而在其他基准上则持续上升。他们的分析认为,解读智能体的能力得分时,必须结合测量时所使用的算力预算一同考量。
得分取决于算力预算
预算依赖性对安全性论证至关重要,因为部署决策隐含着一个前提,即评估中所使用的算力配置代表了实际部署条件。如果部署的系统在不同的算力约束下运行,或者使用了不同的推理策略,基准得分可能无法直接迁移。
负责任的评估报告应当披露所使用的算力预算,在经过测试的情况下说明得分敏感度,并避免将结果外推至评估条件之外。当报告缺乏这些披露时,读者便无法评估该得分在多大程度上反映的是模型内在行为,还是测量条件所致。
评估能证明什么与不能证明什么
评估是 AI 系统研发证据体系中严谨且有价值的组成部分。关键在于评估证据能支持哪些结论,以及安全性论证还需要哪些额外证据。
评估证据能够支持:
- 关于模型在特定条件下针对特定任务性能的主张。
- 在评估设计保持一致的前提下,不同模型或配置之间的对比。
- 识别基准测试中暴露的失败模式,从而推动改进措施。
单独的评估证据不能支持:
- 在缺乏关于部署条件及其与评估设计关联性的额外证据的情况下,断言系统达到了指定的部署风险阈值。
- 仅仅依据有限试验集中未出现某种失败模式,就断言该失败模式不存在。
- 关于未经测试的算力配置下行为的主张。
对智能体部署的审计应当明确区分评估证据已经确立了什么,以及支持在指定条件下的适用性主张还需要哪些额外证据。若将基准得分直接当作安全性论证的替代指标而不审视其鸿沟,就会使基准测试与实际部署环境之间的联系缺乏检验。
本专题中的分析反映了基于上述引述的 AISI 研究的编辑解读,不构成正式标准或监管指导。
关注 Audit Commons
在您的阅读器中及时获取最新报道、实践指南与精选资源。