展示评估结果和各个样本的 Inspect 日志查看器
Inspect 日志查看器,如项目文档所示。仅为界面示例,并非 Audit Commons 产生的结果。 Inspect contributors · MIT

把握报告的基本结构

大多数智能体评估报告都包含相同的结构要素:评估了什么、评估如何开展以及汇总结果。批判性阅读意味着检查这些要素是否存在、是否充分,以及结论是否合乎逻辑地源于证据。本指南梳理了五个关键问题,随后将其应用于一个虚构的示例——该示例不代表任何真实的评估或测得结果。

需要提出的五个问题

1. 使用了哪些任务?其描述是否足够详细以评估相关性?

基准测试任务的描述应当足够精确,以便读者能够判断它们是否与实际部署场景相似。如果一份报告仅将任务描述为“智能体推理问题”,而没有指明工具环境、行动空间或成功判定标准,那么该基准测试对任何特定应用是否具有参考价值就存疑。应当查阅任务描述、智能体能够访问的工具,以及何为正确或安全的结果。

2. 使用了怎样的算力预算?是否测试了对该预算的敏感度?

智能体的得分可能严重依赖所分配的 Token 预算或推理期算力(参见 AISI,2026年7月)。如果一份报告仅提供单一得分而不披露算力预算,或者不说明得分在不同预算下是否发生变化,那么它所提供的信息就是不完整的。

3. 进行了多少轮试验?得分的不确定性是如何量化的?

在相同测试设计下来自可比独立试验的更大样本量,通常能支持更稳定的估计;但如果样本之间存在相关性或偏差,试验次数的增加并不会自动提高证据质量。应当查阅样本量、置信区间或可信区间,以及关于多次运行之间方差的讨论。仅呈现点估计而不给出不确定性边界的报告,会使人难以判断得分的稳定性。

4. 观察到了哪些失败模式?罕见事件是如何处理的?

与安全相关的失败可能很少发生。即使试验集中出现了一些失败案例,罕见失败依然难以精确估计。应当探究报告是否讨论了具体的失败类别,以及是否对观察到的任何失败进行了深入调查或缓解改进。

5. 报告提出了哪些结论主张?这些主张是否合乎逻辑地源于证据?

应将结论部分与方法部分结合起来阅读。如果一份报告断言某模型“适合部署”或“通过了安全评估”,应当检查证据是否确实支持该结论,抑或证据仅支持关于在特定条件下特定任务性能的较窄主张。这两种主张截然不同。

虚构实例分析

以下场景、模型名称、得分及数据完全出于说明目的虚构。

假设您收到一份一页纸的摘要,内容如下:

“模型 X 在 TravelDesk 基准测试上接受了评估,该基准包含 50 项需要网络搜索和日程管理的任务。每项任务运行一次。模型 X 取得了 78% 的任务完成率。评估团队得出结论:模型 X 适合部署于面向客户的日程安排应用中。”

应用上述五个问题进行分析:

  1. 任务描述:虽然描述了“网络搜索和日程管理”,但缺乏关于工具环境、行动空间或是否测试了对抗性输入的信息。日程安排应用会接收不受信任的用户输入;该基准可能并未反映这一点。
  2. 算力预算:未提及。尚不明确该 78% 的数据在不同的推理配置下是否依然成立。
  3. 试验与不确定性:摘要说明 50 项任务各运行一次,得出了 50 个观察结果;但并未确立它们之间的独立性。未提供置信区间。得分可能随任务样本的不同而波动,且由于每项任务缺乏重复试验,因而没有任务内方差估计。
  4. 失败模式:未对 22% 的未完成率进行特征分析。这些失败是良性的(模型拒绝执行)还是有害的(模型尝试了错误的操作)?摘要未予说明。
  5. 主张范围:模型 X“适合部署”的结论超出了证据所能证明的范畴。现有证据仅表明在未指明算力配置的情况下,在 50 项基准任务上取得了 78% 的任务完成率,且未对失败情况进行任何特征归因。

基于相同证据得出的更为审慎的结论应当是:“模型 X 在 TravelDesk 基准测试中完成了 78% 的任务(共 50 项任务,每项运行一次试验,未指明算力预算)。在部署之前,应进一步评估以明确其余 22% 失败的特征,跨不同算力配置进行测试,并评估其在对抗性或分布外输入下的行为表现。”

延伸阅读