CAISI 网络能力指数图中,GLM-5.3 与其他已发布模型的位置
CAISI 于 2026 年 9 月 17 日发布的已发布模型网络能力指数。结果受报告中的工具、安全防护和评估限制影响;Audit Commons 未制作该图。 CAISI/NIST · NIST public information

NIST 下属人工智能标准与创新中心(CAISI)于 9 月 17 日发布了 GLM-5.3 网络安全能力评估,比较了四个漏洞发现与漏洞利用开发基准上的表现。

把分数与评估设置一起读

CAISI 将模型作为可以调用工具的智能体运行,不同基准的轮次上限为 200 或 300。在适用情况下,评估关闭了美国模型的网络安全防护。基准表中的美国前沿水平采用各基准上的最高分,可能分别来自不同模型。

理解结果需要同时考虑这些条件:报告衡量的是所述评估设置下的能力。它无法说明采用不同防护、工具或预算的常规部署会如何表现。

哪些部分仍难以复现

四个基准中的 CAISI OSS-Fuzz 是私有基准。公开的方法说明允许读者检查实验设置,但完整的外部复现仍受限制。

我们的编辑建议是,比较总分之前先比较任务定义、工具权限、安全防护和运行预算。评估报告阅读指南提供了相应的检查清单。