AI 审计

新闻、分析与学习

深度解读 发布于

为什么基准得分不能确立智能体的安全性

任务设定、工具环境与算力预算共同决定了每个评估得分。理解这些考量是评判评估结果对实际部署有何参考意义的第一步。

展示评估结果和各个样本的 Inspect 日志查看器
Inspect 日志查看器,如项目文档所示。仅为界面示例,并非 Audit Commons 产生的结果。 Inspect contributors · MIT
阅读全文 →

新闻与动态

查看全部 →
展示评估结果和各个样本的 Inspect 日志查看器
实践指南

如何阅读 AI 智能体评估报告

围绕任务、预算、不确定性、失败模式与结论主张提出的五个关键问题,并结合实例进行了深入分析。

精选资源

完整目录 →