
九月份关于前沿 AI 发展节奏的一场公开讨论引发了有关评估机构准入与问责的疑问。我们将高管公开声明与已有据可查的实验室行动区分开来。
阅读全文 →Audit Commons 刊发的全部内容,按最新发布时间排序。

九月份关于前沿 AI 发展节奏的一场公开讨论引发了有关评估机构准入与问责的疑问。我们将高管公开声明与已有据可查的实验室行动区分开来。
阅读全文 →Anthropic 报告了一项为期八周的由 METR 主导的评估事件初步调查。其调查范围与后来提出的常设评估机构准入机制有所不同。
阅读全文 →
OpenAI 报告了八月份为期两周的强化学习(RL)暂停及更严格的研究保障措施。该公告所针对的是特定工作负载,而非全面中止所有研究。
阅读全文 →





CatchBench 0.1.2 解决了打包问题,能够清晰提示缺失的可选代码检出,并保持已发布的评测得分不变。
CatchBench 由 Yue Zhao 维护,他同时也是 Audit Commons 的维护者。
阅读全文 →