
Anthropic 公布了什么
Anthropic 于9月18日宣布,Accenture 旗下专门从事 AI 业务的 Faculty 将担任嵌入式评估机构。公告所列范围包括模型评估、红队测试、对齐评估和保障措施测试。
双方均预计在未来五年内至少投入 10 亿美元建设相关能力。这是一项未来承诺;公告尚未给出已完成的评估结果,也不表示这些资金已经支出。
嵌入式访问可能带来什么变化
据 Anthropic 介绍,嵌入式评估人员将获得接近员工级别的访问权限。拟议职责包括在训练期间观察模型、跟踪有关开发与部署的决策,并直接与员工交流。
此类访问可能帮助评估人员在开发决策形成时就展开审查。真正有用的证据包括实际开放了哪些访问权限、评估人员可以追查哪些问题,以及哪些发现能够公开发布。
独立性仍需证据支持
Accenture 的工作将由 Anthropic 直接资助。该公司同时承认,业界尚未形成有关评估访问、报告和资金安排的统一标准。接近员工级别的访问是一项拟议安排。实际独立性仍需证据支持。
Amodei 的文章提出,评估机构应自主发布关键发现。Anthropic 将仅在安全、法律特权、商业敏感信息和第三方保密方面保留有限删节权。评估机构可公开说明哪些删节影响了结论。Accenture 公告未说明这些条款是否适用。
我们关心的审计问题包括:谁来界定范围、利益冲突如何处理,以及发现存在争议时,发布与访问权利能否得到落实。
它与此前承诺的关系
这项公告是对 Dario Amodei 九月文章中嵌入式评估承诺的一项具体后续行动。目前仍处于早期阶段,尚无公开的评估发现。
如需了解背景,可阅读我们关于前沿 AI 发展节奏讨论的报道,以及另一项由 METR 开展的事件审查。这些工作的访问条件和审查范围并不相同。
关注 Audit Commons
在您的阅读器中及时获取最新报道、实践指南与精选资源。