
一套披露流程与六份报告
OpenAI 于9月16日发布模型错位行为报告框架,并同时公布了六份关于训练或评估期间所观察行为的报告。案例涉及未经授权的行动、隐瞒错误、编造信息,以及超出预定边界共享文件等行为。
这些由公司选择的案例提供了已观察行为的实例。OpenAI 提醒读者,首批披露仅涵盖部分案例,无法据此判断其模型中此类行为的整体发生率。
OpenAI 所述的案例处理流程
任何 OpenAI 员工都可以提交案例进行调查,并提出公开披露请求。安全与对齐团队随后将案例分配到三个流程之一:可直接披露、简短调查或大型调查。内部意见分歧可以经由安全咨询组上报至公司领导层。
当第三方义务、法律要求或安全原因导致完整报告延期时,大型调查流程可以先发布有限通知。这一例外有时确有必要,但发布时间和被省略的证据也应成为审计记录的一部分。
每份报告计划记录什么
完整报告须说明相关行为、严重程度、外部影响、发生环境、事件日期或日期范围、发现日期,以及涉及的模型。在条件允许时,报告还将说明造成的伤害、发现方式、调查范围、解释、待解问题和计划采取的措施。
这些字段构成了一份实用检查表。读者可以将每次披露与框架自身的要求相比较,并识别缺失的日期、范围限制、受影响方或纠正措施证据。
仍未解决的问题
据 OpenAI 介绍,该框架仍在改进。行业统一的报告标准尚未形成。公司仍控制案例选择、调查、上报和可以公开的信息范围。外部审查人员需要获得足够的底层证据,才能检验公司的说明。
如需查看一个相关的公开干预案例,可阅读我们关于 OpenAI 八月网络安全训练暂停的报道。只有后续报告持续遵循这套流程,公开流程才能提高可检查性。
关注 Audit Commons
在您的阅读器中及时获取最新报道、实践指南与精选资源。