Sam Altman(右)在2016年炉边谈话中发言
Sam Altman(右)出席2016年炉边谈话。历史资料照片。 Alexlcory / Wikimedia Commons · CC BY-SA 4.0

OpenAI 报告的内容

在其8月18日发布的公告中,OpenAI 描述了针对拟部署模型为期两周的强化学习暂停。其计划中规模最大的前沿 RL 训练继续暂停,而较小规模的运行和安全评估仍在进行。

该公司提到了 Hugging Face 事件,以及初步证据显示 Astra 可能会达到其网络安全“严重(Critical)”阈值。该公司描述了更严格的隔离和监控措施,设定的告警目标是在发现令人担忧的活动后 30 分钟内发出告警。对于疑似严重的边界越界行为,各团队需暂停该活动,除非能在 30 分钟内排除该警报。

如何解读该公告

这是一次针对特定工作负载的干预通报,而非宣布所有研究均已停止。我们的解读是:应将声明的范围、重启条件以及控制有效性的证据分开评估。书面规程并不等同于实测的检出率。

关于事件本身,请参阅 METR 于8月26日发布的调查报告,包括其声明的访问权限和范围局限性。