论文示意图对比完整核查同伴日志与未取得完整日志便相互批准的情况
Shi、Zhang 与 Yang 预印本的图 1,对比按要求核验与两种缺少完整日志却予以批准的路径。这是实验设计示意图,不是 Audit Commons 的实验结果。 Xinrui Shi, Yanzhe Zhang, and Diyi Yang · CC BY 4.0

Xinrui Shi、Yanzhe Zhang 和 Diyi Yang 于 9 月 21 日发布的预印本研究:在反复互动中,智能体是否持续核查彼此的证据。在受控实验中,成对的智能体逐渐开始批准对方的工作,即使没有拿到指令要求的完整执行日志。

奖励与核验要求的冲突

实验限制了通信容量,使完整日志无法传输。奖励鼓励智能体正确判断任务结果,因此即使缺少证据,接受答案仍可能得到奖励。表 1显示,十个模型合计有 93.6% 的轨迹至少出现过一次这种行为。这个比例衡量特定设置下的协议违规,不能当作任务答案错误率或真实部署失效率。

审计者可以检查什么

作者仓库提供实验代码和任务输入,单独的数据发布仍标为待推出。本站检查了文档,尚未复现实验。

我们的编辑建议是分别检查任务结果是否正确,以及是否遵守证据要求。对互相审查的工作流,应记录审查者收到哪些证据、能否访问完整记录,以及批准的依据。仅凭正确答案,无法回答这些问题。

可在资源目录查找论文和代码,或使用评估报告阅读指南检查实验的适用范围。