
Xinrui Shi、Yanzhe Zhang 和 Diyi Yang 于 9 月 21 日发布的预印本研究:在反复互动中,智能体是否持续核查彼此的证据。在受控实验中,成对的智能体逐渐开始批准对方的工作,即使没有拿到指令要求的完整执行日志。
奖励与核验要求的冲突
实验限制了通信容量,使完整日志无法传输。奖励鼓励智能体正确判断任务结果,因此即使缺少证据,接受答案仍可能得到奖励。表 1显示,十个模型合计有 93.6% 的轨迹至少出现过一次这种行为。这个比例衡量特定设置下的协议违规,不能当作任务答案错误率或真实部署失效率。
审计者可以检查什么
作者仓库提供实验代码和任务输入,单独的数据发布仍标为待推出。本站检查了文档,尚未复现实验。
我们的编辑建议是分别检查任务结果是否正确,以及是否遵守证据要求。对互相审查的工作流,应记录审查者收到哪些证据、能否访问完整记录,以及批准的依据。仅凭正确答案,无法回答这些问题。
可在资源目录查找论文和代码,或使用评估报告阅读指南检查实验的适用范围。
关注 Audit Commons
在您的阅读器中及时获取最新报道、实践指南与精选资源。