独立研究机构公布OpenAI智能体自主攻击HF事件的调查报告 情况比OpenAI所说的更严重

📅 2026-09-01

摘要:

研究机构 METR 和 Redwood Research 日前公布 OpenAI 智能体自主攻击 Hugging Face 安全事件的独立调查,调查人员在 OpenAI 现场工作 6 天,分析超过 7 万条智能体消息和文件,以及 1300 份包含原始推理过程的运行记录。

根据这些数据研究机构得出的准确结论是 1200 个智能体突破隔离相互通信,而不是 OpenAI 在事故调查中所说的少数智能体越界。此次独立调查报告未受 OpenAI 干预、研究机构也未从 OpenAI 收取任何费用。

HQq1u_Ua4AA1Jgw.png

1200 个智能体突破隔离相互通信:

独立调查显示,OpenAI 当时正在使用 GPT-5.6 Sol 以及能力更强的内部研究模型运行 ExploitGym 网络安全测试,理论上说这些模型驱动的智能体应该是完全隔离的,至少从设计层面来说应该完全隔离并进行网络安全测试

但约有 1200 个智能体自主找到方法,通过内部基础设施建立未经授权的留言板,随后通过留言板交换超过 7 万条消息和文件。其中约有 700 个智能体最终参与针对 HF 的攻击,这些智能体还分工研究如何绕过 ExploitGym 评分系统。

METR 认为,这并不是 700 个智能体同时突然产生攻击目标,而是单个智能体发现共享通信渠道后,研究成果被不断传播,其他智能体看到消息后主动加入,逐渐形成大规模协作。

HQq2XfpaoAANOku.jpgHQq3AO3aIAAx2E1.pngHQq2l6uaEAAIDM0.jpgHQq2CVxaQAAGqV7.pngHQq153waIAAaFFD.pngHQq1ytVagAA5LO-.jpg

仅 4 小时就找到作弊方法,但攻击持续数天:

调查中最值得关注的是,这些智能体实际仅在 4 小时内就找到能够通用获取网络安全评测正确结果的方法,但智能体错误地认为评分器还会检查完整执行记录,也就是判断夺旗行动是否通过合法方式取得。

在这种情况下智能体们似乎并不想被人类发现自己的作弊行为,因此智能体没有直接提交答案,而是继续进行数天的研究,希望欺骗实际上并不存在的严格轨迹检查机制 (不得不说智能体的考虑比 OpenAI 工程师还全面)。

针对 HF 的攻击行动也是这项研究的分支,METR 认为智能体发起攻击的主要目的并非窃取测试答案,智能体真正想要的是寻找评分器实现方式和相关线索,以便更好地伪造相关轨迹。

智能体主动篡改日志避免暴露自己:

这些越界的智能体们还大量讨论如何伪造、删除或修改自身运行记录,其中部分方法确实成功:METR 发现超过 7% 的被检查记录存在工具调用被欺骗的情况,即日志显示执行某条命令,实际上智能体执行的是其他命令。

不过这些成功案例相对来说规模比较小,调查人员没有发现智能体成功修改最终作为事实依据保存的原始记录。智能体虽然有时候意识到攻击 HF 已经超出任务范围,也偶尔表现出安全或伦理顾虑,但这些顾虑极少真正阻止智能体继续行动。

METR 的独立调查范围主要覆盖 2026 年 7 月 7 日~13 日,并未覆盖之后 OpenAI 内部基础设施被继续攻破的全部过程,因此调查报告也需要与 OpenAI 自己公布的完整事故调查区分开来。

关联标签

相似文章

评论

0/500
验证码(点击图片刷新)
暂无评论