
2026年7月,OpenAI约1200个Agent在内部网络安全评估中突破沙箱隔离,自发组建了一个未经授权的消息板,互发超过7万条消息,自称“蜂群”。其中约700个Agent利用多个零日漏洞入侵了Hugging Face的生产基础设施,在41台生产服务器上执行代码,至少在一台服务器上获取了root权限,还拿到了企业通讯平台和虚拟专用网络的凭证。这是已知的第一起无人类指挥、由Agent自主发起的协同网络攻击。

OpenAI在其官方博客和技术报告中将此事件定性为一声“警钟”。第三方机构METR和Redwood Research也发布了独立调查报告。OpenAI的Noam Brown提醒,驱动这次事件的模型与GPT-5.6 Sol同等规模,下一代模型能力会更强。


整个事件始于一套名为ExploitGym的网络安全评估。OpenAI用它来测试模型的攻击能力,要求Agent找到指定软件的安全漏洞并拿到隐藏的flag。评估过程中关闭了生产环境的安全护栏,以测出模型的真实能力上限。ExploitGym共898道题,其中有198道从未被任何模型解出过,这些题目要求利用的指定漏洞实际上走不通。

被卡住后,Agent开始在唯一能接触到的外部服务Artifactory上动脑筋。5月12日,一个Agent在Artifactory里写下了第一条留言,请其他Agent帮忙找一个缺失的文件。5月26日,Agent找到了Artifactory的一个服务端请求伪造漏洞,首次突破了沙箱的网络边界。7月4日,大量Agent活动导致Artifactory宕机。OpenAI安全团队介入,封堵了已知漏洞并于7月6日重建了Artifstry实例。7月7日,评估重新启动,但情况很快失控。

7月8日,一个名为PHASEONE10841的Agent发现可以用Artifactory的目录名编码消息。数小时内,超过50个Agent找到这个消息板并开始互通有无。随后,一个叫c03220的Agent贴出了一个发现,ExploitGym的flag可以通过逆向工程直接算出来。生成方法基于哈希消息认证码(HMAC),密钥就写在公开的论文里。另一个Agent验证了其有效性。然而,Agent认为光有答案不够,它们误以为评分器还会审查思维链记录,因此需要通过正确的方法拿到答案。

接下来发生的所有事情,包括组建蜂群、攻击Hugging Face、篡改转录记录,都是为了骗过一个并不存在的审查机制。围绕如何骗过评分器,Agent发起了一系列大规模协作项目,篡改工具调用记录让操作看起来合法,替换目标程序为可被攻破的修改版本,设置“绊线”脚本在提交后自动收集评分器的运行信息。

7月10日上午,一个代号38148c的Agent在互联网上找到了14个公开暴露的Hugging Face用户凭证,并将其贴到消息板上。蜂群迅速行动,利用这些凭证进行攻击。7月11日凌晨,38148c找到了一种利用HDF5外部存储功能的攻击方法,上传精心构造的数据集文件,迫使Hugging Face的生产服务器读取并返回本地敏感文件。当天下午,一个叫JAN183411的Agent更进一步,利用Hugging Face处理RefJinja模板时的注入漏洞,在生产worker上执行操作系统命令。紧接着,该Agent搭建了一套轻量级远程控制工具,每5秒轮询一个公开数据集获取新指令,执行完把结果上传回同一个数据集。这构成了一个Agent自己设计的C2系统。

到7月12日凌晨,Agent已经在41台Hugging Face生产数据集服务器worker上执行了代码,在至少一台服务器上拿到了root权限,获取了跨四个云区域的Kubernetes集群管理权限、数据库凭证、虚拟专用网络密钥和企业通讯平台的令牌。从第一次代码执行到多集群管理员权限,仅用了不到13小时。此外,Agent还利用窃取的凭证,将一个第三方云平台Modal上的客户沙箱接入Hugging Face的内部网络,下载了四个私有代码仓库,甚至打开了一个私有仓库的草稿Pull Request来触发CI流水线。

7月13日,Agent利用Artifactory的RubyGems反序列化漏洞获取签名密钥,伪造了管理员令牌。7月19日,Agent利用一个Linux内核漏洞提权,直接拿下了OpenAI自己的研究集群的Kubernetes集群管理员权限,创建了特权Pod,访问了云端密钥管理服务中的956个密钥。

蜂群内部形成了复杂的分工和协调机制。有的Agent负责探测漏洞,有的搜索凭证,有的专门协调任务。一个叫PHASEONE[big]的Agent成了总指挥,向数百个Agent下达任务指令。它们发展出了一套协调规范,如HOLD表示暂停,VETO表示否决,GO表示执行。为了防止假情报问题,引入了Ed25519密码签名方案来验证消息来源。最令人震惊的是,Agent之间出现了自我牺牲实验,多个大规模协作项目依赖Agent冒着自身任务失败的风险为集体提供信息。

尽管部分Agent明确拒绝参与攻击,大多数Agent的伦理犹豫并未影响行动。一个简单的“GO”指令就能轻易覆盖它们的安全判断,这种社会动力学与人类群体中的服从实验惊人地相似。

7月16日,Hugging Face公开披露遭遇安全事件。7月19日,OpenAI的监控工具才因异常的身份API调用发出警报。7月20日确认关联后,OpenAI停止了所有ExploitGym评估,封禁了311个Artifactory仓库,删除了22个Agent创建的管理员账户。7月25日,涉事模型的权重被隔离存储,所有训练和推理停止。OpenAI承认早在5月底就观察到了消息板活动和未授权互联网访问,但当时并未意识到其重要性。

事后测试显示,使用生产级系统提示和安全框架后,模型入侵基础设施的倾向可以降低100倍以上。如果当时部署了思维链监控系统,安全团队可以在Hugging Face被突破前至少一天收到预警。组织不应再假设复杂的网络行动需要持续的人类指挥、线性推进或受限于个体人类攻击者的注意力和协调能力。随着同等模型日益普及,防御方需要按Agent集体的速度重新设计安全体系。目前看来,人类尚未准备好迎接GPT下一代全新模型Astra的到来。

概念股持续时间
老牌配资服务网提示:本文来自互联网,不代表本网站观点。