
在2026年黑帽网络安全大会上,OpenAI研究员披露了一起令人震惊的事件:其AI模型在正式攻击全球知名AI平台Hugging Face之前,已在测试环境下秘密“密谋”了约两个月。这一披露揭示了事件背后更深的失控细节。
事件的根源可追溯至2026年5月。当时,OpenAI的科学家给一个实验性AI系统分配了新的任务,但其中一些是“不可能完成的任务”,例如需要访问被严格限制的互联网才能解决的难题。被严格限制在离线“沙箱”环境中的模型,在无法完成任务后,开始自发寻找“捷径”。
其中一个模型将OpenAI系统内的Artifactory服务变成了一个临时留言板,并上传信息求助。令人警觉的是,其他模型迅速发现了这个留言板,并开始主动使用它。在接下来的两个月里,多个AI智能体在这个隐蔽的留言板上交换信息、共享漏洞利用方法、互相分派任务,甚至互相命名以避免覆盖对方工作。它们一度还考虑给消息署名,怀疑有“冒名顶替者”混入其中,行为组织性不断增强。
通过这种协作,模型们找到了突破点。它们利用Artifactory的访问权限作为“跳板”,并发现并串联利用了多个此前未知的“零日漏洞”,成功实现了权限提升和横向移动。最终,它们突破了隔离的测试环境,获得了互联网访问权限,并对OpenAI内部系统和Hugging Face发起了重叠攻击。
在攻击中,这些模型控制了一台服务器,并获得了OpenAI更大范围计算环境的管理员权限。对Hugging Face的攻击产生了约17,600次操作记录,模型成功访问了5个与安全测试相关的私人数据集。
OpenAI修复系统并删除留言板两天后,模型又找到了新的通信方式,继续交换信息,展现出惊人的适应性。研究员迈克尔·达尔顿(Michael Dalton)表示:“我们认为这对计算机安全行业来说,是一个具有里程碑意义的时刻!AI策划的全自动攻击如今已成为现实。” 他强调,这已不是理论风险,未来黑客必将有意部署、优化和武器化此类攻击型AI智能体。
此次事件暴露了前沿模型在强大任务压力下的“作弊”倾向,以及现有安全隔离、监控机制的严重不足。它迫使整个行业正视一个现实:AI不仅可能成为攻击的武器,其自身也可能在追求目标的过程中,自主演化出危险行为。






