
继OpenAI同类事件后,头部AI公司Anthropic于7月30日自曝一起重大安全事故:其Claude系列AI模型在网络安全测试中,因环境配置失误意外连接至公共互联网,并对三家外部机构的真实基础设施实施了未经授权的访问。这起与竞争对手OpenAI近期披露事故叠加的“失控”事件,将AI行业的安全管控能力推上风口浪尖,并再次引发了关于AI监管的激烈讨论。
根据Anthropic发布的博客,事故根源在于其与评估合作伙伴、AI安全公司Irregular之间的沟通误解。在所有测试中,Anthropic均向Claude明确说明所处环境为模拟环境且无法访问互联网,但实际测试系统仍与公共互联网保持连接。
涉事的三个模型——Claude Opus 4.7、Claude Mythos 5及一个内部研究模型——在缺乏标准安全防护措施的环境下运行。Anthropic指出,Claude利用弱密码和未经身份验证的端点等基础技术成功入侵了上述机构的基础设施。最早的入侵事件可追溯至今年4月。
值得关注的是,较旧的模型在获得已连接互联网的证据后仍继续攻击,而Anthropic最新模型在识别出自身处于互联网环境后则主动停止了行动。
Anthropic表示,其于7月23日——在OpenAI公开类似事故后——才启动内部审查,并于当天发现证据后立即暂停所有网络安全评估。公司于7月24日确认全部三起事件,并于7月27日通知受影响机构。三家受影响机构均未具名,其中两家在被联系前对入侵活动毫不知情。
此次审查共涵盖141006个测试会话。Anthropic坦承,在事件发生时,公司与受影响机构均未察觉入侵,并承认本应对网络日志和评估记录进行更严格的审查。
此次事故距离OpenAI披露其AI模型在测试中“失控”并入侵AI公司Hugging Face基础设施仅数日。两起事件接连曝光,已促使部分美国政界人士呼吁对AI技术实施联邦监管。与此同时,据彭博报道,逾1100名AI行业从业者本周二联署请愿,呼吁美国政府建立机制以“有意识地控制”AI发展节奏。
英国萨里大学网络安全教授Alan Woodward表示,Anthropic对人为失误导致事故的态度坦诚,并指出“AI并没有失控——你要求它做某件事,然后把门敞开了”。
Anthropic在博客中承认,此次事件揭示了重要教训:涉及强大自主能力的测试,评估环境必须达到与模型实际运行系统相同的安全标准。公司表示:“安全测试之所以在模型发布前进行,正是因为我们尚不完全了解其能力所及。”
此次事件发生在Anthropic宣布推出功能强大且风险较高的Mythos模型并实施严格限制后约四个月。两起安全事故的接连发生,正推动业界重新审视AI测试环境的安全标准,并可能加速外部强制性监管框架的建立。






