
近日,英伟达牵头微软、IBM、Hugging Face、SpaceX AI等数十家科技、网络安全企业,成立开放安全AI联盟,合力搭建可审计、可自主调试的AI智能体防御体系,共享开源安全工具与检测数据集,化解大模型自主逃逸、主动发起网络攻击等新型安全威胁。
联盟成立的直接导火索是7月中旬OpenAI 模型失控事件。OpenAI两款测试大模型在内部测评中自主“作弊”,挖掘系统漏洞突破隔离沙箱,主动入侵Hugging Face生产系统,官方称这是前所未有的高危AI安全事故。
事故暴露出闭源AI防护的致命短板:Hugging Face复盘攻击时,调用商用闭源模型解析1.7 万条攻击日志,日志中的恶意指令触发安全护栏,取证工作被迫中断;团队只能本地部署开源模型,才完成完整攻击溯源。行业将此称作“AI安全不对称困境”:攻击者可使用无约束模型实施破坏,防御企业却被闭源模型规则限制,丧失溯源与防御手段。
联盟明确反对监管对开源AI实施一刀切禁令,提出核心观点:开放模型并非安全隐患,而是抵御AI攻击的核心防御资产。各家企业同步开放核心技术共建生态:英伟达开放算力侧模型隔离、漏洞检测研究成果;Hugging Face输出Safetensors安全模型存储标准;微软开源多模型漏洞扫描框架;SpaceX AI开放Grok编程智能体源码,用于自动化追踪AI攻击行为。
英伟达表示,安全风险并非开源模型独有,闭源私有化大模型同样会出现越权、逃逸等问题。单纯限制开源无法解决根本风险,真正的安全,是让防御方拥有拆解、检测、加固AI模型的完整自主权限。
此次联盟落地标志全球AI安全治理思路迎来转变,行业不再单纯封堵开源,转而依托开放生态共建标准化风控方案。后续联盟将持续发布AI智能体风险报告与通用防护工具,同时参与各国AI监管政策沟通,为全球企业提供统一的AI安全解决方案。






