
NVIDIA公司宣布,其面向物理AI(Physical AI)的世界模型“Cosmos 3 Edge”正式向公众开放。该模型旨在让机器人、自动驾驶汽车等智能系统能够在边缘设备上实时感知环境、推理态势并预测下一步行动,无需依赖云端算力。
Cosmos 3 Edge是一个拥有40亿参数的全模态(Omni-model)世界基础模型,基于NVIDIA自研的Nemotron架构构建。其核心特点在于兼顾低内存消耗与高运算吞吐量,可在NVIDIA Jetson、RTX PRO、DGX系统及GeForce RTX GPU等广泛的边缘计算设备上流畅运行。
该模型采用了混合型Transformer架构,能够理解并生成文本、图像、视频、环境音效以及动作指令。这使得它不仅能处理视觉信息,还能综合物理环境的多模态信号进行推理和决策,为机器人控制、自动化系统等提供实时支持。
据NVIDIA介绍,Cosmos 3 Edge在同参数规模模型中,于VANTAGE-Bench视觉分析基准测试中排名第一。其配备的一个20亿参数的推理模块甚至可以独立运行于Jetson Orin 8GB设备上,进一步降低了边缘AI的部署门槛。
对于开发者而言,该模型显著简化了定制流程。借助开放的NVIDIA Cosmos框架,开发者仅需约一天时间,即可使用特定机器人、车辆或传感器的数据对Cosmos 3 Edge进行后训练(Post-training),构建出专用世界动作模型(World Action Model)。模型的权重、代码及训练配方均已在Hugging Face和GitHub上以开源形式提供。
Cosmos 3 Edge的应用覆盖机器人、自动驾驶和智能基础设施三大领域。
在机器人领域,开发者可在NVIDIA DGX Station上进行模型后训练,然后部署至Jetson Thor平台,用于执行实时的物体操控、移动等任务。目前,Agile Robots、斗山机器人、西门子与Skild AI等公司正评估将其应用于机器人工作流程。在自动驾驶方面,该模型有助于在资源受限的车载硬件上实现道路场景理解与意图预测。智能基础设施则可利用其在Jetson Thor上的实时推理能力,进行交通监控、公共安全与工业检测等视觉分析。






