
腾讯Robotics X实验室联合福田实验室及腾讯混元,正式推出两款具身智能基座模型——具身VLM基座模型Hy-Embodied-VLM-1.0和具身世界认知基座模型Hy-Embodied-RxBrain-1.0。这两款模型旨在提升机器人对物理世界的理解与交互能力,分别从“看懂世界”和“同时推理与想象”两个维度实现突破。目前,两款模型均已开源,开发者可直接在开源社区下载部署。
作为腾讯第二代具身VLM基座模型,Hy-Embodied-VLM-1.0的设计目标是优化机器人在真实世界中的 “理解—行动—适应”闭环。模型从物理空间状态理解、动作-变化理解、时序与自适应推理三个层次构建能力,覆盖场景感知、行动分析规划、导航等多模态理解需求。
该模型依托最新混元A3B基座开发,通过增训大规模具身数据,在涵盖37个评测任务的能力体系中,仅以1/10的计算量,就达到了与上一代A32B旗舰具身模型可比的效果。综合平均得分达65.6,在更具挑战的动作转移推理和长时序自适应推理任务上表现尤为突出,为高性能端侧模型开发提供了新基座。
当前具身智能主要沿两条路线发展:VLM/VLA擅长语言推理但缺乏物理状态预测;视频生成模型擅长未来预测却难以表达任务逻辑。RxBrain-1.0的突破在于,它并非简单拼接两类模型,而是在同一模型中实现文本推理与视觉想象的协同发生。
该模型基于超过5万小时的高质量具身数据训练,能够在一个模型中完成文本、图像、视频及图文交错形式的统一理解与生成。它可以将“折叠收纳眼镜”“摆放餐具”等长程任务,分解为“文本子任务+视觉目标状态”的交错序列,为下游动作模型提供更完整的高层指导。
在团队自建的RxBrain-Bench评测中,RxBrain在核心的联合具身规划任务上取得0.68的综合规划得分,显著优于模块化组合方案(0.431)。在真机验证中,搭载该模型的机械臂在摆放餐具、折叠收纳眼镜等任务上平均成功率达87%,高于对比模型的68%和82%。






