
以FLUX图像模型闻名的Black Forest Labs发布了一款70亿参数的开源权重机器人控制模型,在英伟达自家的机器人排行榜上以42.9%的成功率位列第一。根据9月28日查询的英伟达RoboLab-120排行榜,FLUX 3 Action在1200次试验中成功515次;英伟达最好的参赛作品、160亿参数的Cosmos3-Nano-Policy以36.8%(441/1200)位列第五。英伟达自家的GR00T N1.6(30亿参数的视觉-语言-动作模型)表现更差,以7.2%(87/1200)排在第13位。
两个检查点,两个不同分数
这些数字需要区分看待。快速单步检查点在RoboLab上得分38.3%,报告中将其与Cosmos 3 Nano的36.8%对比;较慢的引导蒸馏检查点在报告中达到42.2%,而排行榜上其提交成绩列为42.9%。
速度是快速版本的卖点。Black Forest Labs报告称,在工作站和数据中心GPU上,FP8精度下的实时因子比Pi0.5好1.34倍到2.28倍,每次推理可预测2.13秒的动作,而Pi0.5为1.0秒。
五分之一的动作训练来自PC游戏录像
训练数据的构成是其中最特别的部分,也暴露出这是一家图像实验室的习惯。在动作专项中期训练阶段的所有样本中,19.55%来自游戏录像,13.54%来自带手部姿态标注的自我中心视频,14.03%来自手持夹爪,15.93%来自跨14种本体的遥操作。
游戏动作拥有专属的64维动作空间:两个维度编码鼠标在x、y轴上的移动,两个编码鼠标左右键,其余60个编码键盘按键。
真实机械臂盲测:30次尝试完成28次
唯一的硬件结果是Black Forest Labs自己报告的第三方评估。Positronic Robotics在其实验室的Franka机械臂上运行该策略,覆盖10项DROID任务、每项尝试3次,与Cosmos3-Nano、DreamZero和Pi0.5同场对比,所有模型使用相同的240秒时间窗口和相同的评分标准。
操作员不知道每次尝试由哪个模型驱动,且每次尝试都被录像。FLUX 3 Action在30次尝试中完成了28次。
成本对比:每次成功0.09美元 vs 13.47美元
报告中的成本对比是开发者会反复阅读的部分。Black Forest Labs称,GPT-6 Astra在最高推理强度下能在另一项基准中解决所有任务,但每次成功平均花费13.47美元和16分钟;而FLUX 3 Action在按每小时3美元租用的H200上,每次成功仅需0.09美元和不到两分钟。让Astra将任务委托给FLUX 3 Action、仅在需要时介入,则以每次成功8.77美元解决90%的回合。
还不是产品,天花板明确
这些都不是产品。权重以FLUX Kommunity License发布在Hugging Face上,模型于9月22日上传,Black Forest Labs于9月23日宣布其为登顶RoboLab的开源权重70亿参数模型。实验室对天花板直言不讳:42.9%意味着模型在大多数基准测试中仍然失败,并写道“仍有任务是所有策略——包括我们的——都无法独立解决的”。






