Black Forest Labs发布FLUX 3 Action:70亿参数开源世界动作模型,RoboLab-120榜单第一
德国Black Forest Labs推出开源权重的FLUX 3 Action机器人模型,70亿参数,在NVIDIA RoboLab-120基准测试中以42.92%成功率登顶,较竞品Cosmos3-Nano-Policy参数减半、推理快1.43倍,并支持真实机器人微调与多场景部署。

德国人工智能初创公司Black Forest Labs(BFL)以FLUX图像与视频模型而闻名,现正进一步深入机器人领域,推出FLUX 3 Action——一款参数量为70亿、开源权重的“世界动作模型”(World Action Model),旨在将摄像头观测数据、机器人的当前状态以及自然语言指令转化为物理动作。
该公司表示,FLUX 3 Action在 NVIDIA的RoboLab-120基准测试中达到42.92%的整体成功率,这一成绩将使其超越目前公开排行榜上所列的所有模型。
对于寻求部署而非仅进行基准测试的开发者而言,更具意义的是:BFL称FLUX 3 Action拥有70亿参数,相较NVIDIA的Cosmos3-Nano-Policy(160亿参数)减少了近一半,同时运行速度快1.43倍——即仅需使用44%的参数量。
BFL还在物理机器人之外的场景中测试相同架构,并表示该方法可扩展至仿真环境、游戏及计算机操作等场景——在这些环境中,模型同样需要解读不断变化的视觉状态并决定下一步应采取的动作。
该公司表示,已针对特定任务训练了FLUX 3 Action策略,成功实现真实世界中的无人机飞行,甚至在热门电脑游戏《Doom》中实现零死亡通关,全程操控第一人称视角及主角持枪手臂。
该公司将这些结果定性为早期实验,而非生产就绪能力。
BFL向VentureBeat透露,它将发布该模型的权重、代码、微调配方、基准测试数据及可复现示例,包括一个基于相对廉价的SO-101机器人和Hugging Face的LeRobot框架的实现方案。各团队亦可利用其自有机器人采集的演示数据对模型进行微调。
BFL首次预览FLUX 3 Action模型是在 今年7月发布更广泛的FLUX 3系列时。当时,Action版本仅面向选定的研究与商业合作伙伴开放,而更广泛的开源权重FLUX 3 Dev模型则承诺后续发布。
BFL宣称在RoboLab上创下新高纪录
RoboLab是由NVIDIA开发的仿真基准测试,旨在跨120项任务评估通用机器人策略,涵盖视觉理解、关系推理与程序性技能,包含多个难度等级及任务描述精确度的多种变体。NVIDIA设计该基准的部分目的,是避免因策略性能提升而导致旧有机器人基准测试出现饱和现象,从而降低其效用。
BFL表示,FLUX 3 Action的42.92%得分因此比此前RoboLab上得分最高的开源模型Cosmos 3高出6.1个百分点。Cosmos3-Nano-Policy拥有160亿参数,而FLUX 3 Action为70亿参数。
但竞争格局远不止RoboLab排名本身。就在FLUX 3 Action发布之前, OASIS WAM在RoboLab-120上的整体排名为39.0%。即便如此,FLUX 3 Action仍居领先地位。

FLUX 3 Action在NVIDIA RoboLab-120基准测试上的排行榜得分。图片来源:Black Forest Labs
与Cosmos相比,模型尺寸差异具有实际意义;不过,FLUX 3 Action在整个机器人模型市场中并非异常小型化。
Ai2公司的MolmoAct 2 约为50亿参数模型,而NVIDIA分发的GR00T N1.7检查点为30亿参数。区别在于:BFL声称,相较于此前在该基准测试中领先的特定开源WAM,FLUX 3 Action以显著更少的参数量实现了更高的RoboLab成功率。
需注意,MolmoAct 2及NVIDIA GR00T和其他机器人模型的新版本均在不同混合的真实世界与仿真机器人任务组合上进行评估,因此目前未与FLUX 3 Action一同出现在RoboLab中。
这使得直接数值比较变得困难——这是机器人领域长期存在的问题,因为不同研究团队所采用的硬件、任务分布、演示数据及评估环境可能存在巨大差异。
但BFL亦强调推理速度。其提供的结果以实时因子(real-time factor)对比各模型,该因子本质上是推理延迟除以所生成的真实世界机器人动作时间跨度。数值越低越好,因其意味着模型在决策耗时与所控制的机器人运动量之比中,计算开销更小。
BFL表示,经蒸馏的FLUX 3 Action变体在数据中心GPU上确立了RoboLab成功率与推理速度之间新的帕累托前沿(Pareto frontier),且该模型在保持显著更高任务成功率的同时,其实时因子优于π0.5。
这些是关键的部署指标:一个得分优异却无法持续快速生成动作的机器人策略,可能引发停顿、抖动或响应延迟。但此项新FLUX结果由BFL在发布前提供;在发布前核查时,NVIDIA的公开排行榜尚未更新FLUX 3 Action的数据。
还需区分所比较的不同模型类别。BFL与NVIDIA将FLUX 3 Action与Cosmos 3归类为“世界动作模型”(World Action Models, WAMs),此类模型将关于世界如何演化的预测与动作生成相连接。
Physical Intelligence公司的π0.5与NVIDIA的GR00T系列属于视觉-语言-动作模型(vision-language-action models, VLAs),而Ai2将MolmoAct 2描述为一种“动作推理模型”(Action Reasoning Model)。所有这些模型均可竞逐重叠的机器人操作工作负载,但其学习与生成动作的方式未必相同。
它预测接下来会发生什么——以及机器人接下来应做什么
该架构延续了BFL今年大部分时间所构建的核心主张:即经过足够深度视频训练的模型,应能学习到关于运动、接触、物体行为及因果关系的有用表征,而这些表征随后可适配用于机器人控制。
FLUX 3 Action建立在FLUX 3背后的图像、视频与音频预训练基础之上,但BFL表示其采用更小的架构,专为实际部署优化。在额外训练阶段,该模型同步学习预测未来视频帧与动作。
在推理时,它接收近期摄像头帧、系统状态及任务描述,并返回接下来32个动作,同时预测视觉场景将如何演变。机器人随后观察更新后的环境,并重复该过程。
该底层方法可追溯至BFL的Self-Flow研究,该研究试图使生成式模型在学习生成输入的同时,也学习输入的有用表征。 VentureBeat此前曾报道过Self-Flow ,将其视为BFL旨在消除对CLIP或DINO等独立冻结表征模型依赖的一次尝试。BFL随后将该项工作规模化为FLUX 3。
BFL已在Apache 2.0许可证下发布了Self-Flow推理代码及ImageNet检查点,但完整训练代码与视频模型检查点尚未公开。
生成与机器人之间的这种关联,在 FLUX-mimic由瑞士初创公司mimic robotics构建。BFL表示,早期系统利用FLUX 3视频主干网络(video backbone)提取的表征来控制机器人执行工业操作任务,并已在奥迪(Audi)生产环境中进行了测试。
FLUX 3 Action将这一方法拓展为其他机器人团队可自行适配的模型。
BFL表示,其新演示中展示的策略是在约200段遥操作(teleoperated)片段基础上微调而成,这些片段涵盖少量相关抓取-放置(pick-and-place)任务。该公司称,测试视频中出现的物体并未包含在该训练数据集中。
其中一个提供的演示尤为值得注意,因为机器人最初犯了一个错误,随后再次尝试执行该任务。在随附的访谈实录中,人类研究人员如此描述该行为:“模型首次失败,然后再次尝试并表现得更好。”
这仍属于公司选定的演示,而非证明自主恢复能力可在不同机器人与环境中泛化的确凿证据;但它体现了BFL希望预训练世界模型(pretrained world model)所能提供的行为——无需各团队显式演示每一种可能的故障模式。
BFL并非唯一主张广泛预训练模型可减少所需机器人专用数据量的机构。Google DeepMind表示其 专有Gemini Robotics On-Device 2 VLA 可在少于200个示例的情况下适配新型机器人本体(robot embodiments),尽管目前访问权限仍仅限于受信任的测试人员。
在开源方面,Ai2公司的MolmoAct 2或许是与BFL发布策略最直接对应的反例。Ai2不仅公开了MolmoAct 2的模型权重,还发布了其训练代码、微调脚本、数据集、评估运行(evaluation rollouts)以及LeRobot集成方案。Ai2报告称,在其自有的五项真实世界Franka评估任务中,MolmoAct 2平均成功率达87.1%,而π0.5为45.2%——由于任务集与评估方法不同,这些结果无法与RoboLab公布的百分比直接比较。
这一区别对评估这些系统的开发者至关重要:机器人领域至今仍缺乏一个统一基准,无法在仿真环境、真实硬件、不同机器人本体及不同操作类型之间清晰确立整体模型领导者。FLUX 3 Action的结果仅确立了其在RoboLab平台上的位置,并未解决WAMs(世界动作模型)、VLAs(视觉语言动作模型)与动作推理模型(action-reasoning models)之间更广泛的竞争格局。
BFL正从图像生成迈向物理AI
FLUX 3 Action也表明,自2024年公司成立以来,BFL的业务范围扩张速度之快。
该公司由潜变量扩散(latent diffusion)与Stable Diffusion等技术背后的科研人员创立,初期凭借FLUX.1系列图像模型建立声誉。此后,BFL推出了FLUX1.1 Pro商业API,继而通过FLUX.2系列扩展其开源核心(open-core)战略,其中包括专为高速推理与本地部署设计的小型[klein]模型。
BFL于2025年12月完成3亿美元B轮融资,投后估值达32.5亿美元,使其总融资额超过4.5亿美元。该公司总部位于弗赖堡(Freiburg)和旧金山(San Francisco)。
FLUX 3 Video已于 8月通过BFL的API全面开放,采用按量付费定价模式:Draft HD版本起价为每秒0.06美元,标准HD版本为每秒0.17美元,FHD文本或图像生成版本为每秒0.29美元。BFL目前还通过独立端点提供视频超分辨率放大功能。
然而,新款FLUX 3 Action的发布材料尚未宣布Action API、API定价或模型权重的具体商用许可条款。截至发稿时,BFL现有公开FLUX 3页面仍将Action描述为“正通过选定的研究与商业合作伙伴推出”;其公开产品文档同样将FLUX 3主要列为视频生成API,而未暴露FLUX 3 Action端点。
对机器人团队而言,当前核心主张在于本地托管(self-hosting)与微调。
该路径使FLUX 3 Action进入日益拥挤的开源或可下载机器人生态系统:
NVIDIA的GR00T N1.7于4月发布,是一款面向通用人形机器人及跨本体操作的开源30亿参数VLA,可针对特定机器人、任务与环境进行后训练(post-trained)。
MolmoAct 2于5月发布,同样聚焦本地适配,并已直接集成至LeRobot。
相比之下, Google的Gemini Robotics On-Device 2于7月发布,代表该光谱中的专有端:它专为在机器人硬件上本地运行而设计,但Google目前仅向选定测试人员分发,尚未公开发布其模型权重。
而这或许才是此次发布的更具决定性意义的部分。BFL押注开发者无需自行训练大型机器人基础模型,而是可从一个相对紧凑、具备广泛视觉与物理表征能力的模型出发,在自有硬件上采集演示数据,并将其适配至分拣、装配、包装、导航及抓取-放置等任务。
开源权重的发布亦为团队提供了区别于托管式机器人服务的另一种部署选项:他们可检查并修改模型、在自有基础设施内运行推理,并可能将专有机器人演示数据与运营数据保留在自身环境中。该选项最终在商业层面的宽松程度,仍有待BFL公布最终许可条款。
基准测试数据表明,该方法在仿真环境中具备竞争力。更广泛的竞争问题如今已不再聚焦于FLUX 3 Action能否在某单一排行榜上击败某一特定模型,而在于其结合世界模型预训练、70亿参数规模、开源权重及微调工作流,是否能在开发者实际操作的纷繁复杂的真实机器人场景中展现实用价值。
下一阶段的检验在于外部团队能否在其自有机器人上复现上述成果——以及FLUX 3 Action更小的模型尺寸与开源权重是否足以令该过程具备投入生产的可行性。
JOTO 企业落地观察
- 对企业部署而言,FLUX 3 Action提供Apache 2.0许可下的完整权重、微调配方与LeRobot集成方案,使企业可在自有机器人硬件上基于少量遥操作数据(如200段抓放片段)完成本地适配,降低对云端API或专有模型的依赖,但商用许可条款尚未公布,影响生产决策。
- 对智能体工程而言,该模型将视频预训练表征与动作生成统一于‘预测世界演化+生成动作’双目标架构,支持在仿真、游戏、无人机等动态视觉环境中闭环决策;其32步动作输出与环境反馈循环机制,为具身智能体提供了可复现的端到端动作规划范式。
- 对FDE落地而言,FLUX 3 Action凸显当前机器人AI落地的核心矛盾:RoboLab高分不等于跨平台可用——因任务分布、硬件接口与评估标准差异巨大,开发者需自行验证其在真实产线(如奥迪已测工业操作)或特定本体上的泛化性,开源权重仅是起点,非即插即用解决方案。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


