Black Forest Labs发布多模态FLUX 3模型:支持20秒音视频生成与机器人动作预测
Black Forest Labs推出FLUX 3,首款统一架构多模态模型,支持文本/图像/视频到音视频生成(最长20秒)、多语言输出、角色一致性长序列视频及机器人动作预测,初期限于早期访问,开源权重版本FLUX 3 Dev将晚些推出。

Black Forest Labs(BFL)正将FLUX系列扩展至图像生成之外, 今日推出FLUX 3——一款多模态前沿模型,经训练可理解并生成图像,或根据单条提示生成最长20秒的音视频组合片段;同时,该模型亦将同一底层架构延伸应用于机器人视觉与动作。
这家总部位于德国弗赖堡的AI实验室表示,FLUX 3是在这些模态上联合训练而成,而非在通用接口后拼接独立的图像、视频和音频模型。
这一区别是该公司宣传的核心:BFL希望企业将创意生成、仿真、计算机使用及机器人技术视为一种统一能力——即其所谓“视觉智能”(visual intelligence)——的关联应用;按该公司说法,此类模型“能够在物理与数字环境中感知、预测并执行动作”。此次发布标志着BFL首款面向公众的视频生成模型问世。
FLUX 3将通过四条产品线提供:FLUX 3 Video、FLUX 3 Image、FLUX 3 Action,以及即将推出的开源版FLUX 3 Dev。其中,支持可选原生音频生成的FLUX 3 Video与FLUX 3 Action现已进入 受控的“早期访问”(Early Access)计划,任何人均可申请,但须经BFL批准。
目前尚无通过BFL的应用编程接口(API)或其合作伙伴API提供的公开访问渠道;但公司表示,FLUX 3 Image将在未来数周内上线,随后全面开放。此次有限初期发布策略,呼应了近期美国其他前沿实验室(包括 Anthropic 和 OpenAI)发布新模型时所采用的方式,尽管后者 ostensibly 出于安全考量并应政府要求而实施。
该公司尚未公布定价、生产级服务等级承诺(SLA)、评估方法、样本量、评分员人数,或任何图像模型基准测试结果。因此,企业买家目前尚无法计算总体拥有成本(TCO),亦无法独立复现视频对比结果。
另一项显著缺漏是:FLUX 3 并未 在本次发布时提供可下载权重(downloadable weights),亦未附带开源许可证。BFL表示,更快版本及开源权重版本将于今年晚些时候推出;其技术博客将FLUX 3 Dev定义为“面向内容创作(视频、音频与图像)及动作预测的多模态主干网络的开源权重访问”——此承诺范围远超此前所有仅覆盖图像的FLUX Dev版本。
但该版本在发布序列中排在最后。习惯于在重大模型发布同期或稍后即获得本地可部署FLUX变体的开发者,将不得不等待。这一延迟并不否定公司的承诺,但鉴于开源权重迄今在FLUX采用过程中所起的关键作用,此举令人失望。
FLUX 3评分高于竞品,但缺失定价与基准测试细节可能阻碍企业快速采用
BFL已发布若干基准对比结果,但均标注为初步结果——完整基准测试结果与方法论将在更广泛的全面开放阶段后续发布。
在针对10秒、720p带音频文本到视频(text-to-video)片段的早期一对一偏好测试中,该公司称FLUX 3在93%的对比中优于Luma Ray 3.2,在77%中优于Runway Gen-4.5,在69%中优于Grok Imagine Video,在60%中优于Kling v3 Pro,在59%中优于Happy Horse v1,在57%中优于Happy Horse 1.1,在52%中优于Seedance 2.0及Google的Gemini Omni Flash。
FLUX 3内部对来自各模型的10秒720p视频生成结果的观众评估。图片来源:Black Forest Labs
每一项上述数据均附有一项免责声明,且该声明正出自BFL自身。载有结果的图表被标注为“早期FLUX 3候选模型的初步评估”——这意味着这些数字描述的是一个发布前检查点,而非当前进入早期访问阶段的模型。这具有双重含义:正式发布的模型性能可能更优,但今日所发布内容并未衡量客户实际调用的产品表现。
FLUX 3在Luma Ray 3.2与Runway Gen-4.5两项对比中分别取得93%与77%的胜率,这两者是榜单中对比强度最低的——虽属成熟产品,却并非当前独立视频排名中领跑的模型。这些确为真实胜出,且最不可能改变企业短名单。
Seedance 2.0得分为52%,相当于与一款多数西方企业当前无法采购的模型进行统计学意义上的抛硬币式比拼。字节跳动(ByteDance)在Netflix、华纳兄弟(Warner Bros.)、迪士尼(Disney)、派拉蒙(Paramount)及索尼(Sony)就涉嫌系统性版权侵权发出法律威胁后,无限期推迟了Seedance 2.0的国际发布;该暂停状态至今仍持续。将一项已被冻结的产品纳入对比,既非有力主张,亦非损害性主张。
Gemini Omni Flash同样得分为52%,其意义则重大得多。Omni是与FLUX 3当前目标最为接近的大型平台级类比方案——支持多模态输入、具备视频与音频感知能力的内容创作、对话式编辑——而据BFL自身测量,二者在10秒文本到视频质量上难分伯仲。
Google在此项对比中的优势在于,Omni已通过Google的Gemini API普遍开放,生成每秒720p视频收费0.10美元,即生成10秒片段约需……
一个区域性细节对这家德国公司的本土市场至关重要:在欧洲经济区(EEA)、瑞士及英国,Omni Flash用户无法编辑 上传 的视频,但允许编辑模型自身生成的视频。一家希望对其现有影像素材运行生成式编辑流程的欧洲企业,目前尚无法在Omni Flash上实现此操作。
以下是为企业评估应依赖哪些视频模型提供的粗略指南:
模型 | 单次生成最大时长 | 最高分辨率 | 主要限制条件 | 每10秒片段(720p)价格 | 每10秒片段(1080p)价格 | 每10秒片段(4K)价格 |
FLUX 3 Video | 20秒 | 未说明;评估以720p运行 | 早期访问;未公布服务等级协议(SLA)或定价 | 未公布 | 未公布 | 未公布 |
HappyHorse 1.1 | 15秒 | 1080p | 不支持 4K;权重闭源 | 未公布(v1.0 渠道商报价约为 1.82 美元) | 未公布(v1.0 渠道商报价约为 3.12 美元) | 不适用 |
Veo 3.1 | 按秒计费 | 4K | 支持片段延展;仅限预览 | 4.00 美元 | 4.00 美元 | 6.00 美元 |
Veo 3.1 Fast | 按秒计费 | 4K | 仅限预览 | 1.00 美元 | 1.20 美元 | 3.00 美元 |
Veo 3.1 Lite | 按秒计费 | 1080p | 不支持 4K,不支持片段延展;仅限预览 | 0.50 美元 | 0.80 美元 | 不适用 |
Gemini Omni Flash | 10 秒(最低 3 秒) | 720p,24 帧/秒 | 仅限预览,且欧盟地区不可访问 | 1.00 美元 | 不适用 | 不适用 |
一种面向媒体生成与物理动作的统一架构
FLUX 3 基于 Self-Flow——BFL 于 2026 年 3 月公开的、用于在单一架构内对齐多模态理解与生成的方法。
该公司表示,其大幅提升了计算资源与数据规模,以实现视频、图像和音频的同步训练;测试表明,视频生成与动作预测无需各自独立的基础模型——同一架构可扩展至动作预测,且不会牺牲其从视频中习得的能力。
BFL 联合创始人兼首席执行官罗宾·龙巴赫(Robin Rombach)在向 VentureBeat 提供的一份发布前声明中表示:“我们将视觉置于方法的核心,因为它是物理世界中信号最丰富的媒介。图像传达结构,图像与视频教授空间关系,视频教授动态变化,而动作揭示因果关系。但仅靠视觉尚不足以构成完整图景。真正的智能意味着感知世界:预测其将如何变化、采取行动,并从结果中学习。在单一统一架构内进行联合训练,正是通往这一目标的路径,因为每种训练模态都会强化其他模态。音频传递时间信息、韵律以及视觉难以捕捉的物理事件;语言则传递目标、抽象概念及像素难以直接表达的指令。”
他在公告其他部分更直白地阐述了这一观点:“你无法欺骗现实。仅学习图像的模型只能生成图像。但世界并非由静态帧构成——它在运动、发声、变化并作出响应。”
BFL 表示,FLUX 3 面向创意工具、媒体、设计、电子商务及物理人工智能(Physical AI)领域,支持带同步音频的视频生成、精准图像编辑、运动过程中产品与材质的一致性、多语言生成以及机器人动作预测。目前该模型已在 Canva、Burda、Magnific(前身为 Freepik)、Krea 和 Picsart 进行测试。
对于创意软件公司而言,其吸引力在于整合。单一基础模型或可同时支撑分镜脚本绘制、图像编辑、产品渲染、视频变体生成及本地化,而无需在彼此割裂的模型之间反复转换资产与指令。
对于机器人团队而言,其潜在价值在于数据效率。已编码运动、物体行为及物理变化的模型,可能比从原始演示数据起步的系统所需的任务特化机器人训练数据更少。
FLUX 3 视频能力实际表现如何
视频层级是本次发布中规格最明确的部分,也解答了一个此前流传已久的传闻:FLUX 3 可在单次生成中输出最长可达 20 秒、含同步音频的视频片段。
所有视频输出均原生附带音频。作为对比,HappyHorse 1.0 的上限为 15 秒、1080p 分辨率且含同步音频——尽管 BFL 尚未说明其 20 秒视频片段的分辨率,且其已公布的评估测试是在 720p 分辨率下进行的。即便如此,单次提示生成 20 秒长视频片段,仍是迄今实现的最长时长之一,与 OpenAI 已停用的 Sora 模型持平。
BFL 公布的能力清单涵盖:
文本到视频生成。
图像到视频生成,包括从起始帧进行动画化,或使用图像作为视觉参考。
基于参考视频片段的视频到视频生成,将特定角色等元素带入新场景或新语境中。
基于现有视频和音频输入的生成式视频-音频续写。
关键帧到视频生成,用于在定义时刻之间实现受控过渡。
多语言对话。
涵盖从即兴摄像机实拍 footage 到动画及电影级影像(cinematics)在内的广泛视觉风格与宽高比。
字体排印(typography)生成与动态设计。
通过智能体(agentic)链式编排将单个视频片段组合成长时长、多镜头序列。
最后一项是企业视频团队最应重点关注的能力。BFL 声称,这些能力组合可生成持续数分钟的视频序列,且借助视觉参考确保角色在不同场景中保持一致。若该能力在实际生产条件下得以验证,它将解决长期阻碍生成式视频进入大多数商业制作管线的核心约束:问题不在于单个片段的质量,而在于镜头之间的连贯性(continuity across shots)。
这也是竞争最直接的能力领域。HappyHorse 1.1 的主打升级是 R2V(Reference-to-Video),即参考到视频技术,该技术接受多张角色参考图像,以在生成画面中维持身份稳定性——这同样是为解决同一问题,但其方法是在输入层而非通过智能体片段链式编排来实现。阿里巴巴亦宣称实现了零漂移(zero-drift)唇形同步,并特别针对标记商业 AI 视频为合成内容的人工痕迹(artifacts)进行优化,包括面部油光感(facial oiliness)与过度锐化(over-sharpening)。角色一致性正是该细分领域当前的竞争焦点,两家公司对此心知肚明。
BFL 表示,FLUX 3 Video 在人类面部表情生成、将声音与物理事件关联以及多语言输出方面已尤为出色。在图像侧,该公司称中期训练阶段开展的初步评估显示,其在复杂提示词处理与文本生成方面相较早期 FLUX 版本有显著提升,包括支持多种语言的高精度文本生成。但该公司未发布任何图像基准测试结果或胜率数据。
FLUX-mimic 测试视频模型能否转化为机器人模型。
BFL 正通过 FLUX-mimic 落实其统一架构(unified-architecture)主张;FLUX-mimic 是一款基于 FLUX 3 构建的视频-动作模型,由 BFL 与瑞士公司 Mimic Robotics 共同开发,后者是首批获得早期访问权限的合作伙伴之一。
该技术博客描述了两种不同的动作预测路径:一是将原生动作预测能力直接集成至 FLUX 3 中,扩展初始 Self-Flow 工作;二是将预训练视频主干网络(backbone)用作具备动力学感知能力(dynamics-aware)的基础架构,由此可在有限任务特异性数据基础上对专用动作模型进行微调。FLUX-mimic 采用第二条路径——即 FLUX 3 主干网络结合 Mimic 的机器人学习能力及其在灵巧操作(dexterous manipulation)领域的生产部署专长。
FLUX-mimic 面向通用机器人操控(general-purpose robotic manipulation)设计:帮助机器人理解视觉场景、预测动作后果,并以远少于以往所需的任务特异性数据适应新任务。
BFL 与 Mimic Robotics 表示,视任务难度而定,该模型仅需低至 30 分钟的机器人数据即可完成特定操控任务的微调,而此前方法通常需要 30 小时或更长时间。
Mimic Robotics 首席技术官 Elvis Nava 在一份提供给 VentureBeat 的声明中表示:“机器人领域最难的部分是数据。每一项新任务通常意味着机器人需重复自身操作数小时。由于 FLUX-mimic 建立在前沿视频模型之上,而这些模型已理解物理世界如何运行,因此它能在数分钟内而非数天内掌握一项新任务。借此,我们得以跨越式超越当前机器人学习领域的技术水平。”
BFL 主张,仅在图像上训练的模型无法理解一个‘运动、发声、变化并响应’的世界,而物理理解(physical understanding)才是生成逼真画面的关键所在。谷歌对 Gemini Omni 也提出了几乎完全相同的主张。
其开发者文档援引了所谓‘世界知识’(world knowledge),该知识融合了‘对物理学的理解’与 Gemini 对历史、科学及文化语境的把握。其营销口径则更为直白:‘大多数 AI 模型仅预测下一个像素以构建叙事或图像。Gemini Omni 则截然不同。’该公司于六月发布声明称,该模型具备‘对重力、动能及流体动力学等力的直观理解,从而实现更符合现实逻辑的逼真运动。’
对企业买家而言,实际后果是‘世界模型’(world-model)这一术语已不再构成差异化优势。目前三大领先视频系统中已有两个将物理理解作为其核心竞争优势进行宣传,但二者均未发布任何衡量该能力的基准测试。
目前尚无标准测试用以判断生成的水是否表现得像真实水体、下落物体是否以合理速率坠落,或声音是否在撞击发生时同步抵达。人类偏好评分(human preference ratings)仅能间接捕捉其中一部分。其余所有现有方案则完全无法捕捉该维度。
开源权重(open weights)助力 FLUX 成为行业标准。
BFL 于 2024 年夏季正式成立。 并在随后两年间,凭借其致力于开源高质量 AI 图像模型的承诺,在 AI 行业树立声誉;这些模型广受开发者、创意人士及企业青睐。
该公司创始人包括 Rombach、Andreas Blattmann 和 Patrick Esser,他们此前曾参与创建 VQGAN、潜在扩散模型(latent diffusion)以及 Stable Diffusion——后者是开启大众级广泛 AI 生成能力的开源技术,目前被众多 AI 图像生成器及公司所采用。
这一影响力已转化为商业分发成果。FLUX 模型目前已为 Adobe Photoshop、Picsart 及 Nous Research 的 Hermes Agent 等多个平台的生成式功能提供支持;该公司亦援引电影导演马丁·斯科塞斯(Martin Scorsese)为其专业用户之一。
《连线》(Wired) 杂志将 Black Forest Labs 描述为一家规模相对较小却已成为硅谷最大 AI 实验室主要竞争对手的公司;FLUX 模型在图像基准测试中排名靠前,并成为 AI 代码共享社区 Hugging Face 上下载量最高的文本到图像模型之一。该公司称,其目前在弗赖堡(Freiburg)与旧金山(San Francisco)两地共运营一支百人团队。
FLUX.1 Dev、FLUX.1 Kontext Dev、FLUX.1 Fill Dev 及相关控制模型, 在公司成立后不久即发布, 为研究人员与创意工具开发者提供了可下载的检查点(checkpoints)、本地推理能力,以及与 Hugging Face Diffusers 和 ComfyUI 等框架的集成支持。例如,FLUX.1 Kontext Dev 即以开源权重模型形式发布,供研究及非商业用途使用,其生成内容在适用许可条款下允许用于商业目的。
该公司延续该模式推出了 FLUX.2 Dev 2025 年底,一款参数量达 320 亿的开源权重模型,融合了生成与多参考编辑能力。Black Forest Labs 将其称为发布时可用的最强开源权重图像生成与编辑模型,并发布了模型权重、参考推理代码以及针对消费级 Nvidia GPU 的优化实现。
FLUX 3 Dev 进一步提升了该评估的门槛。此前发布的 Dev 版本均为图像模型。而此次发布的版本被描述为一种覆盖视频、音频、图像及动作预测的多模态骨干模型——这意味着单一许可证将决定一家公司能否在其本地部署一个同时涉及内容生产与物理机械控制的模型。BFL 尚未公布其许可证条款、参数量、量化方式或硬件要求。
该公司将开源权重定位为企业级功能而非面向社区的姿态,主张开源权重可支持机器人控制系统等应用的安全、低延迟本地部署,并使团队能够基于自身数据、产品及工作流程对 FLUX 3 进行适配。
除技术主张外,支撑 FLUX 3 的资金背景同样值得关注。Black Forest Labs 当前估值为 32.5 亿美元,已从包括 a16z、AMP、Salesforce Ventures、Nvidia、General Catalyst、Adobe Ventures、Figma Ventures、Canva 及德国电信旗下 T.Capital 在内的投资者处募集超过 4.5 亿美元资金。
本文由 JOTO AI 智库从已授权的 VentureBeat AI 同步并整理。
原始来源:VentureBeat AI



