一个感知世界的模型:Black Forest Labs为何一次性训练FLUX 3处理一切

Black Forest Labs发布了FLUX 3,这是一个多模态基础模型,摒弃了为不同媒体类型分别训练模型的行业惯例。相反,它在单一统一架构中从图像、视频、音频和机器人动作序列中学习,其前提是没有任何单一模态能够完全描述物理世界的行为方式。

这家以开源权重FLUX.1图像生成模型闻名的德国公司正在进行重大的战略转型。FLUX 3并非一个更大的图像生成器,而是一个赌注,让模型能够渲染逼真波浪的相同底层表征,也能帮助机器人预测如何安装车门。

技术基础是Self-Flow,这是该实验室今年早些时候引入的一种训练方法,结合了流匹配目标和自监督特征重建。FLUX 3将此方法同时扩展到多种模态,该公司报告称,初步的人类偏好结果显示该模型全面超越竞争对手。在720p、10秒文本转视频片段(含音频)的正面比较中,评审者偏好FLUX 3的比例分别为:对比Luma Ray 3.2时为93%,对比Runway Gen-4.5时为77%,对比Grok Imagine Video时为69%。

核心能力是单次生成长达20秒的视频,并带有原生同步音频,对话、音效和环境噪音全部同时生成,而非后期叠加。该模型支持文本转视频、图像转视频、保持角色一致性的视频转视频、关键帧控制过渡、多语言对话,以及可将片段链接成更长的多镜头序列的智能体链式处理。Black Forest Labs特别强调在人类面部表情以及将声音与物理事件关联方面的优势,玻璃破碎的声音听起来像玻璃,因为模型已经学会了冲击与声学特征之间的因果关系。

Support journalism that values evidence, context, and accuracy above everything else.

Contribute today

视频生成消耗了模型训练计算力的95%以上。相比之下,音频仅占不到0.5%的token,这一数字突显了视觉主干就位后音频模态的附加成本之低。

名为FLUX-mimic的机器人组件复用了FLUX 3的视频预测引擎,并配备了一个轻量级解码器,可将预测帧转换为机器人动作序列。奥迪已经在测试该系统用于柔性车门密封条安装,这是一个开发团队表示难以通过传统编程实现自动化的软体操控任务。FLUX-mimic在单块RTX 5090上响应时间约为101毫秒,某些任务只需30分钟的机器人演示数据即可进行微调。

Black Forest Labs分阶段发布。视频和动作功能现已通过早期访问API和向选定合作伙伴提供私有权重访问。图像合成和编辑将在未来几周内推出。开源权重版本FLUX 3 Dev计划于2026年晚些时候发布,延续该实验室最终向社区发布模型权重的模式。

FLUX 3发出的更广泛信号关乎架构方向而非单一基准分数。通过将图像、视频、音频和机器人动作整合到一个主干网络中,Black Forest Labs认为通往通用视觉智能的最高效路径不是单独优化每种模态,而是在训练过程中迫使它们相互约束。这种统一方法在精心策划的演示之外是否成立,将在独立基准测试和开源权重版本于今年晚些时候推出时得到验证。

来源:FLUX 3 – Real World Models (Black Forest Labs,2026年7月23日);Black Forest Labs Unveils FLUX 3 (NYU Shanghai RITS,2026年7月24日);Black Forest Labs Releases FLUX 3 (MarkTechPost,2026年7月26日)

婷 翻译

Scroll to Top