Reed's News
← 返回精选

FLUX 3与Mimic合作:新一代视频-动作模型

AI 59 kensai 2026/7/24 2047 字 原文 ↗

FLUX 3 x mimic:下一代视频-动作模型

我们全新的多模态基础模型FLUX 3的早期版本已在机器人上运行。我们向mimic robotics开放了FLUX 3的早期权限。凭借他们在机器人学习与部署领域的优势,结合FLUX 3的世界知识与Black Forest Labs(BFL)的基础模型技术实力,双方合作打造出FLUX-mimic——下一代视频-动作模型。

FLUX系列演进

FLUX 1与FLUX 2专注于图像生成,FLUX 3则拓展至多模态领域,可联合生成音视频内容,同时为FLUX-mimic奠定基础。这款与mimic合作开发的视频-动作模型,已在奥迪的机器人上完成测试与部署。

乍看之下,生成逼真视觉内容与操控机器人似乎毫无关联:前者是像素生成,后者需要理解物理世界在触碰、操作下的反应逻辑。但如果一个模型能同时完成这两项任务,那它从本质上就不只是内容生成模型,而是一套世界运行规律的模型,内容生成只是其应用场景之一。

FLUX 3正是这样的模型。

视频是核心难点

FLUX 3从训练之初就统一学习图像、视频与音频数据,是一个一体化模型。其中最具挑战性的环节是视频预测,其计算成本占总投入的95%以上。要生成真实感强的视频,模型必须精准掌握接触、运动、重量、因果关系等物理规律——任何一项出错,视频效果都会失真。学会精准还原世界的视觉呈现,本质就是理解世界的运行逻辑。

相比之下,音频是难度较低的模态。720p带音频的视频中,音频的token占比不足0.5%,维度低、细节量远少于视频。一旦模型掌握了视频理解的核心能力,就能轻松学习视频与音频的因果关联,实现唇形同步的语音预测,以及与物理事件匹配的音效生成。

动作预测的逻辑与此类似:机器人状态是低维度表征,与视觉观测紧密耦合。动作、音频、视频帧,都是同一底层物理现实的局部呈现。模型掌握了视频与音频背后的物理规律后,动作预测并非全新领域,而是对其已建模的现实世界的又一种解读视角。

单一骨干架构

如果上述逻辑成立,那么让FLUX 3学习动作预测不应带来永久性性能损耗:模型只需经历一段短暂的适应期,学习动作空间的结构并调整内部世界表征与之对齐,之后就能恢复原有性能。我们的实验结果完全印证了这一点。

在大规模训练中,我们将动作预测加入训练任务,观察其对视频生成质量的影响。初期,随着模型开始整合新的动作模态,文本转视频、图像转视频的人工评分最多下降10%。但经过3500步训练后,模型不仅恢复了此前的视频生成水平,还同时具备了动作预测能力。

每条曲线均以加入动作预测前的自身质量为基准归一化,数值越高表现越好。

模型需要将动作整合到输入输出体系中,但这并未永久占用其算力,只是需要学习新模态与现有世界模型的关联方式。一旦完成适配,原有能力的性能损耗便完全消失。视频生成与动作预测无需各自独立的基础架构,同一骨干模型即可支撑两者。

这意味着物理AI(Physical AI)是Black Forest Labs发展路线的自然延伸,而非方向转变:多模态FLUX 3骨干模型处理图像、视频、音频时,实现的是内容创作;处理动作时,实现的就是物理AI。一个以视觉智能为核心的基础模型,支撑起两大应用领域。我们没有单独构建物理AI基础模型,而是聚焦于更核心的目标:打造一个能理解世界的模型,而在物理世界中行动,正是这种理解能力的必然结果。

从实验室到现实场景:FLUX-mimic

当FLUX 3骨干模型应用于真实生产线的自动化任务时,会产生怎样的效果?

带着这个问题,mimic与BFL合作打造了FLUX-mimic。mimic拥有自主机器人研发能力,在机器人学习、灵巧操作与量产部署方面经验丰富;BFL则专注于视觉基础模型,具备多模态训练与建模技术优势。双方携手构建了一款面向通用操作的下一代模型——它适配工业需求,并已集成到mimic的全栈部署系统中。FLUX-mimic是基于FLUX 3骨干架构打造的视频-动作模型。

解码已学习的世界模型

我们的核心假设是:FLUX 3要生成视频,必须先学习并构建一个内部世界模型。FLUX-mimic正是基于这一假设,从FLUX骨干模型的世界表征中解码出动作指令。这种方法由mimic-video首创:在FLUX视频预测路径提取的中间特征之上,训练一个轻量级动作解码器。

FLUX-mimic基于FLUX 3的架构示意图

该方法的成功取决于两个相关但不同的因素:一是FLUX学习到的世界模型质量,二是该世界模型的特征表征质量。世界模型质量直接关联生成效果:如果模型无法理解世界运行规律,就无法进行精准模拟。但即便拥有最优世界模型,若其特征空间无法被有效访问——比如模态间的因果关系被非线性纠缠——那么从特征表征中理解这些关系,难度就和从原始输入中学习一样大。因此,特征表征质量至关重要。

长期以来,生成质量与表征质量的研究是相互独立的。生成式方法能打造高质量世界模型以支持模拟,且遵循算力投入与回报可预测的缩放定律。但相较于专门的表征学习方法,生成式模型的特征解耦程度较低,这限制了其在需要深度理解世界的任务中的实用性。

由于生成式模型自身依赖内部特征,这种表征质量的差异看似违背直觉:优化生成式模型的内部表征,理应同时提升世界模型质量与下游任务适配性。在我们的Self-Flow研究中,我们证明了可在单一框架内统一生成与表征学习,并观察到了这种双向提升效果:一方面,视频、图像、音频的生成质量(即世界模型质量)得到改善;另一方面,模拟环境中机器人控制任务的成功率(即表征质量)也有所提升。

Self-Flow与Flow Matching(FM)对比。左图:各模态生成误差(Fréchet距离),均以FM=100为基准归一化,数值越低表现越好。右图:微调后四类操作任务的平均成功率,数值越高表现越好。

世界模型的规模化

Self-Flow遵循缩放定律,而FLUX 3正是其规模化应用版本。它从训练初期就基于数千万小时的通用视频数据,尽可能广泛地学习世界动态规律;同时还使用了数十万小时聚焦于人类与机器人操作的视频数据,为成为视觉智能骨干模型做好准备。这种规模化让Self-Flow的实验室成果得以落地。mimic已将FLUX-mimic部署到真实工厂场景中,覆盖生产与物流的日常任务:将零件装入规整托盘、把电子控制单元插入精密夹具、组装组件,以及处理密封件、线缆等传统自动化设备无法操作的柔性材料。

基准测试显示,即使FLUX骨干模型完全冻结,FLUX-mimic的动作解码器性能仍优于此前的视觉-语言-动作模型——而在这种设置下,传统模型通常无法正常工作。这凸显了规模化训练赋予我们骨干模型的强大世界认知与行动决策能力,以及Self-Flow如何让这些知识能从骨干模型的特征表征中轻松解码。当骨干模型与动作解码器联合微调时,FLUX-mimic的成功率达到了当前业界顶尖水平。

虚线代表各模型在20次自主测试中的中位成功率,数值越高表现越好。

从世界知识到落地任务

一个能以可解码形式输出世界知识的骨干模型,彻底改变了机器人学习新任务的方式。如果物理规律已内嵌于模型表征且易于访问,那么适配新任务就无需再教模型理解世界运行逻辑,只需让它学习如何将特定任务映射到已掌握的知识上。最耗费成本的学习环节,在机器人实际移动前就已完成。

这直接体现在新任务所需的演示数据量上。在Self-Flow实验中,相较于未采用Self-Flow的视频模型,动作预测达到指定成功率所需的训练步数减少了一半——更优质的表征让世界知识更易提取,因此达到同等能力所需的数据更少。mimic-video的论文显示,视频-动作模型的样本效率比视觉-语言-动作模型高出10倍;FLUX-mimic则结合了这两种优势。

这种优势还体现在机器人的行为上:FLUX-mimic可自然从失误中恢复,比如抓取失败后会自动调整、重新抓取并完成任务。没有任何演示数据集能覆盖任务可能出现的所有失误场景,这种从未被演示过的恢复能力,正源于模型对世界运行规律的固有认知。

上图为骨干模型预测的未来场景,下图为机器人根据解码动作执行的实际过程。

速度满足实时动作需求

真实场景部署有一项硬性要求:模型的反应速度必须匹配世界的变化速度。FLUX-mimic的主要计算成本来自骨干模型,它是整个模型中体量最大的部分。在mimic优化后的部署栈中,骨干模型的延迟直接决定了整个系统的性能上限。

这正是我们的方法论再次发挥优势的地方:更优质的表征意味着单位参数具备更强能力——一个掌握了结构化世界模型的模型,达到指定性能所需的算力规模,远低于未掌握该模型的系统。对于部署而言,这直接意味着可以使用更小体量的骨干模型,而模型越小,运行速度就越快。

100万步训练后的CLIP评分,数值越高表现越好。骨干模型的深度是部署延迟的主导因素,层数越少模型速度越快。

因此,FLUX-mimic的骨干模型可被优化为:在单块NVIDIA RTX 5090 GPU上,从输入到生成世界表征的耗时不到80毫秒,与人类视觉反应速度处于同一数量级。

真实场景部署还需要对整个栈进行额外优化,以避免任何额外延迟:mimic的优化覆盖多个环节,从动作解码器,到传感器、模型与执行器间的进程间延迟削减,再到实时分块处理,让预测与执行过程重叠,确保机器人运行流畅无卡顿。最终实现的独立机器人系统,反应时间仅为101毫秒。

走进工厂车间

所有技术研发最终都要回到自动化真正发挥价值的地方:工厂。奥迪拥有汽车行业最自动化的生产网络之一,对传统自动化的局限有着清晰认知。尽管投入了数十年的机器人研发,涉及柔性零件与精细操作的任务仍依赖人工,主要原因在于经济成本:高端生产的产品种类繁多,传统编程机器人单元针对每种场景重新设计的成本过高。而基于学习的系统改变了这一成本逻辑。

“通过与mimic合作,奥迪已对FLUX-mimic进行测试与部署。我们看到这些机器人能够完成传统机器人根本无法实现的复杂柔性物体操作任务。这对协助员工工作、提升效率、拓展生产与物流环节的柔性自动化水平具有重大意义。对我们而言,与mimic和Black Forest Labs这样的先锋企业合作,是推动物理AI前沿发展、在真实生产环境中验证创新技术的关键。”——克里斯托弗·施耐德(Christoph Schneider),奥迪生产实验室

结语

FLUX-mimic是一款专为机器人打造的模型,同时也是未来技术方向的有力证明。它的样本效率与鲁棒性,源于FLUX 3骨干模型及其提供的高质量表征,而非针对特定任务的工程优化。这正是该方法能够跨任务、跨行业、跨硬件迁移的核心原因。如需了解更多内容,可访问mimic官网

一个以视觉智能为核心的模型,既能生成图像、视频与音频,又能驱动生产线上的机器人。内容创作与物理AI,是同一个基础模型的两大应用场景。