小米机器人-1:突破数据壁垒的无实体预训练
突破数据壁垒:通过无具身预训练实现机器人策略模型规模化
在语言和视觉领域,基础模型凭借实证缩放定律不断拓展能力边界——模型性能与数据量、参数规模、算力投入直接相关。但机器人领域却迟迟未能跟上这一步伐。大规模高质量数据的匮乏,成为限制机器人策略模型规模化的核心瓶颈,真正经大规模训练的机器人能达成何种能力,此前一直是悬而未决的问题。我们的研究正是为解答这一问题迈出的关键一步:Xiaomi-Robotics-1 采用大规模无具身(UMI)预训练,再结合少量真实机器人数据完成后训练,系统性探索了模型规模化后的表现。
数据支撑
Xiaomi-Robotics-1 的所有能力均以数据为根基。预训练阶段,我们采用10万小时的无具身(UMI)轨迹数据,覆盖家庭、商业场所、工业场地、户外空间等1700余种场景,包含各类任务。为此我们搭建了可规模化的自动标注流水线:先将轨迹分割为固定时长片段,再为每个片段标注描述场景状态变化的文本说明。

后训练阶段,我们采用跨具身数据集,涵盖自研机器人数据、筛选后的开源机器人数据,以及一批高质量UMI数据。其中自研真实机器人数据时长超7200小时,均采集自真实家庭场景,包含整理沙发、整理鞋柜、收纳厨具等任务。这批UMI数据采用人工标注,按时间分段并附上指令提示,与预训练阶段自动生成的状态变化描述标注形式不同。

技术方法
借鉴大语言模型(LLM)的训练范式,Xiaomi-Robotics-1 的训练分为预训练与后训练两个阶段:第一阶段通过大规模UMI数据学习通用动作生成表征;第二阶段则将模型与真实机器人具身特性、指令跟随能力对齐。
预训练:追求广度覆盖
预训练的核心是让模型尽可能接触真实世界的多样场景。我们采用前文所述的无具身UMI数据,覆盖广泛环境与任务。如此规模的数据,人工标注完全不可行,因此我们基于强大的视觉语言模型(VLM)搭建了自动标注流水线:先将长视频切割为固定时长片段,再由VLM描述每个片段中机械臂及交互对象的状态变化。最终形成大规模真实世界操作轨迹语料库,每条轨迹都配有精准文本标注,让模型学习如何生成动作,推动场景向文本描述的状态转变。
一个令人振奋的发现是,预训练呈现清晰的缩放规律:随着数据量和模型规模增长,验证集动作误差持续稳定下降。

后训练:实现双向对齐
后训练的目标是将预训练获得的强大动作生成能力,从两个维度与真实机器人对齐:具身对齐借助高质量跨具身真实机器人数据,将通用动作生成能力映射到实体机器人;指令对齐则让模型从“根据场景状态变化描述生成动作”,转变为“直接理解自然语言指令并执行”。
完成后训练后,Xiaomi-Robotics-1 可直接部署到真实场景,完成各类移动操作任务。我们在未知环境、未知物体实例中对后训练模型进行测试,验证预训练阶段的缩放规律能否迁移到真实机器人的实际表现中。
测试结果给出了肯定答案:随着预训练数据量和模型规模提升,真实机器人任务成功率持续稳定增长。也就是说,预训练模型越强,真实机器人的表现就越好。而且这种缩放收益尚未出现饱和迹象:预训练阶段的数据量越大、模型规模越高,后训练后的真实机器人成功率就越高。

应用场景
后训练完成后,Xiaomi-Robotics-1 可作为性能强劲的机器人基础模型,支撑各类下游应用。我们在两类互补的下游场景中对其进行了验证:高效适配新任务,即仅用每任务数小时的数据,就能让模型掌握全新的复杂真实机器人任务;仿真基准测试,即在主流泛化能力测试套件中验证其性能。
高效适配新任务
Xiaomi-Robotics-1 具备极高的数据学习效率,仅需每任务数小时的真实机器人演示,就能掌握手机包装、打印机加墨、装载洗衣物、装箱等任务。当每任务演示时长平均不足10小时时,整体任务成功率已达75%,是同数据量下π0.5基准模型(40%)的近两倍;将演示时长提升至平均不足40小时,整体成功率进一步升至85%。
| 任务 | 平均<10小时/任务 | 平均<40小时/任务 | ||
|---|---|---|---|---|
| XR-1(自研) | π 0.5 | XR-1(自研) | π 0.5 | |
| 手机包装 | 70 | 30 | 80 | 40 |
| 打印机加墨 | 70 | 20 | 60 | 20 |
| 装载洗衣物 | 80 | 40 | 100 | 50 |
| 装箱 | 80 | 70 | 100 | 100 |
| 整体平均 | 75 | 40 | 85 | 53 |
新任务高效学习能力测试。表格中数值为任务成功率(%),数值越高性能越好。XR-1 = Xiaomi-Robotics-1。
仿真基准测试
我们在4个主流仿真基准测试中验证Xiaomi-Robotics-1的性能,结果显示它在所有测试中均取得当前最优(state-of-the-art)成绩。下表列出了平均成功率及相较于第二名的相对提升幅度,证明Xiaomi-Robotics-1的泛化能力与缩放收益,在标准仿真测试中同样成立。
| 基准测试 | XR-1(自研) | 第二名 | 相对提升 |
|---|---|---|---|
| RoboCasa | 74.5 | 72.6 | +2.6% |
| RoboCasa365 | 57.4 | 46.6 | +23.2% |
| VLABench | 59.1 | 53.2 | +11.1% |
| RoboDojo | 13.93 | 8.80 | +58.3% |
仿真测试结果。所有基准测试均报告平均成功率(%)。XR-1 = Xiaomi-Robotics-1;相对提升 = (XR-1得分 − 第二名得分) / 第二名得分。数值越高性能越好。


研究结论
Xiaomi-Robotics-1 为机器人基础模型的规模化发展提供了可行路径:大规模无具身UMI预训练打破了机器人领域的数据瓶颈,而真实机器人数据与指令对齐则将通用能力迁移到实体机器人。研究结果表明,预训练阶段模型性能随数据量和模型规模呈现清晰的缩放规律,且这种规律可直接延续到后训练阶段——预训练模型越强,后训练后的模型在未知真实环境中就能表现出越好的开箱即用性能。最终得到的基础模型仅需少量数据就能适配新任务,且在4项侧重泛化能力的高难度仿真基准测试中均取得当前最优成绩。
最后,附上一段行李打包任务的完整无剪辑演示视频。
引用格式
@article{guo2026xiaomi,
title={Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories},
author={Guo, Jun and Jin, Piaopiao and Li, Jason and Li, Peiyan and Li, Yingyan and Liu, Futeng and Peng, Wanli, and Qin, Optimus and Su, Yifei and Sun, Nan and others},
journal={arXiv preprint arXiv:2607.15330},
year={2026}
}