1000个机器人训练场景,1700种物体,10万小时。
2026年8月5日,小米技术官微发了一条帖子:自研的具身基座模型 Xiaomi-Robotics-1 正式开源。这不是一个为了PR放出来的半成品——它在4个主流机器人操作benchmark上干掉了Pi0、Gemma3、Qwen2.5-VL,其中RoboDojo高了58.3%,VLABench高出第二名11.1个百分点。
说它是"家底"级别的开源,不过分。

两条腿走路
XR-1的训练范式非常清晰:两阶段,大语言模型式的预训练+后训练。
第一阶段,预训练。数据从哪来?1700多个场景的UMI轨迹数据。UMI(Universal Manipulation Interface)是一种数据采集范式,通过手持设备在不同环境中收集人类操作轨迹,然后映射到机器人动作空间。XR-1用了超过10万小时的此类数据做预训练。这步的目标不是让模型能干活,而是让模型见过足够多的操作场景,形成对物理交互的基本认知——类比语言模型的"读尽天下文章"阶段。这个预训练数据量是目前开源VLA模型里最大的。
第二阶段,后训练。7200小时以上的真机数据——这是在CyberDog和CyberOne上实际跑出来的。真机数据的存在意味着模型已经过了从仿真到真实的迁移这道坎。同时训练中做了视觉生成增强,加入MiMo预测头来提升空间推理能力。

两阶段设计有一个功利但务实的优势:当你需要适配新机器人本体时,不需要从头训练。给不到10小时的新本体数据,XR-1在未见过的任务上就能达到75%成功率——对比Pi0.5在同等条件下的40%。给到40小时以内,XR-1拉到85%,Pi0.5还在53%。这对实际落地意味着换一个机器人型号不需要重新投入一个训练团队。

参数规模的选择
XR-1总参数50亿。不算大。
2026年的VLA模型赛道上有更大的玩家——OpenAI的π0.5、Google的RT-2-X都不是小模型。但XR-1的选择是5B的VLA架构,视觉编码器用了SigLIP2-400M和Gemma3-12B的集成方案,动作解码器是diffusion-based head。
5B这个数字的背后逻辑值得琢磨。具身智能和语言模型不同,推理延迟不是nice-to-have,是hard constraint——一个抓取任务延迟超过200毫秒,物理世界的反馈回路就会出问题。更大的模型意味着更慢的推理速度、更高的硬件门槛、更难部署到实际机器人本体上。小米在官方技术博客里没有展开讨论这个选择,但从开源策略来看,5B模型可以直接跑在单张消费级GPU上,这对于社区复现和实际部署意味着门槛大幅降低。
目前小米已在HuggingFace上提供了5个模型仓库,全部采用Apache 2.0协议,包括预训练权重、后训练权重、视觉编码器等完整组件。评估代码、训练pipeline、技术报告也都公开了。技术论文放在arXiv(2607.15330)。
参考来源: