花几十秒给人示范一个动作,人要练很多次。但对机器人,一次就够了。
今天,自变量机器人(X SQUARE ROBOT)联合北京理工大学、清华大学发布了 HOST 框架(Human-to-robot One-Shot Skill AcquisiTion),论文、代码、权重全部开源。
HOST 做的事情很直接:给机器人看一段人类操作视频,29 秒后,它就能在真实世界中复现这个技能。不需要训练数据采集,不需要微调,不需要更新参数。

听起来像 magic,但数字比口号更有说服力。在 8 个全新任务(训练数据中从未出现)的 20 次随机测试中,HOST 平均成功率 62%。作为对比,Vid2Robot 和 AWDA 分别只有 15% 和 19%,π0.5 和 Wall-OSS 分别是 9% 和 17%。HOST 的 baseline 变体(去掉视频耦合预测)更是只有 4%。比最强的零样本基线高了 43 个百分点。
时间和数据效率是另一个维度的优势。HOST 从单条人类视频中获取技能,耗时约 29 秒。用 π0.5 做 SFT 微调达到相近效果,需要 10-50 条遥操作演示和 2.5-4.9 小时的训练时间。数据量差 50 倍,时间差 507 倍。
传统机器人技能学习的范式是"训练时循环"——采集数据、训练、部署、发现不足、再采集、再训练。每次教新技能,旧技能就可能被覆盖(灾难性遗忘)。HOST 在学完 50 个新任务后,对已掌握 7 个任务的性能保留率是 99%。而 π0.5 + SFT 在同样条件下只保留 43%,Wall-OSS + SFT 保留 45%。HOST 甚至在学更多新技能后,旧技能表现反而上升了——从 70% 涨到 80%。
HOST 是怎么做到的?
核心理念来自认知科学中的"观察学习"——人类面对不熟悉任务时,不需要长期练习,而是先在脑中模拟动作的预期效果,再执行。HOST 把这一思路工程化落地:不是把人类动作翻译成机器人动作然后模仿,而是让机器人先预测"做完之后应该是什么样子",再从目标状态反推要执行的动作。

具体来说,HOST 包含一个级联策略模型,采用双专家 MoT(Mixture of Transformers)架构。"视觉大脑"(视频专家)负责处理视频画面、定位任务进度、预测未来图景;"动作大脑"(动作专家)负责将预测图景转化为机器人可执行的动作序列。
时序对齐是另一个关键问题。同样工作 10 秒,视频里的人可能已经切完菜开始炒菜了,机器人还在切菜。HOST 的解决方案是:将视频每一帧和机器人操作每一步都映射到同一向量空间,然后用动态时间规整(DTW)自动对齐"人类视频第 X 帧"和"机器人操作第 Y 步"。这将对齐误差降低了一个数量级。
训练分两阶段。第一阶段是"同体预训练"——机器人看自己的操作视频,学会预测完成后的状态并生成对应动作。第二阶段是"人机视频训练"——机器人学习人类演示视频,将人类操作过程转化为机器人视角下的任务结果,再根据目标结果推理所需动作。
在鲁棒性测试中,HOST 在光照变化、更换物体、替换场景、人为干扰等四种扰动下,成功率只下降了 1-9 个百分点,保持了 53%-61% 的成功率。
HOST 的论文已在 arXiv 公开(2607.20033),代码和模型权重在 GitHub 和 Hugging Face 上可获取。团队来自北京理工大学、自变量机器人和清华大学,项目负责人是 Guangyan Chen 和 Yufeng Yue。
自变量机器人此前已完成多轮大额融资,投资方包括小米战投、红杉中国、字节跳动、美团战投、阿里云等。HOST 是他们在具身智能基础能力上的一次关键技术输出。
参考来源: