第二届世界人形机器人运动会 400 米(小型组)决赛,天工 Omni 以 45.66 秒的成绩夺冠。但让它出圈的,是那个捂脸狂奔的跑姿——网友说"神似章若楠"。

面对"是不是找个了小姑娘去模仿"的猜测,天工 Omni 400 米小型组研发团队负责人、运动控制算法专家韩刚用一句话让讨论换了方向:都是强化学习自己迭代出来的。
"一开始我们设计的是正常人百米跑步的模式,但这个机器人是在仿真里不断用数据迭代出来的。它在学的时候,可能就感觉捂脸跑比摆臂跑更舒服,"韩刚说,"所以这是它自己迭代出来的一个方式。"

技术层面的解释更关键:摆臂很快时肩部负载很重,会带来发热风险。捂脸跑恰好规避了这些,对速度也有一定提升。这个姿势不是工程师设计的,而是强化学习算法在"奖励最大化"的条件下自然收敛出来的最优解。
韩刚把训练过程比喻为教育小朋友:"在仿真里我们会有一些大的方向的引导,比如说速度、发热,但是具体怎么办,我们也不知道它会怎么样。通过奖励去驱动它,它自己去不断的尝试学习,不断的跌倒重来调整,最后发现这种姿势可以达到你的要求了,同时自己也舒服。"
他进一步解释,强化学习在机器人运动控制上的优势,已经超过了传统的模型方法——"以前我们会写方程,去规划它的每一个动作,去描述它的每一个状态。但实际很多场景下你是很难把它写清楚的。强化学习不需要这些,它都是基于数据驱动自己写出来的。"
关于跑姿像人类这件事,韩刚笑称:"只是它的身体结构和这样一个类型的人很像,所以跑出来的风格也就天然地跟小姑娘跑步一样。"
在一台机器人的一个姿态里,同时看到了强化学习的一个关键特性——有时它产出的解超越工程师的预期。但不是靠"智能",是靠几万次跌倒重来。
参考来源:https://weibo.com/7893641547/ReLQAn9dB