具身智能成果系列展 | 端到端视觉 运动耦合的具身人形机器人算法框架

CD38

具身智能的真实能力

源于机器人与真实环境的动态交互

源于视觉感知与肢体运动的实时协同

而非仿真环境下的理想化拟合


清华大学自动化系赵明国研究员团队

依托清华大学具身智能与机器人研究院

具身智能系统北京市重点实验室

构建端到端视觉运动耦合的人形机器人强化学习框架

让无外接供电、无远程算力的人形机器人

具备真实赛场级的全自主敏捷运动能力

推动人形机器人足球技能

从“仿真复刻”

迈向“真实对抗实时反应”

端到端视觉 运动耦合的具身人形机器人算法框架成果宣传片


人形机器人动态足球交互

当前存在三大核心技术瓶颈

- “感知延迟、反馈缺失,导致动作连贯性不足”

-“仿真训练双目标竞争,易陷入局部最优、泛化性弱”

-“真实场景感知噪声复杂,仿真与真机落地差距大”

本框架搭建统一强化学习架构

实现视觉感知与全身运动控制的端到端耦合

引入对抗性运动先验与虚拟感知建模

同时解决感知不可靠、运动不自然、动态响应慢三重难题


在真实RoboCup赛场环境中

相较传统规则式控制方案

球位估计误差降低46%

踢球响应时间最高缩短64%

前场自主踢球成功率稳定达90%

具备极强的环境鲁棒性与动态适配能力

该技术方案成为全球机器人足球训练标准范式

超半数国际参赛队伍、四强团队均基于该框架迭代策略

同时完成商用机器人平台规模化部署

被RoboCup联合会

纳入官方标准支撑平台

全面赋能国际赛事、科研创新与科创教育

未来

团队将持续迭代

端到端视觉运动耦合技术体系

持续提升人形机器人

动态敏捷性、对抗稳定性与自主学习能力

推动人形机器人运动性能逼近、超越人类运动员水平

筑牢通用具身智能落地的核心运动控制底座


征途长远 具身而行