
智能体的学习
必须通过
与环境的持续交互
而非对静态数据的推断
清华大学电子工程系汪玉教授团队与清华大学具身智能与机器人研究院合作
致力构建支撑具身大模型
长期学习与持续优化的通用技术底座
推动具身智能
从“离线训练”迈向“在线进化”
RLinf: 面向具身智能的高灵活、可扩展大规模强化学习框架科技成果宣传片
实现具身智能持续进化闭环当前面临三大挑战:
“工作组件高度异构且执行流程复杂”
“仿真环境训练算力资源、系统效率受限”
“真实世界训练成本高”
RLinf提出了
全球首个面向具身智能持续进化的
大规模强化学习基础设施方案
在系统架构层面
提出宏到微流变换(M2Flow)
将上层算法逻辑与底层执行优化解耦

在仿真环境训练方面
提出新型混合式细粒度流水调度模式
实现最高2.43倍训练效率提升

在真实世界训练方面
首次提出统一硬件抽象层
将机器人硬件与计算硬件同层管理
实现“像使用GPU一样使用机器人”

RLinf已支持主流
8种具身大模型架构
10种强化学习算法
13种主流具身智能仿真环境
......

当前,RLinf作为重要基础工具
已被全球多所顶尖高校和研究机构认可
并全链条赋能产业落地

未来团队将持续推动具身智能向规模化、持续学习与长期进化发展
让机器人像计算资源统一管理
持续优化
征途长远 具身而行