无问芯穹与清华联合发布RLinf v0.3,打通具身智能强化学习全链路
无问芯穹联合清华大学发布RLinf v0.3,实现从数据采集到真机部署的完整闭环,新增六款模型及多项算法支持。
AI 编撰 · 内容基于所列来源,重要信息请以原文为准

无问芯穹与清华大学联合宣布,全球首个面向具身智能Embodied AI让 AI 通过机器人身体感知并作用于真实世界,不只在屏幕里回答问题。◆ 小白科普 · 现身持续进化的大规模强化学习一种 AI 训练方法:让机器人在亿万次「试错」中自己摸索,做对了就给奖励。机器人走稳路、跑酷空翻,大多是这么练出来的。◆ 小白科普 · 现身基础设施项目RLinf升级至v0.3版本。该版本首次完整打通数据采集为 AI 模型收集「教材」的过程。机器人行业主要靠人远程示范(遥操作)一条条录,或在仿真环境里批量生成。◆ 小白科普 · 现身、数据管理、监督微调(SFT)、强化学习(RL)、模型AI 模型的简称,指经过训练、能从输入算出输出的程序。机器人的模型输入画面和指令,输出动作。◆ 小白科普 · 现身评测及真机部署把机器人真正放到工作现场长期干活,而不只是在实验室演示。部署规模决定了数据回流和经验积累的速度。◆ 小白科普 · 现身等关键环节,形成从仿真在电脑里搭建虚拟世界来测试、训练机器人。成本低、速度快,但和真实世界总有差距。◆ 小白科普 · 现身训练到真实机器人长期进化的统一开发闭环。
RLinf v0.3围绕模型、算法、真机、仿真、系统五个维度全面升级。模型生态方面,新增Dexbotic DM0、DreamZero、GR00T-N1.6/N1.7等六款具身模型支持,其中DreamZero利用系统级加速取得近4倍吞吐提升。算法体系新增DSRL扩展至Pi0.5、RECAP训练流水线、SAC-Flow等真机强化学习算法,以及DAgger和HG-DAgger在线模仿学习。真机支持方面,新增空间鼠标、VR、GELLO三种遥操作Teleoperation由人在远端控制机器人完成动作,并把这些示范记录为训练数据。◆ 小白科普 · 现身方式,双臂Franka、GimArm、DOS-W1三个真机平台,以及Franka DexHand灵巧手Dexterous Hand安装在机械臂末端、可以完成多指抓握和精细操作的机器人手。◆ 小白科普 · 现身等末端执行器。仿真环境新增Genesis、Polaris、RoboVerse等五种仿真器支持。系统层面新增Reward Model、Value Model、SGLang推理服务化等组件,并全面支持昇腾、AMD ROCm、Musa等国产指原本依赖进口的零部件改由中国厂商生产。核心部件国产化,是这两年机器人大幅降价的最大推手。◆ 小白科普 · 现身及异构计算平台。
RLinf自开源把代码、数据集或硬件设计公开给所有人免费使用。机器人公司常用开源来换取开发者和科研生态的支持。◆ 小白科普 · 现身以来,已在GitHub获得4100+ Stars、600+ Forks、100+ Contributors,并被Isaac Lab官方收录为首个面向具身大模型的训练引擎。RLinf团队与NVIDIA合作的医疗器械组装任务在GTC 2026上展示,项目还荣获EAI-100年度十大突破奖。未来RLinf将坚持开源路线,持续提升易用性。