9月4日·星期五 17:19·来源:量子位

机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理

星尘智能基座模型团队发布异步在线强化学习框架SmoothRL,解决大模型异步推理下机器人动作序列与真实执行不一致的问题。该框架将动作序列划分为已提交、执行和丢弃三个区域,仅对机器人实际执行的动作进行梯度更新,并让训练与部署遵循同一异步节奏。 团队在绳驱机器人S1上完成三项真机测试:动态投掷成功率从39%升至94%,给笔戴帽从8%升至83%,快递开箱从30%升至90%。实验显示,在线学习能修正基础策略的系统性偏差,如投掷速度调节不准、刀片左偏等,同时降低末端执行器加速度波动。SmoothRL首次将异步在线强化学习应用于真实高动态投掷任务,验证了该方法在连续加速、精确释放等场景中的有效性。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(量子位)→