如何从历史中学习?基于RhymeRL的强化学习系统优化实践|QCon上海
上海交通大学副教授杜冬冬将在2026年QCon上海站“AI Infra”专题分享RhymeRL强化学习系统优化实践。他指出,LLM强化学习中Rollout占训练耗时84%至91%,批内长尾导致最早完成的GPU约76%时间空闲。研究发现相邻epoch存在大量可匹配token,据此提出RhymeRL,结合历史推测解码与长度调度,采用离线后缀树、奖励感知选枝、动态窗口、奇偶步互补及尾部迁移等设计,解决在线索引开销与长样本失衡问题,端到端吞吐最高提升至基线2.6倍。该方案不依赖额外小模型,当前主要面向math和code场景。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→
