9月18日·星期五 10:00·来源:InfoQ

让 Agent 越用越强:AReaL 2.0 构建 Agent 在线强化学习闭环|QCon上海

香港科技大学助理教授袁彬航将在QCon上海站分享AReaL 2.0,一种面向Agent自演进的在线强化学习基础设施。针对Coding Agent等生产环境中交互轨迹和用户反馈难以转化为训练数据的问题,AReaL 2.0通过Agent轨迹协议、数据代理层和演进控制平面,将真实业务交互转化为可训练、可回放、可治理的数据,并采用微服务化Agent-Compute架构,无需重构原有Agent即可接入Online RL。在Hermes Agent和软件工程Agent场景中,该方案支持大规模并发环境、异步训练和持续优化,使Agent从一次性执行系统演进为持续学习系统。袁彬航指出,Online RL面临稳定性、Reward设计和多路径优化等挑战,需结合回放评估、灰度发布与版本回滚机制。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→