这个世界模型训练完就“退场”,机器人反而更能干了
光象科技联合清华大学发布物理原生世界模型Phi-WM 1.0 ActEffect。该模型仅在训练阶段使用,用于评估机器人动作后果并将反馈用于策略优化,训练完成后即退出部署链路,执行任务时无需额外推理。在LIBERO基准上平均成功率达98.8%,在加入分布偏移的LIBERO-PLUS上为80.3%,在29维动作空间的RoboCasa-GR1上为67.5%。技术核心在于让策略生成前馈、粗提案、精修三版完整动作,由受控世界模型预测各自后果,并与真实未来比较以优化排序。该方法可降低工业部署中的时延与算力成本,已应用于汽车制造中的焊接上下料与移动质检等场景。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(量子位)→
