8月26日·星期三 14:51·来源:InfoQ

535B 大模型“直播”训练三个月:代码、数据、Loss全公开,吴恩达公开力挺

斯坦福大学基础模型研究中心(CRFM)联合发起开放项目Marin,于近期启动总参数5350亿的MoE模型Marin 535B-A23B训练。该模型将处理18.75万亿Token,其中80%用于预训练,20%用于中期训练,运行在11套NVIDIA GB200 NVL72系统上,预计耗时约3个月,总算力约2.7×10²⁴ FLOPs。项目旨在探索基础模型能否像开源软件一样公开研究,通过GitHub Issue声明实验、以Pull Request提交配置,并公开训练曲线、数据配方及W&B指标,记录成功与失败过程。此前Marin已训练过8B和32B模型。该模型采用共享专家与路由专家并存设计,每层激活8个路由专家和2个共享专家,实际每Token激活参数约230亿。团队曾面临长上下文导致Token丢弃率上升的问题,故以4K上下文启动预训练,并测试新型专家并行方案将丢弃率降至约3%。吴恩达转发相关消息,称其为捍卫AI开放性的珍贵示范。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→