7名博士生仅用3个月从零训练7B大模型:代码+数据+训练日志全公开
北京中关村学院7名博士生用3个月从零训练出7B模型ZGCM-1,并公开数据配方、权重、代码、checkpoint和训练日志。该模型在通用评测中与Qwen3-8B相近,部分数学推理和搜索评测可对标更大规模模型。团队组建数百个Agent分别负责数据、实验、评测等环节,实践AI4AI研发范式,并对11类任务的Agent自主性做L1至L5评级:实验监控和部署达L4,架构与算法设计仍为L2。训练中曾遇loss下降但能力退步,追查发现是数据分片和shuffle异常,随后建立ACE评测体系,将能力拆为18类183项、2503个探针。技术上采用局部与全局注意力结合,上下文从16K扩至256K,吞吐提升约3.94倍,KV Cache降至约六分之一,并结合Muon、FP8等,预训练效率较BF16/AdamW基线提高约4.2倍。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(量子位)→
