Meta 拓展自研芯片战略:从计算领域延伸至网络领域
Meta发布自研AI加速器MTIA 300,专为排序与推荐模型训练设计。与传统GPU不同,此类模型通信开销大于算力需求,因嵌入表参数占比超99%,训练时频繁产生集合通信操作。MTIA 300将网络接口集成至芯片封装,配备两个网络芯粒及12个定制800Gbps RDMA网卡,提供1.2TB/s总I/O带宽,支持机架内外扩展。其另设16个专用消息引擎,独立于计算网格处理通信,避免资源争用,使矩阵运算与集合通信并发时计算吞吐量下降不足0.5%,而对比GPU架构损耗超20%。该硬件与Meta集合通信库HCCL协同设计,将通信操作编译为子图自主执行,减少主机CPU干预。生产测试中,单机架通信带宽最高达940GB/s;针对1500亿参数模型,总通信耗时较GPU集群降低3.9倍。Meta已部署数十万MTIA用于推理,计划两年内推出四代产品,覆盖推荐与生成式AI,并扩大与博通合作,同时继续采购AMD、英伟达芯片,采取组合策略。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→
