在线蒸馏灵活却太慢,离线缓存高效却不够灵活,LinkedIn 如何取舍?
LinkedIn 公布其 AI 职位搜索的训练基础设施,核心是一条多教师蒸馏流水线,将大型教师模型知识压缩至 6 亿参数排序模型。系统基于 SGLang 构建定制框架,可直接在训练循环中服务教师模型,支持张量并行与数据并行配置。在线模式下异步客户端实时查询教师模型,多节点部署使蒸馏提速 3 倍;离线模式则预先计算教师输出并存储于 HDFS 或 NFS,避免重复计算。训练层还采用 LiGer、FSDP2、多节点数据并行及 H200 集群等优化,整体训练速度提升约 8 倍。该 6 亿参数学生模型的知识来自 80 亿参数相关性教师与 17 亿参数互动教师,将职位搜索 NDCG@10 从 0.7583 提升至 0.9432,推理侧结合结构化剪枝与上下文压缩,单 GPU 排序吞吐量从约 290 条/秒增至 2000 条以上。系统已投入生产,支持美国用户自然语言职位搜索。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→
