9月16日·星期三 11:07·来源:量子位

把记忆交给CPU,大模型会变快

量子位报道,随着Coding Agent等长任务普及,KV Cache显存占用成为大模型推理瓶颈。以Qwen3-8B为例,每个Token的KV缓存约147KB,百万上下文对应约147GB。若按300万日活、每人10次请求估算,日累计KV数据规模可达数千PB。显存不足时缓存被清,后续需重算Prefill,推高首Token延迟。业界思路是“以存代算”,将不活跃缓存从GPU HBM分层卸载至CPU DDR内存、SSD及远端存储,由CPU统一调度管理,从而释放显存服务更多并发请求。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(量子位)→