参数几乎翻倍,推理反而更省:DeepSeek V4.1-Flash 重构 KV Cache
DeepSeek 发布原生多模态 MoE 模型 DeepSeek-V4.1-Flash,支持 100 万 Token 上下文。模型主干参数 552B,另有 196B Engram 条件记忆参数,Prefill 阶段每 Token 仅激活 8B,Decode 阶段激活 16B;上一代 V4-Flash 主干为 284B,每 Token 激活 13B。架构上,40 层语言主干拆分为 20 层因果编码器与 20 层解码器,前两层用滑动窗口注意力,其余采用压缩稀疏注意力 CSA2,并引入跨层 KV 共享与分层稀疏索引器。Global KV Cache 经 FP4 量化后压缩至约 890 Byte/Token,约为上代四分之一。官方称上下文从 4K 扩至 1M 时,单 Token Decode FLOPs 仅增约 25%,Prefill 计算量接近减半。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→
