8月28日·星期五 16:54·来源:InfoQ

Token消耗减少75%,千问办公创造了新的“省钱模式”

阿里千问团队于8月26日发布多模态MoE模型Qwen3.8-Flash并同步开源权重版本。该模型主参数量125B,额外集成51B N-gram Embedding,每个Token仅激活6B参数,输入与输出价格分别为每百万Tokens 0.8元和2.7元。同期,千问办公上线标准模式,单任务生成速度提升约100%,Token消耗平均减少75%,并宣称可覆盖约95%日常任务。该模式通过模型与Agent双向协同,采用GDN与Attention混合架构及Qwen Sparse Attention技术,在1M上下文下实现Prefill和Decode阶段最高7.6倍与4.9倍加速。实测显示,标准模式在周报整理、网页生成等任务中完成度接近高级模式,但积分消耗从两位数降至零点几。千问办公将模型档位从三档收拢为标准与高级两档,旨在降低用户使用成本与决策门槛。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→