9月5日·星期六 17:00·来源:InfoQ

RTX 4060 跑 35B 模型,每秒 39 Token?伯克利、MIT 联手开源 FreeToken

加州大学伯克利分校与麻省理工学院研究人员联合推出开源推理引擎FreeToken,旨在弥合前沿混合专家(MoE)模型与消费级硬件间的性能差距。该项目共同作者包括Databricks联合创始人Matei Zaharia和Ion Stoica等。 FreeToken采用名为q*策略的动态协同调度方案,替代传统静态专家卸载机制。当GPU发生缓存未命中时,系统会根据实时互连吞吐量,在CPU核心与GPU张量核心间分配计算任务,并利用快速权重格式与整层双缓冲实现权重传输与计算层执行完全重叠。其弹性内存管理器可在运行期间动态调整KV缓存与专家槽位间的显存分配。 该引擎还集成了语义锚点检查点机制,在逻辑任务边界缓存中间状态,使智能体修改工具参数或插入执行结果时无需整体失效提示词缓存。基准测试显示,FreeToken在配备8GB显存RTX 4060的笔记本上运行Qwen3.6-35B模型,速度约每秒39个Token;在RTX 5090台式机上可运行284B参数模型。相比Ollama和llama.cpp,其解码速度快3至4倍,预填充速度快6至30倍。目前支持Linux和Windows系统上的NVIDIA RTX 30至50系列GPU,用户可通过FlashML.ai及GitHub获取工具。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→