9月9日·星期三 16:30·来源:InfoQ

Shopify 推出 Gisting 新技术:将大模型系统提示词压缩为主旨词元

Shopify工程团队推出新技术Gisting,用于压缩大模型冗长提示词,将其转化为精简的Gist词元集合,以提升推理吞吐量并降低成本。该技术在不修改模型核心权重的前提下,将Sidekick GraphQL智能体的系统提示词从约6000词元压缩至1500词元,实现4比1压缩比。实测数据显示,在每分钟350次请求负载下,首词元时间中位数由438毫秒降至354毫秒,端到端延迟由6.8秒降至4.2秒,吞吐量从20.2 QPS提升至23.4 QPS,由此减少了所需分配的GPU数量。 Gisting源自2022年一篇论文,通过教师-学生两阶段流程训练压缩词元嵌入,使模型行为接近读取完整提示词时的表现。推理时无需自定义注意力掩码或额外服务路径。该技术可与前缀缓存等优化手段互补叠加使用,进一步减少解码阶段开销。Shopify表示,上述性能改善使其能够缩减整体GPU资源分配。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→