Meta新研究:字节模型蒸馏后,天花板破了
Meta FAIR与华盛顿大学发表论文,提出将知识蒸馏的学习单位从Token改为Byte。团队设计Marginalize-It和End-Of-Token两种方法,将教师模型的Token概率分布转换为字节级分布,且仅需一次前向计算。以Llama 3-8B为教师的实验中,三类学生Transformer参数量均约12.8亿。结果显示,Token模型前期学习更快但较早进入平台期,字节模型起步慢却随计算量持续提升。预测下游平均准确率上限:Token蒸馏48.4%,Marginalize-It为50.5%,End-Of-Token达52.4%,高出4个百分点。字节级蒸馏还显著降低存储压力,End-Of-Token实际处理文本量约为Token方案的六分之一,存储量约五分之一。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(量子位)→
