RecodeX 重构消息,Meta FAIR与华盛顿大学联合发表论文《突破Token天花板:蒸馏出更小、更强的字节模型》,提出将蒸馏的学习单位从词元(Token)改为字节(byte)。团队设计了Marginalize-It和End-Of-Token两种方案,把教师的Token概率分布转换到字节级别,且只需教师做一次前向计算。
以Llama 3-8B为教师的实验中,三类学生Transformer层参数量均约12.8亿。按缩放定律预测,三种蒸馏方案的平均准确率上限分别为:Token蒸馏48.4%、Marginalize-It蒸馏50.5%、End-Of-Token蒸馏52.4%,后者高出传统Token蒸馏4个百分点。End-Of-Token约在6.33×10²² FLOPs时追平Token蒸馏的预测上限。
研究还显示,字节级蒸馏可降低存储压力:在Token仅保留top-600、字节保存完整分布的设置下,存储量约为五分之一,处理文本量约为Token方案的六分之一。