首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

Meta新研究:字节模型蒸馏后,天花板破了

2026-09-15 1 阅读 约9分钟阅读 henry
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> Meta新研究:字节模型蒸馏后,天花板破了 henry 2026-09-15 14:37:16 来源: 量子位 henry 发自 凹非寺 量子位 | 公众号 QbitAI Token词元替代了Byte字节,但不意味着大模型都得是Token。 字节模型,特别是蒸馏后,有点儿新说法。 最近,来自Meta FAIR和华盛顿大学的论文《突破Token天花板:蒸馏出更小、更强的字节模型》,提出了一个很有趣的想法—— 蒸馏的时候,能不能把学习单位从词元(Token)换成字节,让学生模型直接从 字节(byte)级别的概率分布 学起? 结果还真可以~ 团队给每个Token加上结束标记,把教师的Token概率分布完整转换到字节级别。在以Llama 3-8B为教师的蒸馏实验中,团队根据缩放定律预测: 随着训练计算量增加,字节级蒸馏将反超Token级蒸馏,下游平均准确率上限高出 4个百分点 。 传统蒸馏让学生学习教师在庞大Token词表上的概率分布。相比之下,字节只有256种基础取值,单个位置的预测空间更小,基础取值也不随分词器改变。 换句话说, 学习的基本单位反而更小了,模型最终能学到的能力上限却更高了。 这是怎么做到的? 字节级蒸馏 其实到今天,蒸馏已经不是什么陌生技术了。我们都知道,大的模型能力更强,但把它部署到实际应用中,显存、计算和响应速度都是成本。 于是,一个常见做法,就是让大模型当老师,把能力蒸馏给更小的学生模型。 和普通监督训练只告诉模型“下一个正确Token是什么”不同,蒸馏还会让学生学习教师对 各个候选Token的概率判断 。 但问题也出在这里。Token的候选空间实在太大。以Llama 3-8B为例,它的词表包含 128256个Token ,这意味着每一个预测位置,都对应十几万个候选概率。 如果做离线蒸馏,把完整概率分布全部保存下来,存储成本会非常高。因此实际操作中,通常只能保留概率最高的一部分,也就是 top-k截断 。 而字节模型,刚好把这个候选空间一下压小了。 一个字节由8个比特组成,共有256种可能的取值 。即使加上少量特殊符号,每个位置需要保存的概率也不过两百多个,完整分布自然更容易保留下来。 不过,教师预测的是整个Token,学生预测的是单个字节。要让两者对上,不能只把文本拆开,还得把教师的概率分布一起转换过去。 这正是论文首先解决的问题。 具体的,团队提出了两种方案,分别叫作 Marginalize-It 和 End-Of-Token 。 两者的基本思路基本相同: 把教师对不同Token的概率,逐步分解到对应的字节位置上。 以论文里的Tiramisu为例,它可能被tokenizer切成 T、iram、isu几个Token。 假设教师在预测下一个 Token 时,候选里同时有 isu、isk 和 is。 这三个候选都以字节 i 开头,那么预测第一个字节时,就可以把所有以 i 开头候选的概率加起来。 等真实前缀变成 i,再只保留前缀匹配的候选,继续计算下一个字节的概率。 沿着真实字节序列不断重复,就能把原本的 Token 分布,一步步拆成逐字节的训练目标。 第一种方法Marginalize-It,直接聚合并重新分配概率。 不过,麻烦出现在不同Token长度不一样的时候。 比如已经走到前缀 is,isu 和 isk 后面都还有字节,但 is 这个Token已经结束了。 这时,如果还想知道 is 之后接什么,就需要继续查询教师在这个Token结束后的预测;而不同候选路径,又可能对应不同的后续分布,计算量会迅速增加。 Marginalize-It的处理很直接: 已经结束的候选就不再往后追,把剩余候选的概率重新归一化。 这样只需要一次教师前向计算,效率很高,但代价是会丢掉一部分已经结束 Token的概率信息,因此本质上是一种近似。 第二种方法End-Of-Token,则给「Token结束」留了一个位置。 End-Of-Token则换了一个思路:既然Token会结束,那就干脆给“结束”本身一个明确的预测位置。 具体来说,团队在每个Token末尾加入一个特殊符号。于是原来的三个候选就变成:isu、isk和is。 这样,当已经走到前缀is时,学生接下来既可以预测u,也可以预测k,还可以预测,表示当前Token到这里结束。 原本因为长度不同而“悬空”的那部分概率,就有了明确去处。 因此,End-Of-Token可以在保留Token边界的同时,更完整地把教师分布映射到字节空间。 而且,两种方法都只需要教师做一次前向计算,就能完成从Token分布到字节分布的转换,不必为了不同分词路径反复调用教师模型。 到这里,教师模型的知识,总算可以真正交到字节学生手里了。 接下来要看的,就是它到底能学到多少。 实验验证 团队分别测试了Token、普通字节和带的字节三种表示,每种再分为监督训练与蒸馏训练,一共六组。 这样既能比较蒸馏有没有帮助,也能观察改变学习单位后,模型的训练表现如何变化。 教师统一使用Llama 3-8B。三类学生的Transformer层参数量相同,均约为12.8亿。 计入词表相关参数后,总参数量则有所不同:Token学生约18.1亿,字节学生约12.8亿。 研究逐步增加训练数据和计算量,字节模型的训练覆盖约万亿字节规模,再在选择题问答、语言生成和机器翻译三类任务中完成八项评测。 先看训练过程。 Token模型在计算量较小时学得更快,但很快开始接近平台期;字节模型起步更慢,却随着计算量增加持续改善。 也就是说, Token模型赢在前期效率,字节模型则表现出了更好的Scaling潜力。 不过,如果只看BPB,也就是统一到每字节上的预测损失,几种字节模型很早就已经超过Token模型,但真正拿去做题时,成绩却仍然更低。 之所以这样,是因为BPB衡量的是模型对文本预测得准不准,而下游任务看的是最后答案能不能选对,两者并不是一回事。 所以,团队没有直接拿BPB判断谁更强,而是进一步拟合了: 训练计算量 → BPB → 下游任务成绩, 再用这条关系预测不同方案继续Scaling后的能力上限。 结果表明,三种蒸馏方案的预测平均准确率上限分别是: Token蒸馏48.4%,Marginalize-It蒸馏50.5%,End-Of-Token蒸馏52.4%。 也就是说, End-Of-Token最终比传统Token蒸馏高出4个百分点,也是六种方案里预测上限最高的。 不过,蒸馏的优势并非在所有预测中都成立。 普通字节监督模型的渐近准确率预测为51.2%,高于Marginalize-It蒸馏的50.5%。 论文认为,这里的原因很可能就是前面提到的:Marginalize-It为了省计算,丢掉了一部分Token结束后的概率信息。 而能够更完整保留教师分布的End-Of-Token,则同时超过了自己的监督版本和其他所有方案。 进一步,按照Scaling曲线继续往外推,End-Of-Token
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱