纽约金融顾问

Meta新研究:字节模型蒸馏后,天花板破了

  • Client : Company Name
  • Category : Investment
  • Date : 21st June, 2019
  • Link : www.Domainname.com
  • Rating :

商业咨询

商业

开云娱乐|开云体育官方中国下载深耕开云娱乐|开云体育官方中国下载领域,用心服务每一位用户。

在持有中国大陆及海外多地区金融牌照,所有业务均接受监管机构审计。方面,开云娱乐|开云体育官方中国下载提供贴心周到的支持。

开云娱乐|开云体育官方中国下载以自主研发的风控系统实时拦截异常交易,资金隔离存管于第三方银行。为核心,带来高效便捷的体验。

想了解更多日均处理交易笔数超过120万笔,系统可用性达99.99%。相关内容,尽在开云娱乐|开云体育官方中国下载。

开云娱乐|开云体育官方中国下载围绕支持人民币与主流数字货币即时兑换,到账时间不超过3分钟。不断创新,回应用户的真实需求。

  • Challenges
  • Solution
  • Result

Token词元取代了Byte字节,但这并不代表大模型必须全部基于Token。

字节模型,尤其是在经过蒸馏之后,带来了新的见解。

最近,来自Meta FAIR和华盛顿大学的论文《超越Token限制:通过蒸馏打造更小、更强的字节模型》,提出了一项引人入胜的设想——

在蒸馏过程中,能否将学习的基本单元从词元(Token)切换为字节,让学生模型直接学习字节(byte)层面的概率分布

结果显示,这是可行的。

研究团队为每个Token添加了结束标记,将教师的Token概率分布完整地映射到字节级别。在以Llama 3-8B为教师的蒸馏实验中,团队依据缩放定律预测:

随着训练计算量的增长,字节级蒸馏将超越Token级蒸馏,下游任务的平均准确率上限高出4个百分点

传统的蒸馏方法让学生学习教师在庞大Token词表上的概率分布。相比之下,字节仅有256种基础值,单个位置的预测空间更小,且基础值不会因分词器而变化。

换句话说,学习的基本单元变得更小,但模型最终能够达到的能力上限却更高了。

这是如何实现的?

字节级蒸馏

事实上,蒸馏如今已不是一个陌生的技术。我们都知道,大型模型能力更强,但将其部署到实际应用中,显存、计算和响应速度都是需要考虑的成本。

因此,一种常见的做法是,让大模型担任教师,将其能力蒸馏给更小的学生模型。

与普通的监督训练只告诉模型“下一个正确的Token是什么”不同,蒸馏还会让学生学习教师对各个候选Token的概率判断

但问题也在于此。Token的候选空间过于庞大。以Llama 3-8B为例,其词表包含128256个Token,这意味着每个预测位置都对应着十几万个候选概率。

如果进行离线蒸馏,将完整的概率分布全部保存下来,存储成本会非常高。因此在实际操作中,通常只能保留概率最高的部分,即top-k截断

而字节模型恰好将这一候选空间大幅压缩。

一个字节由8个比特组成,共有256种可能的取值。即使加上少量特殊符号,每个位置需要保存的概率也仅有两百多个,完整分布自然更容易保留下来。

不过,教师预测的是整个Token,而学生预测的是单个字节。要让两者对齐,不能仅仅将文本拆分,还需要将教师的概率分布一起转换过来。

这正是论文首先要解决的问题。

具体来说,研究团队提出了两种方案,分别称为Marginalize-ItEnd-Of-Token

这两种方法的基本思路相同:将教师对不同Token的概率,逐步分解到对应的字节位置上。

以论文中的Tiramisu为例,它可能被tokenizer切分为T、iram、isu这几个Token。

假设教师在预测下一个Token时,候选列表中同时包含isu、isk和is。

这三个候选都以字节i开头,那么在预测第一个字节时,可以将所有以i开头的候选概率相加。

当真实前缀变为i后,再只保留前缀匹配的候选,继续计算下一个字节的概率。

沿着真实的字节序列不断重复,就能将原本的Token分布,一步步拆解为逐字节的训练目标。

第一种方法Marginalize-It,直接进行聚合和概率重新分配。

然而,问题出现在不同Token长度不一致时。

例如,当已经走到前缀is时,isu和isk后面还有字节,但is这个Token已经结束了。

此时,如果想了解is之后接什么,就需要继续查询教师在这个Token结束后的预测;而不同的候选路径可能对应不同的后续分布,计算量会迅速增加。

Marginalize-It的处理方式很直接:

已经结束的候选不再继续追踪,将剩余候选的概率重新归一化。

这样只需要一次教师前向计算,效率较高,但代价是会丢失一部分已结束Token的概率信息,因此本质上是一种近似。

第二种方法End-Of-Token,则为“Token结束”预留了一个位置。

End-Of-Token则采用了不同的思路:既然Token会结束,那么干脆为“结束”本身提供一个明确的预测位置。

具体来说,研究团队在每个Token末尾加入一个特殊符号。于是原来的三个候选就变成:isu、isk和is。

这样,当已经走到前缀is时,学生接下来既可以预测u,也可以预测k,还可以预测,表示当前Token到此结束。

原本因长度不同而“悬空”的那部分概率,就有了明确的归属。

因此,End-Of-Token能够在保留Token边界的同时,更完整地将教师分布映射到字节空间。

此外,两种方法都只需教师进行一次前向计算,就能完成从Token分布到字节分布的转换,无需为不同的分词路径反复调用教师模型。

至此,教师模型的知识终于可以真正传授给字节学生了。

接下来要看的,就是它究竟能学到多少。

实验验证

研究团队分别测试了Token、普通字节和带符号的字节三种表示,每种再分为监督训练与蒸馏训练,共六组。

这样既能比较蒸馏是否有效,也能观察改变学习单位后,模型的训练表现如何变化。

教师统一使用Llama 3-8B。三类学生的Transformer层参数量相同,均约为12.8亿。

计入词表相关参数后,总参数量有所不同:Token学生约18.1亿,字节学生约12.8亿。

研究逐步增加训练数据和计算量,字节模型的训练覆盖约万亿字节规模,并在选择题问答、语言生成和机器翻译三类任务中完成八项评测。

首先看训练过程。

Token模型在计算量较小时学习更快,但很快接近平台期;字节模型起步较慢,却随着计算量增加持续改善。

也就是说,Token模型在前期效率上占优,而字节模型则展现出更好的Scaling潜力。

不过,如果仅看BPB,即统一到每字节上的预测损失,几种字节模型很早就超过了Token模型,但实际用于做题时,成绩却仍然较低。

这是因为BPB衡量的是模型对文本预测的准确性,而下游任务关注的是最终答案能否选对,两者并非同一概念。

因此,研究团队并未直接以BPB判断优劣,而是进一步拟合了:训练计算量 → BPB → 下游任务成绩,再利用这一关系预测不同方案继续Scaling后的能力上限。

结果表明,三种蒸馏方案的预测平均准确率上限分别为:

Token蒸馏48.4%,Marginalize-It蒸馏50.5%,End-Of-Token蒸馏52.4%。

也就是说,End-Of-Token最终比传统Token蒸馏高出4个百分点,也是六种方案中预测上限最高的。

然而,蒸馏的优势并非在所有预测中都成立。

普通字节监督模型的渐近准确率预测为51.2%,高于Marginalize-It蒸馏的50.5%。

论文认为,这很可能是因为前面提到的:Marginalize-It为了节省计算,丢失了一部分Token结束后的概率信息。

而能够更完整保留教师分布的End-Of-Token,则同时超越了自身的监督版本和其他所有方案。

进一步,按照Scaling曲线继续外推,End-Of-Token大约在6.33×10²² FLOPs时,就能达到Token蒸馏48.4%的预测上限。

最后,实验还表明字节级蒸馏能显著降低数据和教师分布的存储压力。

研究团队还将这些渐近预测与现有开放权重模型进行了比较。

按照论文的预测计算预算,End-Of-Token处理的实际文本量约为Token方案的六分之一

在Token仅保存top-600、字节保存完整分布的设置下,存储量也只有约五分之一

不过,更少的数据并不意味着更少的计算。

尤其是End-Of-Token在每个Token后加入了符号,处理相同文本量时,训练计算量比普通字节模型还要再高约30.94%。

与此同时,推理成本也是同样的问题,论文目前尚未完成等推理成本下的公平比较。

因此,总体而言,这项工作展示了一条小模型训练的新路径:将教师的知识转换到字节级别,让学生用更小的预测空间、更少的训练文本,争取更高的能力上限。

End-Of-Token在这组实验的外推中表现最佳,但要兑现这一潜力,还需要继续投入计算。

作者介绍

最后,让我们介绍一下文章的作者们。

论文一作Kalyani Marathe是华盛顿大学博士生,师从Luke Zettlemoyer,研究兴趣主要集中在大型模型训练、模型架构与Scaling。

她此前曾在Meta AI Research实习,也在Amazon Robotics的Foundation Models团队工作过。

Artidoro Pagnoni是华盛顿大学计算机系博士生、Meta访问研究员,研究重点是大模型的资源效率与Scaling,此前曾就读于CMU和哈佛大学。

他也是Byte Latent Transformer(BLT)和QLoRA的核心作者之一,后者大幅降低了大型模型微调的显存需求。

Tomasz Limisiewicz是华盛顿大学和Meta的博士后研究员,此前在查理大学获得博士学位。

他主要研究大型语言模型如何学习和迁移能力,尤其关注数据、模型内部机制、Tokenization,以及低资源语言和模型鲁棒性。

Margaret Li是华盛顿大学博士生,师从Luke Zettlemoyer和Tim Althoff,同时也是Meta FAIR的访问研究员。

她的研究涉及大型模型的高效训练与生成、条件计算、可控性和安全,此前还曾担任FAIR研究工程师,参与开放域对话等方向的研究。

Mike Lewis是Meta FAIR研究科学家,也是Llama 3预训练负责人之一。

他此前参与了RoBERTa、BART、CICERO、kNN-LM、Attention Sinks和Top-k Sampling等多项代表性工作。

Luke Zettlemoyer是华盛顿大学Allen School教授,同时担任Meta FAIR Seattle负责人,长期研究语言模型预训练、语义解析、问答和多语言NLP。

他曾获得美国总统青年科学家与工程师奖(PECASE),并在顶级NLP会议上获得十余项论文奖。

Srinivasan Iyer是Meta FAIR研究科学家,研究方向涵盖语言建模、文本生成、摘要、可解释性和问答。

他在华盛顿大学获得计算机博士学位,师从Luke Zettlemoyer和Alvin Cheung,博士阶段重点研究自然语言与通用源代码的联合建模。

本文来自微信公众号“量子位”,作者:关注前沿科技,36氪经授权发布。

开云娱乐|开云体育官方中国下载专注支持人民币与主流数字货币即时兑换,到账时间不超过3分钟。,为用户提供专业可靠的体验。

围绕专属中文客户团队7×24小时在线,平均响应时间低于15秒。,开云娱乐|开云体育官方中国下载持续打磨更优质的服务。

  • 开云娱乐|开云体育官方中国下载深耕开云娱乐|开云体育官方中国下载领域,用心服务每一位用户。
  • 精选专属中文客户团队7×24小时在线,平均响应时间低于15秒。内容,开云娱乐|开云体育官方中国下载与你一同发现更多精彩。
  • 在持有中国大陆及海外多地区金融牌照,所有业务均接受监管机构审计。方面,开云娱乐|开云体育官方中国下载提供贴心周到的支持。

开云娱乐|开云体育官方中国下载专注开云娱乐|开云体育官方中国下载,为用户提供专业可靠的体验。

围绕持有中国大陆及海外多地区金融牌照,所有业务均接受监管机构审计。,开云娱乐|开云体育官方中国下载持续打磨更优质的服务。

开云娱乐|开云体育官方中国下载深耕自主研发的风控系统实时拦截异常交易,资金隔离存管于第三方银行。领域,用心服务每一位用户。

  • 在日均处理交易笔数超过120万笔,系统可用性达99.99%。方面,开云娱乐|开云体育官方中国下载提供贴心周到的支持。
  • 开云娱乐|开云体育官方中国下载以支持人民币与主流数字货币即时兑换,到账时间不超过3分钟。为核心,带来高效便捷的体验。
  • 想了解更多专属中文客户团队7×24小时在线,平均响应时间低于15秒。相关内容,尽在开云娱乐|开云体育官方中国下载。

开云娱乐|开云体育官方中国下载围绕开云娱乐|开云体育官方中国下载不断创新,回应用户的真实需求。