每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Apple将扩散式语言模型扩大到17亿参数

用2.1万亿token训练后自我蒸馏,4步生成句子,探索自回归模型的替代路径

이미지: METAL LAB 생성

摘要

  • Apple机器学习研究团队公开了一篇论文,用2.1万亿token训练了一个17亿参数规模的流匹配语言模型
  • 将该模型自我蒸馏(self-distillation)后得到的Categorical Flow Map只需最少4步推理即可生成文本
  • 以往相关研究仅在10亿参数以下规模得到验证,可扩展性一直是悬而未决的问题,此次首次进行了大规模验证
발행처
Apple ML Research, 논문 공개일 2026-08-07
베이스 모델 규모
17억 파라미터(1.7B) 흐름 모델
학습 데이터량
2.1조 토큰(2.1T tokens)
추론 단계
자기증류 후 최소 4단계(4-step)로 압축
저자
Oscar Davis 등 7인, 옥스퍼드대 공동연구 포함

发布了什么

Apple机器学习研究团队于2026年8月7日发表的论文《Scaling Categorical Flow Maps》,展示了以流匹配(flow matching)方式而非自回归(autoregressive)方式扩大语言模型规模的结果。研究团队用2.1万亿token训练了一个17亿参数规模的基础模型,随后再对其进行自我蒸馏——即模型以自身输出为"老师"训练出更快版本的方法——由此得到一个名为Categorical Flow Map(CFM)的压缩模型。据介绍,该CFM仅需最少4次推理步骤,即可生成多样且高质量的文本,同时保持接近真实数据的token熵——衡量句子多样性程度的指标。研究团队还提出了一种可将该模型换算为标准语言模型基准测试分数的似然(likelihood)计算方法,并说明其结果与现有的离散扩散(discrete diffusion)方式处于相近范围。

这意味着什么

如今广泛使用的语言模型,大多数——如GPT系列——都是自回归方式,即从左到右按顺序逐个token预测句子。相比之下,扩散(diffusion)或流匹配模型最早在图像生成领域站稳脚跟,其做法是从噪声出发,同时打磨多个位置,逐步完成最终结果。将这种方式应用于文本,可以不按顺序并行打磨多个token,理论上能以更少的步骤实现更快的生成。问题在于,文本不像图像那样是连续值,而是离散的单词、token序列。因此,近期的研究一直在尝试用流匹配的方式,连接经过独热编码(one-hot encoding)的数据分布与高斯噪声,但迄今为止仅在10亿参数以下的小规模上得到验证,能否在大规模下得出同样的结果一直是个悬而未决的问题。这篇论文首次给出了17亿参数、2.1万亿token规模下的答案,展现了流匹配系列研究的下一阶段。值得一提的是,在图像生成领域,流匹配架构已经站稳脚跟,Black Forest Labs曾于去年8月发布了320亿参数规模的rectified flow transformer模型FLUX.2-dev。

Black Forest Labs发布320亿参数图像模型FLUX.2-dev

这会带来什么改变

此次发布并非商用产品,而是一篇研究论文。尽管如此,它仍为"流匹配这一替代架构在大规模下同样可行"这一论断,在自回归模型已事实上成为标准的语言模型市场中,又增添了一份依据。研究团队还整理了关于损失函数权重设置与时间调度安排的实务建议,这些内容预计将为后续尝试这一方法的其他研究团队提供直接参考。至于4步生成是否兼具足以投入实际服务的速度与质量,仍需经过更多基准测试与验证才能确认。