METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

苹果将扩散式语言模型扩展到17亿参数规模

用2.1万亿token训练后自我蒸馏,实现4步生成句子,探索自回归模型的替代方案

苹果将扩散式语言模型扩展到17亿参数规模

图片:METAL

摘要

  • 苹果机器学习研究部门公开了一篇论文,用2.1万亿token训练了一个17亿参数规模的流匹配语言模型
  • 将该模型自我蒸馏(self-distillation)后得到的Categorical Flow Map,只需最少4步推理即可生成文本
  • 以往相关研究仅在不到10亿参数的规模上得到验证,扩展性一直是悬而未决的问题,此次首次完成了大规模验证

发布了什么

苹果机器学习研究部门于2026年8月7日发表的论文《Scaling Categorical Flow Maps》,展示了以流匹配(flow matching)方式而非自回归(autoregressive)方式训练语言模型的成果。研究团队用2.1万亿token训练出一个17亿参数规模的基础模型,随后对其进行自我蒸馏——即模型以自身输出为"老师"来训练出更快版本的方式——得到了名为Categorical Flow Map(CFM)的压缩模型。据介绍,这个CFM仅需最少4步推理,就能生成多样且高质量的文本,同时保持了接近真实数据的token熵——衡量句子多样性程度的指标。研究团队还提出了一种可将该模型换算成标准语言模型基准分数的似然(likelihood)计算方法,并说明其结果与现有的离散扩散(discrete diffusion)方式处于相近水平。

这意味着什么

目前广泛使用的GPT系列等语言模型大多采用自回归方式,即从左到右、逐个token按顺序进行预测。而扩散或流匹配模型最早在图像生成领域站稳脚跟,其方式是从噪声出发,同时对多个位置进行打磨,最终完成结果。将这种方式应用于文本,可以不按顺序、并行打磨多个token,理论上能以更少的步骤实现更快的生成。问题在于,文本不同于图像,并非连续值,而是离散的单词、token序列。因此近期的研究一直尝试用流匹配将独热编码(one-hot encoding)的数据分布与高斯噪声连接起来,但迄今为止都只在不到10亿参数的小规模上得到验证,大规模下是否也能得出相同结果一直是悬而未决的问题。此次论文首次以17亿参数、2.1万亿token的规模对这一问题给出了答案,展示了流匹配系列研究的下一步进展。值得一提的是,图像生成领域流匹配架构已经站稳脚跟,Black Forest Labs去年8月就曾发布了320亿参数规模的rectified flow transformer模型FLUX.2-dev。

Black Forest Labs发布320亿参数图像模型FLUX.2-dev

那么这带来了什么变化

此次发布的并非商用产品,而是一篇研究论文。尽管如此,它仍为"流匹配这一替代架构在大规模下也能行得通"这一论点,在自回归模型事实上已成为语言模型标准的市场中,又增添了一份依据。研究团队还就损失函数的权重设置、时间调度方案应如何设计等给出了实务性建议,这预计将为后续尝试这一方式的其他研究团队提供直接参考。至于4步生成是否具备了可用于实际服务的实用速度与质量,仍有待今后更多基准测试与验证来确认。

评论