
이미지: METAL LAB 생성
摘要
- 苹果ML Research于8月发布了一篇论文,从理论和实测两方面比较了扩散语言模型(DLM)与自回归语言模型(ARM)的性能特点
- 研究结果显示,DLM通过并行生成token提高了计算效率,但随着上下文变长,其可扩展性会下降
- 研究确认,采用分块解码方式后,DLM也能像ARM一样扩展到更长的上下文
- 발행처
- Apple ML Research
- 공개 시점
- 2026년 8월
- 주요 저자
- Minseo Kim(서울대), Amir Gholami(UC버클리) 등
- 핵심 발견
- DLM은 병렬 생성으로 산술 강도는 높으나 긴 문맥 확장에 취약
- 제안 기법
- 블록 단위 디코딩으로 산술 강도와 문맥 길이를 분리
拆解不按顺序生成的模型
苹果ML Research于8月公开了一篇正面比较扩散语言模型(Diffusion Language Model,DLM)与自回归语言模型(Autoregressive Model,ARM)性能差异的论文。首尔大学研究员Kim Minseo、加州大学伯克利分校研究团队以及苹果研究团队共同署名。
该论文将两种方式的权衡分为理论分析和实测性能剖析两部分进行考察。结论十分明确:DLM可以同时处理多个token位置,从而提高算术强度——即衡量GPU在计算中有效利用数据程度的指标——但随着上下文变长,这一优势会消失。研究团队提出分块解码作为替代方案。他们解释称,与一次性生成整句话不同,将句子拆分为多个区块处理,可以使算术强度不再受制于上下文长度。
ARM与DLM为何走向分化
以GPT系列为代表的ARM,是先读取前面所有词语,再预测下一个词的方式。由于是逐字写成,准确度较高,但必须遵守顺序,因此存在难以并行调用GPU的结构性局限。相反,DLM从带有噪声的整句话出发,逐步精炼,一次性完成整句生成。理论上可以同时计算多个位置,因此硬件效率更高。
从苹果去年8月11日发布的另一篇论文中,也可以推测出苹果为何在这一比较上投入精力。苹果ML Research当时曾表示,他们用2.1万亿个token训练了一个17亿参数规模的流匹配语言模型,并通过自蒸馏得到的Categorical Flow Map,仅需最少4步推理即可生成文本。以更少的运算量快速给出答案的模型,在iPhone这类设备端环境中价值尤为突出。这篇性能比较论文,更像是验证该方向究竟在哪些方面真正有利、又在哪些方面遇到瓶颈的后续研究。
研究团队还确认,在批量推理——即将多个请求打包一起处理的方式——场景下,结果会发生反转。ARM在同时处理批次内多个序列时获得的收益更大,因此在吞吐量上超过了DLM。
由此带来的改变
这篇论文相当于给此前一味将DLM捧为未来替代方案的趋势踩了刹车。研究团队指出,开源DLM要想比ARM实现更快的响应速度,关键在于减少采样步数。事实上,苹果同期推出的4步推理模型,可以看作是完全遵循这一方向得出的结果。此次分析进一步明确了这样一个基本图景:在上下文较短、响应速度至关重要的设备端任务中,DLM更具优势;而在需要处理长文档或同时应对多个请求的服务器环境中,ARM仍然更为有利。



