
이미지: METAL LAB 생성
摘要
- 苹果ML Research于8月发布论文,分析了扩散Transformer(DiT)内部的"异常token"问题
- 研究确认,单纯遮蔽异常token的方式并无效果,根本原因在于受损的局部patch信息
- 为解决这一问题,团队提出了"双阶段寄存器(DSR)"技术,并在ImageNet及大规模文本生成图像任务中进行了验证
- 논문 제목
- Taming Outlier Tokens in Diffusion Transformers
- 발행처·시점
- Apple ML Research, 2026년 8월
- 저자
- Xiaoyu Wu, Yifei Wang 외 (일부 Rice University 소속)
- 제안 기법
- Dual-Stage Registers (DSR)
- 검증 대상
- ImageNet, 대규모 텍스트-이미지 생성 파이프라인
发布了什么
苹果ML Research于8月公开了一篇论文,正面探讨了图像生成中使用的扩散Transformer(Diffusion Transformer,DiT)内部出现的"异常token(outlier token)"现象。研究团队确认,在基于表征自编码器(RAE)的DiT流程中,预训练的视觉Transformer(ViT)编码器和DiT本身都出现了这一现象。尤其是在DiT内部的中间层,这类token表现得更为突出。
研究团队发现的一个有趣之处在于,单纯遮蔽或删除数值较大的异常token并不能提升性能。这意味着问题并非源于少数极端值,而是该位置本身的局部patch信息已经受损。为解决这一问题,团队提出了"双阶段寄存器(Dual-Stage Registers,DSR)"方案:如果能使用已训练好的寄存器就直接使用,若没有则在推理阶段迭代应用寄存器,并在去噪网络(denoiser)上另外附加扩散专用寄存器。
为什么"异常token"是个问题
视觉Transformer会将图像切分成小块(patch),并将每一块当作一个"token"来处理,这与将句子按词切分处理的语言模型方式相同。然而,随着训练的进行,有报告指出部分token会出现异常大的数值(高范数,high-norm),而该位置实际的图像信息却几乎没有被承载,反而过度吸引了其他token的注意力(attention)。在ViT研究中,已知可以通过设置专门的"寄存器"位置来吸收这类token,但在生成模型DiT中,这一现象的具体作用机制此前一直未被充分厘清。
DiT是Stable Diffusion 3、FLUX系列等最新图像生成模型采用的架构,取代了以往的U-Net结构。苹果此前已持续开展扩散模型相关研究,包括比较基于扩散的方式与自回归方式的性能,以及将扩散语言模型扩展至17亿参数的实验等。此次论文可以视为这一系列研究的延续,找出了侵蚀图像质量的细微缺陷的根本原因。
由此会带来什么改变
异常token问题此前一直被认为是生成图像中偶尔出现的局部斑点或畸变patch的原因之一。苹果这项研究的意义在于,没有采用简单遮蔽的临时方案,而是从训练结构层面加以处理,这有可能为今后提升基于DiT的图像·视频生成模型稳定性提供设计指引。不过,目前这一结果仅停留在研究论文层面的验证,具体会以何种形式反映到实际商用模型中,还需观察后续公开的研究进展。



