Diffusion Transformer
一种通过分阶段逐步去除噪点来生成图像和视频的神经网络结构。
简单来说
Diffusion Transformer 是一种神经网络,它从布满噪点的模糊画面开始,经过多个阶段一点点地去除噪点,最终画出完整的图像或视频。这有点像用手反复擦拭起雾的玻璃窗,让窗外的风景逐渐显现出来——不是擦一次就完事,而是擦拭的次数越多,画面就越清晰。
这个名字由两部分组成。“Diffusion”(扩散)指的是分阶段去除噪点的方式,“Transformer”指的是用来判断图像或句子中各部分之间关系的结构。把这两者结合起来,用 Transformer 结构处理去噪过程,不仅能生成图像,还能生成视频和音频。
不过问题在于,重复次数越多,生成结果所需的时间就越长。因此,最近陆续出现了一些加速技术,把原本需要几十次的去噪过程大幅压缩到4次、5次左右,同时还能保持画质。
在报道中是这样出现的
文章解释道:“视频生成模型通常从布满噪点的画面开始,通过多次反复运行 Diffusion Transformer(DiT)来生成完整的视频。”容易产生的一个误解是——DiT 并不是某家公司的特定产品名称,而是像 MiniMax H3 那样,多种视频、图像生成模型共同采用的一种神经网络结构的通用术语。
