
图片:METAL
摘要
- 谷歌研究院于9月29日发布Diffusion Controller,将扩散模型的图像生成过程重新表述为一个连续控制问题。
- 原始模型保持不变,只接收中间输出的轻量级辅助网络在每一步校正方向,因此也能接入不公开权重的闭源模型。
- 在Stable Diffusion v1.4实验中,灰盒方案的SFT和RWL胜率分别为0.667和0.682,领先LoRA的0.577和0.611,白盒变体在PPO下达到0.935。
谷歌研究院于9月29日发布了控制框架Diffusion Controller,用于把文本生成图像的扩散模型引向所需方向。其核心在于:庞大的原始模型保持冻结,附加在旁边的小型辅助网络在图像生成的每一步细微地校正方向。撰写博客的谷歌研究院软件工程师Chih-wei Hsu和Moonkyung Ryu把这个辅助网络比作摩托车的"转向阻尼器",并表示它"能顺畅地接入即便是访问受限的闭源模型"。也就是说,无需修改原始模型,就能按照用户意图进行调整。
它要解决的是提示词忠实度与画质之间的拉锯。博客以戴墨镜的蜥蜴为例:模型可能生成一只没戴墨镜的逼真蜥蜴,或者为了强行加上墨镜而让蜥蜴的脸变形。迄今为止,开发者分别使用在生成过程中调节提示词影响力的引导技术,以及借助LoRA等轻量适配器、奖励加权回归或策略梯度重新训练模型的方法。Hsu和Ryu诊断称,"这些工具一直被当作彼此独立、互不相关的修补手段",整个领域缺乏一种能将其统一起来加以分析的数学语言。
Diffusion Controller把逐步去除噪声、完成图像的整个过程改写为一个连续控制问题。根据METAL查阅的37页论文原文,研究团队将逆向扩散采样置于线性可解马尔可夫决策过程(LS-MDP)中的随机控制框架下,并把控制定义为对预训练模型转移概率的重新加权。由这些最优性条件导出两种训练方法:一种是用裁剪规则限制变化幅度的PPO式策略梯度法,另一种是为产生良好结果的生成路径赋予权重的奖励加权损失。论文于3月7日发布在arXiv上,作者共7人,包括在谷歌研究院实习的卡内基梅隆大学Tong Yang、耶鲁大学Yuejie Chi和谷歌DeepMind的Bo Dai。

同一理论也决定了模型结构。由于最优分数函数可以拆分为固定的预训练基线与一个小的控制修正项,结论是原始模型可以冻结,只需训练修正项。辅助网络只把原始模型对外暴露的中间去噪结果作为输入,这也是研究团队称之为灰盒环境的原因:即使没有查看内部权重的白盒权限,只要能看到中间输出就能接入。论文中的辅助网络是在64×64潜在空间上运行的轻量级UNet,性能最好的配置约有1,181万个可训练参数。
实验以Stable Diffusion v1.4为基础模型,在监督微调(SFT)、奖励加权损失(RWL)和PPO三种训练方式下进行。评价指标是由预测人类偏好的HPS-v2判定、相对原始模型的胜率。灰盒版Diffusion Controller以1,200万参数在SFT中取得0.667、在RWL中取得0.682的胜率。使用1,700万参数且需要访问模型内部的LoRA在相同条件下仅为0.577和0.611。简化了辅助网络结构的对照组为0.566和0.506,与原始模型几乎没有差别。在PPO中,LoRA以0.905领先灰盒方案的0.696,但联合训练LoRA与辅助网络的白盒变体Diffusion Controller-J升至0.935。博客所说的90%胜率指的就是这一数字。
研究还加入了人工评估。研究团队向50多名评估者展示由50个HPS-v2提示词生成的图像组,每个提示词生成四张,让他们选出更好的一组。论文注明,评估者是报酬高于其就业国家生活工资的付费合同工。据博客介绍,在包含多种属性的复杂提示词上,Diffusion Controller在主观画质和提示词匹配度两方面都获得了最佳结果。论文还表示,在奖励加权损失方面,它只用现有方法DPOK四分之一的样本就取得了更高的胜率。在推理阶段,只需调整一个引导强度数值,就能调高或调低控制力度。

从AI工程师的角度看,这项研究瞄准的是闭源模型。Hsu和Ryu在博客中解释称,"世界上最好的图像生成模型往往是企业机密",而辅助网络让工程师无需触碰底层代码就能调整被锁定的模型。这意味着即使模型供应商不交出权重,只要开放中间输出,客户就可以用自己的偏好数据单独训练一个小型辅助网络,这样的商业结构成为可能。实验仅限于Stable Diffusion v1.4一种模型,这也意味着其在最新大型模型上的效果仍需另行验证。谷歌研究院将个性化工具、减少有害图像生成的安全机制以及视频模型控制列为下一步方向。METAL曾报道谷歌研究院发布长篇AI视频生成框架的消息,这一控制方式是否会延伸到视频生成领域,是下一个值得关注的看点。





评论