
图片:METAL
摘要
- R4T 先用强化学习训练一个扇出语言模型,再用它生成的数据训练一个小型扩散模型,推理时不需要思维链 token,一次就能给出十个子查询。
- 奖励由 0.6 的落地性、0.2 的多样性和 0.2 的对齐性混合而成;去掉多样性项后,模型会退化成生成无意义字符串的捷径。
- OpenReview 的评审记录指出,语义指标的提升能否转化为点击率之类的服务指标,仍是一个悬而未决的问题。
Google Research 于 9 月 15 日在公司博客上发布了一个新框架 Retrieve-for-Train,简称 R4T,它返回的搜索结果不是单个条目,而是一个集合。博文由学生研究员 Pengcheng Jiang 和高级研究工程师 Judith Yue Li 撰写,所依据的论文 Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion 以 Google Research 和伊利诺伊大学厄巴纳-香槟分校 11 位研究者的名义被 ICML 2026 接收。核心思路是不再在每次搜索时让大型语言模型把查询拆成多个方向,而是只跑一次强化学习,把这种行为转移到一个 5390 万参数的小型扩散模型里。METAL 完整阅读了论文原文和 OpenReview 评审记录,据其记载,这种方式的查询扩展速度比自回归方式快 12 到 20 倍。
从问题设定就能看出原因。据 Jiang 和 Li 介绍,如今的搜索和推荐面对露营装备这样的查询,应该返回的不是十个四人帐篷的变体,而是帐篷、睡袋、便携炉和头灯这样互补的一套。系统为此采用把宽泛查询展开成多个子查询的扇出技术,而把这件事交给通用语言模型会遇到两个问题。一是同义重复。面对波西米亚音乐节风格这样的查询,标准模型只会给出波西米亚音乐节时尚、波西米亚音乐节服装之类的同义词,而错过时尚专家会想到的流苏夹克、钩针连衣裙、麂皮靴等方向。二是延迟。要拆出好的子查询,需要先生成数百个思维链 token,而逐个吐 token 的结构与搜索框要求的亚秒级响应并不匹配。
R4T 分三步。第一步,用强化学习训练 Gemma3-4B 和 Qwen3-4B 这类 40 亿参数的开源模型,让它为每个查询生成 10 个子查询。奖励是三项混合的综合分数:衡量子查询是否接近数据库中真实条目的落地性、用 Vendi 分数衡量的多样性,以及检查是否偏离原始查询的对齐性,论文中的默认权重是落地性 0.6、多样性和对齐性各 0.2。优化采用在组相对策略优化上叠加软 PPO 正则化的 Soft-GRPO。第二步,把训练完成的模型冻结,离线生成查询与目标集合的配对,完全不需要人工标注。据作者在评审答复中所写,每个查询以 0.9 的温度采样 128 个样本,学习的是整个分布而不是单条最优轨迹。第三步,5390 万参数的扩散模型学习从查询嵌入直接映射到一组目标嵌入,推理时无需自回归,一次生成十个方向,再通过最近邻检索找到真实条目。
在奖励设计上,作者最强调的是防止走捷径。Jiang 和 Li 写道:"如果没有多样性项,模型会很快退化成生成 line ending line ending 这样毫无意义的退化字符串,以数学方式利用数据库的向量坐标。"在落地性上只加对齐性时,模型这次靠反复改写原始查询而更快地崩塌,只有三项同时施加,策略才被推到一个既落在真实条目上又能找到不同方向的平衡区域。论文的权重实验显示,落地性过大时对齐性会崩溃,对齐性和多样性过大时探索会减少。
性能在两个任务上测量。在没有标准答案的开放式抽象检索中,以 Gemini-2.5-Pro 作为裁判,用五分制评估多样性、对齐性和落地性;在有弱参考集合的组合检索中,则看召回率和命中率。数据是由用户搭配的穿搭集合组成的时尚基准 Polyvore,以及专家制作的公司内部音乐播放列表。从论文表格看,以 Gemma3-4B 为基准,时尚任务的平均分从零样本的 38.5、在五个候选中选最优的 Best-of-N 的 40.9,提高到经过强化学习的 R4T 模型的 49.1,多样性分数从 56.0 升至 76.8。音乐任务的平均分从 48.1 升至 58.1。组合检索的前 5000 召回率,Gemma 从 6.0 升至 16.9,Qwen 从 10.1 升至 20.9,超过了 Gemini-2.5-Flash 的 15.7,蒸馏出的扩散模型也分别达到 15.0 和 16.5。速度的差距更为悬殊。自回归模型在批量 8 时耗时 1.46 秒,批量 1024 时接近 50 秒,而扩散模型分别只需 0.07 秒和 4.21 秒。
从工程师的角度看,这篇论文真正的主张是强化学习该放在哪里。Jiang 和 Li 写道:"我们证明了,把强化学习当作一次性的目标转换器而不是在线推理引擎来用时,它可以非常有效。"其逻辑是,把靠奖励寻找行为的重计算与真正部署的模型分开,人无法标注的集合级目标也能转化为监督学习数据。METAL 曾报道,Google 在制作工具使用数据时同样采用了先生成答案再补上问题的反向合成方式。两项研究都指向在没有标签的地方自己造数据的方向。
评审记录写明了这种方法要走出论文还需要什么。据 OpenReview 记载,论文被作为常规论文接收,但评审总评建议的是弱接收,一位评审在答复之后维持了原分数,指出论文没有证明多样性、对齐性等语义指标的提升能否转化为点击率或转化率这样的真实服务指标。作者在答复过程中补充了人工评估。每个模型系列各取 35 个宽泛查询,配 5 到 6 名评分者,共 419 条评分,Qwen 的多样性分数从 2.74 升至 3.26,p 值 0.0003,而 Gemma 从 3.48 升至 3.75,p 值仅为 0.08。论文附录写道,当数据库非常大或频繁变动时,强化学习阶段的成本会上升;创意性或文化敏感性这类难以写成标量奖励的偏好很难纳入;开放式任务的评估依赖语言模型裁判。作者回应称,在服务环境中可以把点击率替代指标或从用户反馈学到的奖励模型纳入第一阶段奖励,而这一连接能否在真实搜索框中成立,是这个框架的下一场考验。





评论