
图片:METAL
摘要
- 谷歌研究院9月10日公开了生成工具使用训练数据的框架ToolGrad。它不先写问题,而是先搭出一条真能跑通的工具链,再配上相应的问题。
- 原有的深度优先搜索方式合格率为63.8%,现在升到99.8%;单条样本串起的工具数从2.1个增至3.4个,调用工具的成本下降41.7%。
- 用这500条数据微调的Gemma-3-12B在ToolBench上得19.6分,超过Gemini 2.5 Pro的11.4分。作者们也写明了合成数据彼此趋同这一局限。
AI要学会调用工具,得先有人把场景搭好:用户提出了这样的请求,按这个顺序调用了这些API,于是得到了这样的答案,这三者合成一组。此前这一组总是从人编出来的问题开始,再由智能体去找能解决它的工具组合。谷歌研究院9月10日公开的ToolGrad,是一套把这个顺序整个倒过来的工具使用数据生成框架。
倒过来的理由很简单:先写问题,就没人知道这个问题到底解不解得开。论文写道,探索在本质上必然昂贵,无法保证标注成功,因而白白消耗智能体资源。反过来,先把工具接成一条真能跑通的链路,再据此写出对应的问题,只需调用一次模型就能完成。
数字上的差距很大。论文显示,原有的深度优先搜索方式合格率为63.8%,而ToolGrad为99.8%。单条样本串起的工具数也从2.1个增加到3.4个,实际调用工具所花的成本则从34.3降到20.0,降幅41.7%。也就是说,更复杂的数据,做得更多,也更便宜。
生成过程像是把机器学习的反向传播用文字重写了一遍。API提议器一次取50个候选并收窄到三个,三个执行器同时真去调用这些API,选择器读完执行报告,把表现最好的那一个接到目前的工作流上。最后由更新器按照变长的工具清单,改写用户的问题和答案。作者们把这一选择环节称作文字形式的梯度,意思是决定下一步的不是导数,而是模型的判断。
这样做出来的数据只有500条。用这个名为ToolGrad-500的数据集微调小模型后,在要求模型挑出并调用正确工具的ToolBench测试中,Gemma-3-12B拿到19.6分。同一测试里,Gemini 2.5 Pro为11.4分,Claude 4.5 Opus和GPT-5 Nano均为15.4分。据谷歌研究院博客,在给出模型从未见过的工具的BFCL综合分上,ToolGrad-12B以83.1分位列第二,比Gemini 2.5 Pro的83.2分低0.1分,Claude 4.5 Opus为82.8分,GPT-5为74.4分。
领衔这项研究的是谷歌XR的研究科学家Zhongyi Zhou。他在博客中写道,“高质量的工具使用数据集,可以通过答案优先的范式更高效、更可靠地生成”。论文里的说法更直白,作者们评价旧办法时写道,“探索在本质上必然昂贵”。东京大学与理化学研究所AIP的研究者共同署名,论文收录于ACL 2026 Findings。
作者们自己写下的局限,是数据会彼此趋同。论文承认,智能体倾向于在训练集内生成相似的工具使用,而这类重复的合成数据在框架规模扩大时必然损害模型训练。事实上,把样本量从500条加到1千条、2千条时,成绩先升后降。论文也写明,多轮工具使用与智能体使用不在这套框架的范围之内。
这里真正值得盯住的不是分数,而是原料的来源变了。教模型用工具的原料,正在从人留下的记录转向机器实际跑出来的记录。ToolGrad连“人来编问题”这一步都往后挪了,留给人的只剩下确认结果是否像样的位置。论文让两名评分者看八个问题、十二个模型,各评96项,报告与机器评判的相关系数为0.88;这套设计本身就说明,人的角色已从生成缩到审核。
小模型在哪里能赢过大模型,这一点也再次显现。METAL此前报道过,教智能体流程的技能对性能的影响大于知识,ToolGrad的结果指向同一个方向。基础状态下只有1分的Gemma-3-1B,在同一测试里升到14.1分,靠的不是模型变大,而是看到了写明流程的范例。
成本结构是这个故事的另一条线。在METAL查阅的论文对照表中,模型那边的成本几乎没动,从64.5到63.9,只有工具那边的成本从34.3降到20.0。换句话说,省下来的不是思考的开销,而是真正去敲API的开销。生成用的是便宜又快的Gemini 2.5 Flash Lite;论文解释说,单条样本的迭代次数定为十次,是因为在八到十二次之间合格率不再上升。
谷歌把代码、数据集和模型全部公开了。它把“用好工具的能力如今取决于训练数据的设计而非模型规模”这一主张,做成了别人可以验证的形式。公开的500条按体量看并不大,但每一条按什么顺序串起了哪些工具都完整保留,其他研究者可以把这套设计拆开来看。
合成数据的胜负手是多样性,不是数量。ToolGrad证明的是:先造出经过验证的答案,数据就几乎不用丢;同时暴露出来的是,这样造出的答案彼此越来越像。教AI使用工具这件事,已经从收集更多范例的问题,变成设计彼此不同的范例的问题。





评论