Agent RL
让模型实际使用工具、并根据成功或失败的结果获得奖励从而不断进步的训练方法
简单来说
Agent RL 是一种让 AI 模型亲自动手学会使用工具的训练方式,而不是只靠死记硬背。学做菜时,光背菜谱和真正站在厨房里切菜、调火候是完全不同的两回事。刚开始可能会把食材烧焦,但成功了会得到肯定,失败了就重新尝试,慢慢地手就熟练了。Agent RL 也是同样的道理:让模型去执行修复代码、运行终端命令、搜索网络等实际任务,然后根据结果是否正确打分,再依据这个分数一点点调整模型。
这种训练通常按顺序进行。往往从有明确答案的数学题开始,再依次扩展到软件工程任务、终端操作、网络搜索,难度和领域逐步扩大。这有点像接力赛,前一阶段训练出的成果会被用作下一阶段训练的起点。
不过,由于这种训练成本高、过程复杂,并不会对所有规模的模型一视同仁地应用。规模较小的模型往往只训练到能够遵循指令的程度,而只有规模较大的模型才会额外加入真正操作工具的训练。
在报道中是这样出现的
IBM 在介绍 Granite 4.2 时表示,8B 和 30B 模型加入了依次涵盖软件工程、终端使用、网络搜索的 Agent RL 训练模块,而 3B 模型则跳过了这一阶段。这里容易产生的误解是,以为 Agent RL 是对模型一次性统一施加的单一流程,但实际上它是可以根据模型规模有选择地加入或省略的独立训练阶段。即便是同名的模型,也可能因规模不同而在是否真正学会使用工具上存在差异。
