Tree-RL
一种在执行过程中分出多条路径、同时尝试并从中学习的强化学习训练方式
简单来说
Tree-RL 是一种让 AI 通过反复试错来学习更好判断的训练方法,但它不是把一次尝试从头走到尾只沿一条路径进行,而是在中途设置多个分岔点,从那里同时分出多条路径去尝试。
打个比方,这就像玩游戏时不是从头玩到尾就结束,而是在关键时刻设置存档点,然后从那个存档点出发反复尝试不同的选择。就像树从树干分出许多枝条一样,从同一个起点分出多个方向,比较每条分支的结果,就能更高效地学到哪种选择其实更好。
要真正实现这种方式,需要能把 AI 当时所处的状态倒回并复制到某个特定时间点的技术。因为如果只能一直向前推进,就无法制造出分岔点。
在报道中是这样出现的
文章提到,“在从选定时间点分叉 rollout 的 Tree-RL 训练中,TerminalBench-2 分数从 34.2% 提升到了 39.4%。”需要注意的是,Tree-RL 并不是某家公司的特定产品名称,而是一种训练技巧,只有借助能够倒回并复制执行状态的运行环境(Shepherd)才能实现。
