counterfactual optimization
一种优化技术,让AI智能体的执行从某个时间点分出多条路径同时尝试,再从中选出结果最好的那一条
简单来说
反事实优化是指AI智能体在处理任务的过程中,回退到某个节点,同时尝试多个不同的选择,然后挑出结果最好的那条路径继续使用。这有点像玩游戏时,在关键时刻存档,然后从那个存档点开始尝试多种不同的玩法,最后选择进展最顺利的那一局继续玩下去。
通常,AI智能体如果想撤销已经执行过的操作,只有两种办法:从头重新开始,或者在错误的基础上打补丁式地修改。这两种方法都费时费钱,而且很难重新还原出完全相同的情境。反事实优化之所以能够实现,是因为可以直接复制执行过程中的状态并分出多条分支。它的核心在于,不是提前锁定一个答案,而是把多种可能性都实际执行一遍,再对比选出最优结果。
这种方式也被用在智能体自我训练的过程中。做法是在特定的分岔点上让执行分出多条路径,再把表现好的路径反馈到训练当中。
在报道中是这样出现的
文章提到,“基于分支搜索的反事实优化在四个基准测试中,性能比现有方法最高提升11分,同时将执行时间最多缩短了58%。”容易被误解的一点是,这并不是让智能体在事后修正错误的功能,而是一种提前把执行过程分出多条路径再进行比较的搜索方式。
