Recursive Self-Improvement
AI系统不断检查自身能力,并据此修改自己的学习方式或结构,从而反复变得更强的过程
简单来说
递归自我改进是指AI系统自行检查自己的表现,并根据结果修改自己的学习方式或结构,从而生成一个更好版本的过程。
可以想象一个独自学习的学生。考完试后,他自己分析哪里做错了,然后改变学习顺序或方法,再去考一次试。如果这个过程不断重复,且完全没有人插手,那么这个学生每次都用新的方式把自己重塑成一个更好的学生。在AI领域,递归自我改进指的就是系统在没有人类指示的情况下,自行完成这种循环。
到目前为止,这种循环主要发生在处理文本或代码的领域,但最近也出现了将这一概念应用到机器人等具身系统上的尝试。不同之处在于,这时改进所依赖的素材不再是文本,而是机器人在搬运物体过程中遇到的摩擦力、震动等真实世界的经验。
在报道中是这样出现的
在一篇关于OpenAI的报道中提到,一位负责风险管理的高管把关注重点转向了'递归自我改进可能带来的风险'。这指的是人们担心,一个能够自我优化并训练其他模型的AI系统,可能会发展到难以控制的程度。而在一篇关于Sakana AI的报道中,同一个词却不是作为风险出现,而是作为研究目标——该公司宣布将把物理AI作为下一个研究方向,即让机器人通过真实世界的经验自主提升能力。同一个概念既可以被当作需要警惕的风险,也可以被当作值得追求的目标,这一点颇为有趣。
亲手试一试
你可以用现在正在用的聊天机器人,体验一下这个概念的简化版。
'请你自己找出刚才那个回答中错误或不足的地方,然后重新写一个更好的版本。'
把这个请求重复几次,你就能大致体会到:不需要人一一指出问题,系统自己检查并修正自己是什么感觉。不过要注意,这只是一个帮助理解的类比体验,与真正改变模型自身结构或学习方式的递归自我改进并不是一回事。
