self-improving RLM harness
包裹AI模型、负责管理工具调用和长时间任务的执行框架,在运行过程中自行修改自身设置的方式。
简单来说
self-improving RLM harness 指的是:包裹AI模型、让它能使用工具并持续完成任务的执行框架本身,在工作过程中不断修改自己的设置。"harness"这个词原本指套在马或狗身上的挽具和缰绳装置。在AI领域,如果模型是"马",那么harness就相当于告诉这匹马何时该用工具、何时该停下、该记住什么的那套挽具。
通常挽具一旦套上,整个任务过程中都保持不变。但这种方式不同。随着任务变长而不断累积的记录(累积上下文),不再被当作固定的负担,而是可以在需要时卸下或改变的可变量;多个智能体像多匹马互相传递消息一样协同工作;甚至挽具本身的结扣和长度也会在任务进行中被自行调整。这种设计的目的,是让写代码或持续数小时的自主任务这类无法靠一次对话完成的工作,能够更持久、更低成本地运行下去。
不过,这种自我修改能力具体如何运作、又设置了哪些安全机制,目前还没有被具体公开。可以说,目前只确认了"self-improving(自我改进)"这个名字和大致的设计方向。
