
이미지: Hugging Face 화면 갈무리
摘要
- IBM Research用ALTK-Evolve测量了8个模型的智能体记忆效果,发现不同模型所需的记忆量各不相同
- DeepSeek-V3.2(671B)在使用完整指南集时任务完成率提升9.5个百分点、场景完成率提升16.1个百分点,而gpt-oss-120b(117B)在压缩后的核心指南方式下完成率提升16.1个百分点
- GLM-5(745B)即使加入记忆也没有出现可测量的性能提升
- 발표
- IBM Research, Hugging Face 블로그, 2026-08-18
- 기법명
- ALTK-Evolve (가이드라인 추출·통합·검색 파이프라인, 가중치 업데이트 없음)
- 평가 벤치마크
- AppWorld, 585개 과제(test_normal 168 + test_challenge 417), 9개 시뮬레이션 앱
- DeepSeek-V3.2(671B MoE)
- 전체 가이드라인 세트 적용 시 TGC +9.5%p, SGC +16.1%p
- gpt-oss-120b(117B MoE)
- 압축 검색 방식 적용 시 TGC +16.1%p, 토큰 증가는 +5%에 그침
- GLM-5(745B MoE)
- 기억 추가에도 측정 가능한 성능 향상 없음, '포화' 패턴으로 분류
- GPT-5.5·Opus
- TGC는 포화 상태였지만 SGC는 각각 +7.2%p, +7.1%p 추가 상승
- 실험 모델 규모
- 30B 밀집모델부터 최상급 독점 모델까지 총 8개
让AI智能体把过去的经验全部反馈进去,听起来性能应该会提升,但实际情况并没有这么简单。IBM Research针对8个模型进行的实验显示,即便给予同样量的"记忆",有的模型性能大幅提升,有的模型反而受到干扰,而有的模型则毫无变化。
记忆也需要"处方"
IBM Research公开的ALTK-Evolve是一款从智能体自身过去执行任务的记录(trajectory)中提炼经验教训的工具。它会从成功和失败的任务中都提取可反复使用的行动准则——奏效的策略、应避免的错误、例外情况——并将其整合为一套指南集,在推理阶段重新输入给智能体。整个过程完全不改变模型权重,也没有人工打标签的环节。研究团队表示,因此引入成本较低,且可以直接迁移到不同模型上使用。
研究团队用AppWorld基准对这一记忆方法进行了验证。他们在日历、消息、支付等9个模拟应用中执行了585个多步骤任务(test_normal 168个,test_challenge 417个),并用两项指标打分。TGC(Task Goal Completion)是常见的完成率指标,衡量是否完整完成了单个任务;SGC(Scenario Goal Completion)则是更严格的指标,只有同一场景下的所有变体(数据、表述、例外条件各不相同的版本)全部通过才能得分。
8个模型,三种反应
研究团队从30B级密集模型到顶级专有模型共测试了8个,结果模型呈现出三种模式之一。
| 模型 | 规模 | 反应模式 | 完成率(TGC)变化 | 场景完成率(SGC)变化 |
|---|---|---|---|---|
| DeepSeek-V3.2 | 671B MoE | 偏好完整指南集 | +9.5个百分点 | +16.1个百分点 |
| gpt-oss-120b | 117B MoE | 偏好压缩检索 | +16.1个百分点 | 以+5%的token量完成 |
| GLM-5 | 745B MoE | 饱和(无变化) | 无可测量提升 | 无可测量提升 |
| GPT-5.5、Opus | - | TGC饱和,SGC仍在上升 | 已接近上限 | 分别为+7.2、+7.1个百分点 |
余量充足的强模型能够消化包含罕见例外情况在内的完整指南集,DeepSeek-V3.2就属于这一类。相反,相对较弱的模型反而被庞大的指南压垮。gpt-oss-120b在只挑选每个任务所需的少量高可信度核心指南的方式下表现最佳,所用token仅为使用完整指南集时的约一半。GLM-5无论采用哪种方式都没有出现明显变化,研究团队将其称为"饱和"模式,但并未断定具体原因,而是列出了多种可能——该任务本身已接近上限、指南未能触及剩余的失败点,或模型未能正确应用指南。
研究团队表示,哪个模型属于哪种模式并非仅由参数量决定。基准测试的余量、上下文窗口大小、架构、指南质量以及任务分布似乎都会产生影响,而将这些因素逐一分离的工作仍在进行中。
比完成率更严苛的指标:SGC
作为更严格的指标,SGC的变动幅度总体上大于TGC。DeepSeek的TGC提升9.5个百分点时,SGC跃升了16.1个百分点,研究团队解释称,这是因为好的指南对通过场景所有变体的贡献,大于对平均任务执行的贡献。这一效应在顶尖模型上依然存在。GPT-5.5和Opus在TGC上已接近上限,但SGC分别又提升了7.2和7.1个百分点。这意味着,只要还存在未解决的失败类型,记忆就能持续发挥作用。
Token成本与提示缓存
每一步都重新输入完整指南集的方式会推高输入token量。相比之下,压缩检索方式将成本维持在接近基线的水平,对较弱的模型而言在准确率和成本上都更有利。DeepSeek无论是否加入记忆,其ReAct步骤数平均都在18到19次之间,相差不大。也就是说,额外成本并非来自更长的推理过程,而是来自输入token的增加。研究团队指出,实际运营中降低成本的关键手段是提示缓存。指南集中每一步都重复出现的部分是可以被缓存的,如果将这部分前缀设计得稳定不变,即便是使用完整指南集的强模型,也能将成本降到实用水平。
局限与后续计划
研究团队强调,这一结果只是起点。目前的检索方式是基于余弦相似度对指南进行排序,团队确认这种方式无法完美预测某条指南是否真正对特定任务有帮助。此外,对于能力非常弱的模型,仅靠从自身轨迹中提炼的自我蒸馏方式信号不足,团队表示正在考虑采用独立教师模型蒸馏的方式。验证目前也仅限于AppWorld这一个基准,团队称将继续在更广泛的智能体基准和实际部署环境中进行验证。将上下文窗口大小与模型自身能力分离开来的对照实验,也仍是尚未完成的课题。
大约在同一时期,Nous Research也为其智能体应用Hermes Desktop发布了机器人模式,选择让每个机器人拥有各自独立的角色、模型和记忆。这表明,如何为智能体分配记忆,正是多家公司同时在探索的课题。
编辑视角
这项研究有趣的地方在于,它并没有推翻"给记忆就好"这一传统认知,而是为这一认知加上了一个条件。模型越强越能更好地消化更多信息,这与直觉相符,但745B规模的GLM-5毫无反应这一点表明,仅凭参数量无法预测记忆容量。对于实际设计过智能体系统的人来说,这是个熟悉的场景——把同样的提示工程技巧原封不动地套用到多个模型上,结果有的模型有反应,有的毫无反应,有的性能反而下降。这项研究结果,用数字把这种经验坐实了下来。
对于国内运营智能体流水线的团队来说,眼下有两点值得马上检查。第一,应根据当前使用的模型是上下文余量充足的高端模型,还是中小型模型,来分别设计指南注入方式。给中小型模型塞入全部手册的做法,只会增加token成本,反而可能损害性能。第二,仅凭完成率(TGC)单一指标来判断记忆的效果,会低估其实际收益。在本次实验中,顶尖模型的TGC上看不出变化,但SGC依然在提升。对于讲究可靠性的服务而言,应同时参考场景整体通过率等更严格的指标。
在接下来的几周内,这一问题很可能朝"检索算法升级"的方向发展。研究团队自己也承认了基于余弦相似度的检索方式的局限性,并预告下一步将采用根据结果信号进行学习的选择器(selector)。一旦有超出AppWorld范围、来自实际部署环境的验证结果出炉,目前这三种模式的分类也可能被进一步细分,甚至被推翻。



