RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States
让自我进化的LLM智能体记忆越积越乱、奖励误发的问题,被压缩成四个固定格子解决
自我进化的LLM智能体会把过往经验存成记忆,并给每条记忆学习一个有用度分数,但随着经验累积,需要打分的对象不断增多,有限的反馈被稀释,而且一次任务成功的奖励会同时分给所有被共同检索出来的记忆,导致无关记忆也被错误地记上功劳,陷入所谓的记忆-奖励陷阱。RoMeRL不再让记忆空间无限增长,而是按结果极性(成功/失败)和记忆动态(长期代表/最近变化)交叉出四个固定格子来循环存放经验。在ALFWorld和LifelongAgentBench上的实验显示,性能提升的同时,冷启动比例、记忆规模和LLM调用次数都大幅下降。
METAL LAB 解读图
RoMeRL:把不断增长的记忆压缩进四个固定格子
证据状态已报告实测结果
- 原有问题每条存储轨迹都有单独的有用度分数,经验越多打分对象越多,共享的任务奖励又会错误地记到无关的共同检索记忆上
- 四个固定坐标按成功/失败与代表案例/最近变化交叉得到四格:PCC(最优成功案例)、PAC(失败后首次成功)、NCC(有价值的失败经验)、NAC(最近一次失败)
- 在线更新与替换新经验到来时只更新或替换对应格子的内容,并继承原有有用度分数作为热启动,而不新增永久变量
- 理论依据证明坐标越少每个坐标平均获得的反馈越多,并用污染-清理转移模型给出错误坐标残留比例的上界
- 实测效果在ALFWorld和LifelongAgentBench上:成功率提升,冷Q比例降低80.0%,反馈密度提升约6.0倍,记忆规模减少84.4%,LLM调用减少21.1%
他们做了什么
- 问题所在:现有的可学习记忆系统给每条存储的轨迹单独分配一个有用度分数,经验越多,需要打分的对象空间就越大,有限的反馈被摊薄到越来越多的对象上。
- 记忆-奖励陷阱:一次任务的成功奖励会同时分给该次任务中被一起检索出来的所有记忆,导致实际上没有贡献的无关记忆也可能获得正向更新并持续存留。
- 解决方法:RoMeRL对每个任务只保留四个固定的语义坐标——按结果极性(成功/失败)与记忆动态(长期巩固代表/最近适应性变化)交叉得到PCC、PAC、NCC、NAC——新经验到来时只更新或替换这四格的内容,而不新增永久变量。
- 理论分析:作者证明减少坐标数量会提高每个坐标平均获得的反馈次数,并用一个通用的状态转移模型分析了错误坐标被污染又被清理的过程,给出错误坐标残留比例的上界。
- 实验结果:在ALFWorld和LifelongAgentBench(OS、DB任务)上,RoMeRL相比最强基线整体平均成功率提高3.2个百分点,从未获得更新的"冷Q"比例降低80.0%,反馈密度提升约6.0倍,记忆规模减少84.4%,LLM调用次数减少21.1%。

| Method | Lifelong Agent Bench | ALFWorld | Overall Avg. | LLM Calls Avg Num. | Memory Avg Num. | ||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| OS Last / CSR | OS | Last / CSR | DB Last / CSR | DB | Last / CSR | P&P | Examine | Clean | Heat | Cool | Pick-2 |
| OS | |||||||||||
| Last / CSR | |||||||||||
| DB | |||||||||||
| Last / CSR | |||||||||||
| Model | DS-V4-flash | DS-V4-flash | GPT-5.4-mini | – | – | – | |||||
| No Memory | 0.646 | 0.550 | 0.883 | 0.827 | 0.861 | 0.850 | 0.855 | 0.788 | 0.783 | – | – |
| Pass@10 | – / 0.756 | – / 0.906 | – | – | – | – | – | – | – | – | – |
| RAG | 0.700 / 0.752 | 0.556 / 0.844 | 0.891 | 0.834 | 0.868 | 0.855 | 0.858 | 0.796 | 0.795 | – | – |
| Mem0 | 0.691 / 0.733 | 0.575 / 0.841 | 0.897 | 0.841 | 0.873 | 0.858 | 0.872 | 0.805 | 0.802 | – | – |
| MemP | 0.768 / 0.796 | 0.631 / 0.942 | – | – | – | – | – | – | – | 570K | 45K |
| MemRL | 0.808 / 0.820 | 0.632 / 0.934 | 0.908 | 0.855 | 0.887 | 0.865 | 0.871 | 0.812 | 0.830 | 570K | 45K |
| RoMeRL (ours) | 0.824 / 0.838 | 0.680 / 0.952 | 0.968 | 0.957 | 0.901 | 0.862 | 0.880 | 0.826 | 0.862 | 450K | 7K |

| Method | Round-10 SR (%) ↑ | Positive Noise Updates ↓ | Final Noise Ratio (%) ↓ |
|---|---|---|---|
| MemRL | 79.2 | 3.7 | 1.02 |
| MemRL + UCB | 78.4 | 7.2 | 1.20 |
| RoMeRL | 82.0 | 2.4 | 0.15 |
| Inference Model | Base | Transfer | Gain (Δ) |
|---|---|---|---|
| LifelongAgentBench–OS | |||
| GPT-5.4-mini | 67.0 / 3.23 | 81.6 / 2.22 | +14.6 / -1.01 |
| Gemini-3.5-flash | 74.0 / 4.53 | 81.4 / 3.02 | +7.4 / -1.51 |
| LifelongAgentBench–DB | |||
| GPT-5.4-mini | 93.0 / 2.15 | 96.8 / 2.00 | +3.8 / -0.15 |
| Gemini-3.5-flash | 96.2 / 2.44 | 97.6 / 2.18 | +1.4 / -0.26 |

| Component | Configuration / Version | Notes |
|---|---|---|
| Backbone LLM | DS-V4-flash | Used for LifelongAgentBench |
| GPT-5.4-mini | Used for ALFWorld | |
| Embedding Model | Text-Embedding-3-Large | Used for Intent and Query encoding |
| Generation Params | Temperature =0.0 | General (Greedy decoding) |
| Top-p =1.0 | Default |
| Benchmark Setting | ||||
|---|---|---|---|---|
| Parameter | Description | Lifelong Bench (OS) | Lifelong Bench (DB) | ALFWorld |
| RoMeRL (Ours) | ||||
| α | Learning Rate | 0.3 | 0.3 | 0.3 |
| ωQ | Q-Weight Balance | 0.5 | 0.5 | 0.5 |
| δ | Similarity Threshold | 0.50 | 0.37 | 0.62 |
| k1 | Cosine Similarity Recall Size | 10 | 10 | 5 |
| k2 | Final Memory Selection Size | 5 | 5 | 3 |
| Qinit | Initial Q-value | 0.5 | 0.5 | 0.0 |
| Baselines | ||||
| kRAG | Retrieval Top-k | 5 | 5 | 3 |
| kSelfRAG | Retrieval Top-k | 5 | 5 | 3 |
| kMemP | Retrieval Top-k | 5 | 5 | 3 |
| Benchmark | Runtime Learning | Transfer Learning | Split / Note |
|---|---|---|---|
| Lifelong Agent (OS) | 500 tasks | 500 tasks | 7:3 Split (Seed 42) |
| Lifelong Agent (DB) | 500 tasks | 500 tasks | 7:3 Split (Seed 42) |
研究结果
- RoMeRL的整体平均成功率达到0.862,比最强基线的0.830高出3.2个百分点(Table 1)。
- 在OS任务上,MemRL的冷Q比例从约29%升高到44.9%,而RoMeRL从约28%降到9.0%,反馈密度从4.96提升到29.93,约6.0倍(Figure 3)。
- 平均记忆规模从45K降到7K,减少84.4%;LLM调用次数从570K降到450K,减少21.1%(Table 1)。
- 在注入10%噪声的受控压力测试中,给MemRL加上UCB探索后,噪声条目获得的正向更新次数从3.7升到7.2,最终噪声比例从1.02%升到1.20%,而RoMeRL将两者分别限制在2.4和0.15%,同时取得最高的82.0%成功率(Table 2)。
- 在四种模型-任务组合的跨模型记忆迁移实验中,迁移已学习的冻结记忆状态均提升了验证得分并减少了平均执行步数(Table 3)。

可应用场景
- 为长期运行、经验不断累积的任务自动化或客服类智能体设计记忆管理结构
- 在存储和LLM调用成本有限的智能体系统中控制资源开销
- 将智能体切换到不同的LLM后端时,复用此前学到的过程性记忆

局限与待验证事项
- 仍然依赖任务级的最终结果奖励,尚未完全解决记忆之间的因果功劳分配问题。
- 要真正估计理论模型中的污染与清理转移参数(gamma、lambda),需要通过反事实回放等方式获得坐标级别的因果标签,这一点尚未验证。
- 实验仅限于ALFWorld以及LifelongAgentBench的OS、DB子任务,更开放、更长视野的场景评估留待未来工作。
- 四个固定坐标(2x2结构)是论文给出的最小设计,结合更细粒度奖励或其他划分标准的扩展尚未验证。
为什么重要
智能体运行时间越长,记忆越可能无限膨胀,带来存储成本和奖励误判的风险,这对长期运行的实际部署系统是个现实问题。这项工作说明,不需要重新训练底层LLM,仅通过改变记忆结构、把记忆压缩成固定大小,也能在保持或提升性能的同时大幅降低成本与污染风险。
本文术语
- 冷Q比例(Cold-Q ratio) · 当前记忆代表项自加入以来从未获得直接有用度更新的比例,数值越低说明反馈越有效地传达到了记忆
- 记忆-奖励陷阱(MRT) · 一次任务的共享奖励被同时记到所有共同检索出的记忆上,导致没有实际贡献的记忆也获得正向更新
- PCC/PAC/NCC/NAC · RoMeRL维护的四个固定记忆格:正向巩固代表、正向适应性转变、负向巩固代表、负向最近失败
- 累计成功率(CSR) · 在多个训练轮次(epoch)中至少被成功解决过一次的任务比例
论文原文摘要(英文)
Learning-based memory systems for self-evolving LLM agents face two tightly coupled challenges. First, trajectory-indexed utilities grow with the interaction history, thereby dispersing limited feedback over an ever-expanding state space. Second, because trajectory-level rewards are jointly assigned to co-retrieved memories, irrelevant experiences may receive misleading utility updates and consequently enter the memory-reward trap. To address these challenges, we introduce Reduced-Order Memory Reinforcement Learning (RoMeRL), which represents the growing trajectory-indexed utility space using a fixed-dimensional per-task memory state factorized by outcome polarity and memory dynamics. RoMeRL incorporates new experiences through a fixed set of semantic coordinates whose contents are updated or replaced over time, thereby concentrating feedback over a bounded utility support. Theoretically, we show that this reduced-order parameterization increases the average feedback received by each utility coordinate and characterize the steady-state occupancy of erroneous coordinates under a generic coordinate-transition model. Empirically, across ALFWorld and LifelongAgentBench, RoMeRL improves task performance, reduces the Cold-Q ratio by 80.0%, increases feedback density by approximately 6.0 times, reduces the maintained memory size by 84.4%, and cuts LLM calls by 21.1%. These results show that reduced-order utility states support efficient self-evolving agent memory while limiting persistent reward contamination. Code is available at: https://github.com/YOUNG-fnxm/RoMeRL
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM AgentsAI助手在该向你提问的时候,却更愿意自己去核实事实
- SynFlow: A Multidimensional Diachronic Semantic Analysis Toolkit一款把单词意义变化拆解到语法细节的开源分析工具
- Automated Summarization of Financial News Using Large Language Models and Retrieval-Augmented Generation: An Early Empirical Study (Fall 2023)用AI总结股市新闻发现:简单的摘要方法反而比时髦的检索增强技术更靠谱
METAL LAB 最新报道
图片来源: Yi Yang et al., arXiv:2608.02508, arxiv-nonexclusive