
이미지: The Decoder 화면 갈무리
摘要
- 一项研究发现,在对长对话进行摘要压缩的过程中,用户设定的会话规则平均有83%会消失
- 宾夕法尼亚州立大学研究团队使用名为COMPINT的评估工具测算发现,压缩后的规则遵守率相比压缩前大幅下降
- 研究团队利用基于Qwen3.5-9B的小型附加模块,将保留率提升至90%以上
- 평균 지시 보존율
- 압축 후 17%(평균 83% 손실)
- 평가 도구
- 펜실베이니아주립대 개발 COMPINT
- 추가 모듈 베이스 모델
- Qwen3.5-9B
- 모듈 적용 후 보존율
- 에이전트 궤적 95.6%·장기 연구 95.1%·다중 턴 채팅 90.3%
- 비압축 상태 규칙 준수율
- 59~71%
- 특화 압축 프롬프트 보존율
- 40% 미만
- 공개 방식
- COMPINT와 추출 모듈 모두 GitHub 공개
对话变长,AI就会忘记规则
如果你曾给聊天机器人设定过"未经我批准不要发送邮件"之类的规则,那么随着对话变长,这条规则被遵守的概率反而会降低。宾夕法尼亚州立大学研究团队发表的研究显示,当AI系统对长对话记录进行摘要压缩时,用户设定的规则平均会消失83%,只剩下17%得以保留。
为什么需要压缩
AI模型一次能读取和记忆的对话量,也就是上下文窗口,是有限的。如果用户不开启新对话,而是在同一个窗口中持续对话,就会触及这一上限。业界针对此问题采用的解决方案是"压实(compaction)",即通过摘要已有对话内容来腾出空间。问题在于,摘要过程中细节信息必然会丢失。
研究团队将这类损失中最脆弱的一类定义为"会话约束(session constraints)"。例如"变更前请先向我确认""回答中不要使用我的名字"之类的规则,其有效期仅限于该次对话结束之前。由于这类规则并非任务本身的目标或下一步动作,因此很容易被排除在压缩系统优先保留的"任务连续性"对象之外。研究团队指出,这类规则在压缩后正是以这种方式被忽略的。
问题有多严重——COMPINT测量结果
为量化这种损失,研究团队开发了名为COMPINT的评估工具。在未压缩状态下,当用户规则原样保留时,AI代理的规则遵守率维持在59%至71%之间。而经过压缩后,这一数值急剧下降,许多情况下降至与完全没有规则时相近的水平。测试过的大多数压缩系统表现甚至不如完全不进行压缩,只有GPT-5.4-mini在部分情况下超过了不压缩的基准线。
即便对压缩提示词进行专门优化以保留用户规则,效果依然有限。研究团队另外设计的专门用于保留规则的提示词,其保留率也未能超过40%。
解决方案——单独提取规则的小型模块
研究团队提出的替代方案并非修改压缩系统本身,而是在其旁边单独运行一个小型模块。该模块基于阿里巴巴训练的Qwen系列紧凑型模型Qwen3.5-9B构建。其结构是:读取用户的所有输入,识别出会话约束并汇总为单独列表,待对话随后被摘要压缩时,将该列表附加到摘要内容中。
在测试的三种场景中,这一提取模块的保留率均超过90%:代理轨迹场景为95.6%,长期研究任务为95.1%,多轮聊天为90.3%。其特点在于无需更改压缩系统本身,也无需额外训练。
| 场景 | 应用提取模块后的保留率 |
|---|---|
| 代理轨迹 | 95.6% |
| 长期研究任务 | 95.1% |
| 多轮聊天 | 90.3% |
编辑视角
这项研究有趣之处不在于问题本身,而在于问题隐藏的方式。用户会相信自己设定的规则正在被遵守,但一旦对话变长,这种信任就失去了依据。更糟糕的是,这个问题是隐形的:AI依然流畅作答,任务照常推进,用户甚至察觉不到压缩已经发生。直到某一刻,邮件在未经批准的情况下被发出,或是被禁止透露的信息被暴露出来。
从将代理型AI应用于实际业务的经验来看,这种模式并不陌生。越是在对话初期设定的规则,随着对话变长,越容易感受到它不被遵守的概率在上升。以往人们只将这归结为模型的"记忆力"问题,而这项研究具体地表明,这其实是压缩算法的设计问题——为优先保证任务连续性而设计的压缩系统,在结构上就会排除用户的附加条件。
对于在实际业务中长时间保持聊天机器人或代理运行的组织而言,眼下能做的是养成反复重申会话规则的习惯,而不是只在对话开始时说一次。需要区分管理那些可以永久写入系统提示词的规则,和那些在对话中途提出、之后就会被遗忘的规则。尤其是涉及审批、安全的指令,不应仅依赖于会话本身,而应转移到系统层面的策略中去,这样更为安全。
未来几个月内,类似的保留模块很可能会被默认集成进主要AI平台的压缩功能中。既然上下文压缩已成为业界标准,修补其副作用的附加功能被纳入标准配置,恐怕只是时间问题。



