
이미지: X — 모델·오픈소스 화면 갈무리
摘要
- 腾讯混元通过X平台介绍了一篇探讨AI智能体自我进化(self-evolution)可信度的综述论文
- 论文按变化影响的深度将其划分为L0至L4五个层级,从输出层级到判断标准层级依次递进
- 论文主张,若自我进化真正可信,其证据应在该次更新的边界之外依然有效
- 발표 채널
- X(트위터) Tencent Hunyuan 공식 계정
- 발표 시각
- 2026-08-12T07:42:34+00:00
- 논문 제목
- Diving into Reliable Self-Evolving Agents: A Survey
- 핵심 프레임워크
- 변화의 깊이를 L0~L4 5단계로 구분
- L0~L2
- 출력·모델·스캐폴드(프롬프트·스킬·메모리·워크플로) 수준의 변화
- L3~L4
- 향후 업데이트를 제안·관리하는 방식과 그 판단 기준 자체의 변화
- 핵심 주장
- 신뢰할 수 있는 자기진화는 관련 업데이트 경계 밖에 남는 증거가 필요하다
智能体说自己变强了,凭什么相信
如果AI智能体在完成任务后自行重写提示词、整理记忆,甚至改变自己的评估标准,人类该依据什么来判断"它确实变得更好了"?腾讯混元(Tencent Hunyuan)8月12日通过X账号发布了一篇尝试回答这一问题的综述论文《Diving into Reliable Self-Evolving Agents: A Survey》。该论文系统梳理了智能体自我改变的方式,并绘制了一份地图,说明要信任每一次更新需要具备哪些证据。
将变化深度划分为五个层级
论文提出的核心框架是以"变化渗透的深度"为标准的五级分类。L0是仅影响当前正在执行任务的输出与行为层面变化;L1是改变可学习模型或策略本身的层级。L2是改变提示词、技能、记忆、工作流、以及包裹智能体执行结构的"脚手架"(harness)等骨架层面的阶段;L3涉及未来的更新由谁、以何种方式提出和管理;L4则是改变用于判断该行为及未来更新所依据的标准本身,是最深层的阶段。
| 级别 | 名称 | 影响范围 |
|---|---|---|
| L0 | 输出层级(Output-Level) | 仅限于当前任务 |
| L1 | 模型层级(Model-Level) | 可学习的模型・策略 |
| L2 | 脚手架层级(Scaffold-Level) | 提示词・技能・记忆・工作流 |
| L3 | 改进者层级(Improver-Level) | 未来更新的提议与管理方式 |
| L4 | 判断标准层级(Criterion-Level) | 用于判断行为・更新的标准 |
论文的论点很明确:像L0和L1这类局限于当前任务范围内的变化相对容易验证,但到了L2及以上层级,变化会延续到下一次任务、下一次更新中。腾讯混元在附图中明确指出,"需要在更新边界之外仍然成立的证据"。其背后的担忧在于,如果智能体连自我判断的标准本身都改变了,就可能陷入用改变后的标准来证明自身变化正确这样的循环论证。
为何这一问题在此时提出
自我进化型智能体近期在行业内正迅速超越实验阶段。8月8日,Kimi发布了"Agent Swarm"系统,最多可并行启动100个子智能体,处理超过1500次工具调用;8月10日,Sakana AI扩展了RSI Lab,将在物理世界中自我改进的"物理AI"确立为下一个研究前沿。方向各异,但共同前提相同:都是要打造无需人工介入、能自行提升性能的系统。
问题在于,证明这种改进的方法尚未跟上步伐。当模型自行重写提示词或改变记忆结构时,仅凭基准测试分数提升这一事实,很难判断该变化在其他情境下是否同样有效。腾讯混元的这篇综述可以理解为一次填补空白的尝试,正是针对这一问题——"应以何种证据来信任自我进化的结果"这一评估方法论上的空缺。
因此会带来什么改变
这篇论文本身并非新的模型或产品,但对于正在构建自我进化型智能体的团队而言,多了一条可参考的基准线。方向在于,不能仅凭"性能提升了"这一说法,而应先判断该变化属于L0到L4中的哪个层级,再要求与该层级相匹配的证据。这可以作为一份筛查清单,用来识别把脚手架层级的变化包装成模型层级改进、或改变判断标准本身却宣称有所改善之类的假象。对于打算将智能体投入实际服务的企业而言,在全盘接受"变得更聪明了"这类说法之前,又多了一份需要追问的问题清单。


