AI 모델 자체는 그대로 둔 채, 그 모델을 감싸는 실행 틀을 AI가 스스로 계속 고쳐 쓰게 했더니 성능이 올랐다
AI 모델 자체는 그대로 둔 채, 그 모델을 감싸는 실행 틀을 AI가 스스로 계속 고쳐 쓰게 했더니 성능이 올랐다
AI 에이전트는 모델(LLM) 자체뿐 아니라 그 모델이 작업을 수행하도록 감싸는 코드 틀인 하네스에 의해서도 성능이 크게 달라진다. 이 연구는 하네스를 작업별로 따로 두고, 얼려 놓은(파라미터를 바꾸지 않는) 하나의 LLM이 위계적으로 나뉜 세 역할을 맡아 하네스와 그 개선 전략까지 스스로 고쳐 쓰게 하는 HSI 프레임워크를 제시한다. BALROG라는 텍스트 기반 게임 벤치마크에서 DeepSeek-V4-Flash-Preview 모델로 실험한 결과, 중간 난이도 과제들에서는 초기 하네스 대비 뚜렷한 향상을 보였지만 모델 능력 자체가 부족한 어려운 과제(NLE)에서는 하네스를 아무리 고쳐도 개선이 없었다.
METAL LAB 해설 도표
AI 모델 자체는 그대로 둔 채, 그 모델을 감싸는 실행 틀을 AI가 스스로 계속 고쳐 쓰게 했더니 성능이 올랐다
- 01LLM 하나(파라미터 고정)를 작업 실행, 하네스 재작성(진화자), 진화 전략 재작성(메타 진화자)이라는 세 층위에 나눠 투입하고, 가장 바깥의 실행 로직만은 고정해 무제한적인 자기 참조를 막았다
- 02작업 실행 중에는 심층 추론(thinking)을 꺼서 성능 향상이 추론 능력 때문이 아니라 순수하게 하네스 개선 덕분임을 구분해서 확인했다
- 03BALROG의 중간 난이도 과제에서 원래 하네스 대비 원점수 기준으로 BabyAI +39.3, Crafter +33.0, TextWorld +25.0, MiniHack +15.0 향상을 얻었다
- 04BabaIsAI에서는 전체 과제 중 20%를 한 번도 보여주지 않고 떼어놓았는데도, 진화된 하네스가 BreakStop에서 0.98, GoTo에서 1.00의 최고 테스트 성적을 내며 낯선 과제에도 잘 통했다
- 05반대로 모델 능력을 넘어서는 어려운 과제(NLE)에서는 하네스를 아무리 진화시켜도 성능이 오르지 않아, 하네스 개선에는 명확한 한계가 있음을 보였다
무엇을 했나
- LLM 하나(파라미터 고정)를 작업 실행, 하네스 재작성(진화자), 진화 전략 재작성(메타 진화자)이라는 세 층위에 나눠 투입하고, 가장 바깥의 실행 로직만은 고정해 무제한적인 자기 참조를 막았다
- 작업 실행 중에는 심층 추론(thinking)을 꺼서 성능 향상이 추론 능력 때문이 아니라 순수하게 하네스 개선 덕분임을 구분해서 확인했다
- BALROG의 중간 난이도 과제에서 원래 하네스 대비 원점수 기준으로 BabyAI +39.3, Crafter +33.0, TextWorld +25.0, MiniHack +15.0 향상을 얻었다
- BabaIsAI에서는 전체 과제 중 20%를 한 번도 보여주지 않고 떼어놓았는데도, 진화된 하네스가 BreakStop에서 0.98, GoTo에서 1.00의 최고 테스트 성적을 내며 낯선 과제에도 잘 통했다
- 반대로 모델 능력을 넘어서는 어려운 과제(NLE)에서는 하네스를 아무리 진화시켜도 성능이 오르지 않아, 하네스 개선에는 명확한 한계가 있음을 보였다
| LLM | BabyAI | Crafter | TextWorld | MiniHack | NLE | Avg |
|---|---|---|---|---|---|---|
| Gemini-3-Pro | 96.0±2.8 | 57.3±4.4 | 60.2±7.5 | 40.0±7.7 | 6.8±3.2 | 52.1±5.1 |
| Gemini-3.1-Pro-Thinking | 98.0±2.0 | 55.0±6.4 | 75.7±6.4 | 27.5±7.1 | 2.6±0.3 | 51.8±4.4 |
| Gemini-3.1-Pro | 100.0±0.0 | 46.8±4.2 | 66.5±7.5 | 35.0±7.5 | 3.0±0.5 | 50.3±3.9 |
| Gemini-3-Flash | 86.0±4.9 | 45.0±6.3 | 50.2±8.1 | 30.0±7.2 | 4.0±0.8 | 43.0±5.5 |
| Grok-4 | 76.0±6.0 | 57.3±3.9 | 62.9±7.9 | 17.5±6.0 | 1.8±0.8 | 43.1±4.9 |
| Claude-Opus-4.5 | 80.0±5.7 | 49.5±3.1 | 51.4±8.4 | 27.5±7.1 | 2.0±0.5 | 42.1±5.0 |
| Claude-Opus-4.5-Thinking | 72.0±6.3 | 48.6±3.2 | 59.0±8.0 | 30.0±7.2 | 2.4±0.3 | 42.4±5.0 |
| Gemini-2.5-Pro-Exp-03-25 | 80.0±5.7 | 55.0±6.0 | 49.2±8.2 | 17.5±6.0 | 1.7±0.2 | 40.7±5.2 |
| DeepSeek-R1 | 74.0±6.2 | 36.4±3.8 | 21.8±6.1 | 25.0±6.8 | 1.4±0.5 | 31.7±4.7 |
| GPT-5-minimal-think | 80.0±5.7 | 39.1±4.1 | 30.6±7.0 | 20.0±7.3 | 1.3±0.5 | 34.2±4.9 |
| Claude-3.5-Sonnet | 68.0±6.6 | 32.7±3.2 | 42.1±5.4 | 15.0±5.6 | 0.6±0.5 | 31.7±4.3 |
| GPT-4o | 77.6±3.7 | 33.1±2.3 | 39.3±5.2 | 10.0±4.7 | 0.4±0.4 | 32.1±3.3 |
| DS-V4-Flash (Init harness) | 42.0±3.5 | 11.6±5.0 | 40.0±6.2 | 0.8±1.9 | 0.0 | 18.9±3.3 |
| DS-V4-Flash w. HSI (meta-off) | 77.3±1.2 | 36.4±1.6 | 46.0±2.4 | 5.8±3.8 | 0.0 | 33.1±1.8 |
| DS-V4-Flash w. HSI (meta-on) | 81.3±4.2 | 44.6±3.2 | 65.0±3.0 | 15.8±2.9 | 0.2±0.3 | 41.4±2.7 |

| Sub-suite | Init Harness | Best Dev | Best Test (meta-on) | Best Test (meta-off) |
|---|---|---|---|---|
| BreakStop | 0.0333±0.0334 | 1.0000 | 0.9800±0.0632 | 1.0000±0.0000 |
| GoTo | 0.1818±0.0802 | 1.0000 | 1.0000±0.0000 | 0.9636±0.0809 |
| Make | 0.0000 | 0.5556 | 0.3625±0.3284 | 0.3375±0.2029 |

| Suite | Setup | Dev | Val | Test ep. | Dev ep. | Test rep. | Meta | Submit-best |
|---|---|---|---|---|---|---|---|---|
| TextWorld | A | 1.0 | 0.00 | 10 | 3 | 3 | off | 50 |
| BabyAI | A | 1.0 | 0.00 | 10 | 3 | 3 | on | 80 |
| Crafter | A | 1.0 | 0.00 | 5 | 3 | 3 | on | 50 |
| MiniHack | A | 1.0 | 0.00 | 5 | 1 | 3 | on | 80 |
| NLE | A | 1.0 | 0.00 | 5 | 1 | 1 | on | 50 |
| BabaIsAI-BreakStop | B | 0.8 | 0.20 | 5 | 1 | 1 | off | 80 |
| BabaIsAI-GoTo | B | 0.8 | 0.25 | 5 | 1 | 1 | on | 80 |
| BabaIsAI-Make | B | 0.8 | 0.25 | 5 | 1 | 1 | on | 80 |
| Method | Proposer | Surface | Domain | Feature |
|---|---|---|---|---|
| Meta-Harness | External stronger | Full harness code | Coding, math | Full-trajectory feedback |
| Self-Harness | Self (target) | Config interface | Coding | Model-specific edits |
| AHE | External stronger | Decoupled comps | Coding | Observability bottleneck |
| HarnessX | Multi-agent | Typed processors | 5 benchmarks | Operational mirror to RL |
| DGM | Self | Full codebase | Coding | Archive-based search |
| HGM | Self | Full codebase | Coding | Clade meta-productivity |
| GEA | Self (group) | Codebase + exp | Coding | Shared experience pool |
| SICA | Self | Full codebase | Coding | Framework saturation |
| HyperAgents | Fused self | Codebase + meta | Coding, robots | Editable meta-mechanism |
| Live-SWE-Agent | Self (runtime) | Tools on-the-fly | Coding | Zero offline cost |
| TTHE | Self (test-time) | Harness population | Coding, SQL | Unlabeled trace adaptation |
| Rethinking Eval. | — (critique) | — | Coding | Test-time-scaling confound |
| Statistical Limits | — (theory) | — | PAC learning | VC bound ⇔ learnability |
| HSI (Ours) | Same frozen M | 3-layer hierarchy | BALROG | Endogenous hierarchy with frozen outer anchor |
왜 중요한가
지금까지는 프롬프트나 도구를 사람이 손으로 고치는 방식이 흔했는데, 이 연구는 그 틀 자체를 AI가 스스로, 그것도 여러 층위로 나눠서 안전하게 고쳐 쓸 수 있음을 보여준다. 다만 모델 자체의 한계는 하네스로 뛰어넘을 수 없다는 사실도 함께 밝혀, 에이전트 개발자가 어디에 투자해야 하는지에 대한 실질적 기준을 제공한다.
이 논문의 용어
- 하네스(harness) · 모델을 감싸서 실제로 과제를 수행하게 만드는 프롬프트, 도구, 메모리, 실행 로직 등의 코드 틀
- 얼려 놓은 모델(frozen LLM) · 학습된 파라미터를 바꾸지 않고 그대로 고정해 사용하는 모델
- 진화자/메타 진화자(evolver/meta-evolver) · 각각 하네스를 고쳐 쓰는 역할과, 그 고쳐 쓰는 전략 자체를 다시 고쳐 쓰는 역할
- % Progress · BALROG 벤치마크에서 과제 완료 정도를 0~100 점수로 나타내는 지표
- held-out(홀드아웃) 일반화 · 훈련·개선 과정에서 전혀 보여주지 않은 과제로 성능을 테스트해 실제 응용력을 확인하는 방식
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 비서가 뭘 기억할지 결정할 때, '물어봐야 할 순간'에 되레 세상에 확인하고 넘어간다AI 비서가 뭘 기억할지 결정할 때, '물어봐야 할 순간'에 되레 세상에 확인하고 넘어간다
- 단어 뜻이 언제 어떻게 변했는지, 문법 구조까지 뜯어서 보여주는 오픈소스 도구단어 뜻이 언제 어떻게 변했는지, 문법 구조까지 뜯어서 보여주는 오픈소스 도구
- AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다
METAL LAB 최신 기사
그림 출처: Tailin Zhou et al., arXiv:2608.08466, CC BY 4.0