Looped Language Models Improve Compositional Tool Calling
생각을 여러 번 되짚는 AI가 여러 개의 도구를 순서대로 엮어 쓰는 일도 더 잘한다
AI 모델이 답을 내기 전에 같은 계산 블록을 여러 번 반복 통과시키는 루프드 언어모델(looped language model)을 API-Bank, BFCL, NESTful이라는 세 가지 도구 호출 벤치마크로 테스트했다. 같은 데이터와 학습 방식으로 맞춰 비교한 결과, 여러 API를 순서대로 조합하거나 앞선 결과를 다음 호출의 입력으로 넘기는 복합적인 작업에서 반복 계산이 뚜렷한 성능 향상을 보였다. 매번 고정된 횟수만큼 반복하는 대신 필요한 만큼만 반복을 늘리는 적응형 추론 방식이 더 적은 연산으로 비슷하거나 더 나은 성능을 냈다.
무엇을 했나
- Ouro-1.4B, Ouro-2.6B 같은 원래부터 루프 구조인 모델과, Llama-3.2-1B·OLMo-2-1B를 개조해 루프 구조로 만든 모델 두 종류를 실험했다
- 같은 학습 데이터(Hermes function-calling dataset)와 동일한 학습 설정으로 루프 모델과 일반 모델을 나란히 비교했다
- 단순히 하나의 API만 부르는 작업에서는 루프 모델의 이득이 작고 모델마다 달랐지만, 여러 호출을 병렬로 묶거나 앞 결과를 다음 호출에 넘기는 작업에서는 이득이 훨씬 컸다
- 반복 횟수(recurrent depth)를 1~8회로 바꿔가며 테스트하니 복합 작업 성능이 대체로 반복이 늘수록 좋아지다가 일정 수준에서 멈췄다
- 토큰마다 필요한 만큼만 반복하는 적응형 추론이 고정 반복 방식보다 더 적은 계산으로 같은 수준의 성능을 냈고, 반복을 거듭할수록 틀렸던 함수 선택이나 빠뜨린 종속 호출이 점차 올바르게 고쳐지는 모습도 확인됐다
| Model | Training | Simple | Multiple | Parallel | Par.-Mult. | Overall |
|---|---|---|---|---|---|---|
| Ouro-1.4B | Base | 65.3 | 67.0 | 35.0 | 44.5 | 55.4 |
| SFT | 91.8 | 90.0 | 67.5 | 55.5 | 79.3 | |
| Ouro-2.6B | Base | 80.5 | 75.5 | 2.0 | 1.0 | 47.9 |
| SFT | 92.3 | 88.0 | 83.0 | 76.5 | 86.4 | |
| Qwen3-1.7B | Base | 1.5 | 0.0 | 0.0 | 0.0 | 0.6 |
| SFT | 67.0 | 57.0 | 3.0 | 9.5 | 40.7 | |
| Instruct | 91.8 | 91.5 | 83.5 | 81.0 | 87.9 | |
| Qwen3-4B | Base | 72.0 | 57.5 | 1.0 | 0.5 | 40.6 |
| SFT | 94.3 | 87.0 | 2.5 | 5.5 | 56.7 | |
| Instruct | 93.0 | 92.5 | 87.5 | 88.5 | 90.9 | |
| Qwen3-8B | Instruct | 95.5 | 96.0 | 91.5 | 89.5 | 93.6 |
| Llama-3.2-1B | Instruct | 18.2 | 2.5 | 4.0 | 4.5 | 9.5 |
| Llama-3.2-3B | SFT | 88.2 | 86.0 | 69.0 | 60.5 | 78.4 |
| Instruct | 33.8 | 37.0 | 0.0 | 0.0 | 20.9 | |
| Llama-3.1-8B | Instruct | 46.5 | 41.0 | 0.0 | 0.0 | 26.8 |
| OLMo-2-1B | SFT | 59.2 | 50.0 | 14.5 | 12.5 | 39.1 |
| Looped SFT | 55.0 | 58.0 | 26.5 | 14.5 | 41.8 | |
| Llama-3.2-1B | SFT | 29.8 | 28.5 | 14.0 | 5.0 | 21.4 |
| Looped SFT | 43.5 | 40.5 | 31.0 | 6.0 | 32.9 |
| Model | Training | Function F1 | Parameter F1 | Partial | Full | Win Rate |
|---|---|---|---|---|---|---|
| Ouro-1.4B | Base | 0.905 | 0.539 | 0.149 | 0.091 | 0.110 |
| SFT | 0.899 | 0.566 | 0.219 | 0.131 | 0.191 | |
| Ouro-2.6B | Base | 0.920 | 0.595 | 0.207 | 0.128 | 0.190 |
| SFT | 0.922 | 0.680 | 0.295 | 0.204 | 0.371 | |
| Qwen3-1.7B | Base | 0.000 | 0.000 | 0.000 | 0.000 | 0.000 |
| SFT | 0.000 | 0.000 | 0.000 | 0.000 | 0.000 | |
| Instruct | 0.924 | 0.555 | 0.202 | 0.109 | 0.134 | |
| Qwen3-4B | Base | 0.000 | 0.000 | 0.000 | 0.000 | 0.000 |
| SFT | 0.458 | 0.309 | 0.156 | 0.001 | 0.063 | |
| Instruct | 0.971 | 0.703 | 0.285 | 0.196 | 0.292 | |
| Qwen3-8B | Instruct | 0.979 | 0.774 | 0.329 | 0.246 | 0.345 |
| Llama-3.2-3B | Base | 0.911 | 0.561 | 0.208 | 0.155 | 0.146 |
| SFT | 0.911 | 0.495 | 0.175 | 0.093 | 0.095 | |
| Instruct | 0.929 | 0.419 | 0.160 | 0.033 | 0.060 | |
| Llama-3.1-8B | Instruct | 0.657 | 0.342 | 0.137 | 0.030 | 0.073 |

| (a) Controlled models |
|---|
| Base SFT Model Call Exact Parse Call Exact Parse Ouro-1.4B 73.0 67.6 95.1 75.1 70.2 97.2 Ouro-2.6B 79.2 76.9 99.2 79.9 77.1 99.7 Qwen3-1.7B 5.1 5.1 13.9 61.4 57.8 93.6 Qwen3-4B 71.2 71.2 99.2 76.6 73.8 99.7 Llama-3.2-1B 1.7 1.3 10.8 16.3 14.1 55.3 Llama-3.2-3B 0.3 0.3 0.3 68.5 64.5 99.7 OLMo-2-1B 1.9 0.5 35.7 37.1 33.2 99.5 OLMo-2-1B (Loop) 0.1 0.0 1.5 34.0 30.3 90.7 Llama-3.2-1B 1.7 1.3 10.8 16.3 14.1 55.3 Llama-3.2-1B (Loop) 0.1 0.0 1.5 17.9 16.2 43.4 |
| Benchmark | Candidate tools | Call structure | Dependencies | Primary challenge |
|---|---|---|---|---|
| API-Bank | one or more | typically |Cx|=1 | Ex=∅ | Tool and argument grounding |
| BFCL Simple | |𝒯x|=1 | |Cx|=1 | Ex=∅ | Argument grounding |
| BFCL Multiple | |𝒯x|>1 | |Cx|=1 | Ex=∅ | Function selection |
| BFCL Parallel | one or more | |Cx|>1 | Ex=∅ | Independent call generation |
| BFCL Parallel-Multiple | |𝒯x|>1 | |Cx|>1 | Ex=∅ | Selection and call composition |
| NESTful | multiple | |Cx|>1 | typically |Ex|>0 | Dependency-aware execution |
왜 중요한가
여러 API를 조합해 작업을 수행하는 AI 에이전트를 만들 때, 모델 크기를 키우지 않고도 필요한 순간에만 계산을 더 투입해 정확도를 높일 수 있다는 실마리를 준다. 특히 이전 호출 결과를 다음 호출에 넘기는 복잡한 워크플로우를 다루는 실무 시스템 설계에 참고할 만하다.
이 논문의 용어
- 루프드 언어모델(Looped Language Model) · 동일한 신경망 블록을 답을 내기 전에 여러 번 반복 적용해 계산량을 늘리는 모델 구조
- 반복 깊이(recurrent depth) · 추론 시 같은 블록을 몇 번 통과시키는지를 나타내는 값
- 적응형 추론(adaptive inference) · 토큰마다 필요한 만큼만 반복 횟수를 조절해 계산량과 성능의 균형을 맞추는 방식
- 리트로핏(retrofitted) 모델 · 기존에 학습된 일반 모델 일부 층을 반복 구조로 개조한 모델
- AST 정확도(semantic AST accuracy) · 생성된 함수 호출을 표준화한 구조로 바꿔 정답과 의미적으로 같은지 비교하는 채점 방식
논문 원문 초록 (영문)
Looped language models have shown promising results on reasoning benchmarks, yet their potential for agentic tool use remains largely unexplored. We study this question in compositional tool-calling settings, where models must coordinate multiple API calls, maintain intermediate state, and preserve dependencies across tool interactions. We evaluate native and retrofitted looped language models on API-Bank, BFCL, and NESTful, comparing looped and no
arXiv에서 원문 보기최신 논문
- FM-Bench: A Benchmark for Long-Horizon Management with Competing AgentsAI에게 축구 구단을 20년간 통째로 맡겨보니, 승패는 계산력이 아니라 '경영 감각'에서 갈렸다
- FinRCA-Bench: Benchmarking Evidence Retrieval and Reasoning for Financial AI SystemsAI가 '정답'을 맞혀도, 정작 증거는 못 찾는 경우가 대부분이었다 - 재무 이상거래 진단 AI의 숨은 약점
- FACET: Preserving Source Intent and Executable State in Terminal Task SynthesisAI 에이전트에게 '터미널 문제집'을 정합성 있게 만들어주는 파이프라인, FACET
- Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models음성·소리를 알아듣는 AI, 지시문 학습 없이 '연결 다리'만 훈련해도 충분하다
- Adversarial Review: Structured Disagreement for Grounded Agentic Code ReviewAI 코딩 에이전트, 에이전트 늘리기보다 '검토자 vs 비판자' 한 쌍이 더 똑똑하게 일한다
- Bridging Search and CRM: Productionizing AI Product Research Agents for Customer Re-Engagement쇼핑몰 검색에서 이탈한 고객을 AI 에이전트가 다시 카톡(왓츠앱)으로 불러온 이야기
- GenEx: A Graph-Based Representational Paradigm for SARS-CoV-2 Variant Detection via Codon Co-occurrence Networks바이러스 유전자 서열을 코돈끼리 서로 옆에 등장하는 관계망(그래프)으로 바꿔 변이를 구분하는 법
- Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval이미지-긴문장 검색 AI가 '이미 다 맞혔다'고 착각해서 정작 헷갈리는 문제를 못 배우던 버릇을 고쳤다
METAL LAB 최신 기사
그림 출처: Andrei Cristian Popescu et al., arXiv:2608.18171, CC BY 4.0