SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning
AI 에이전트 학습에서 별도 비평가 모델과 여러 번의 시행 없이도 한 번의 시도만으로 더 잘 배우게 만드는 방법
SAPO는 언어모델 하나로 정책(행동을 고르는 부분)과 가치(그 행동이 얼마나 좋은지 평가하는 부분)를 동시에 뽑아내는 학습 방식이다. 기존 방식들은 같은 과제를 여러 번 시도해 비교하거나 별도의 평가 모델을 따로 두어야 했는데, SAPO는 문장을 생성하는 순서 그 자체를 이용해 한 번의 시도만으로 두 가지를 함께 학습한다. ALFWorld와 WebShop이라는 다단계 과제 환경에서 기존 PPO와 GRPO 방식보다 각각 평균 15.1점, 12.1점 더 높은 성공률을 보였고, 반복당 처리 시간도 PPO보다 33.2% 줄였다.
무엇을 했나
- 기존 그룹 상대 방식(GRPO 등)은 같은 과제를 여러 번 시도해 보상을 비교해야 하는데, 보상이 다 비슷하면 학습 신호가 사라지는 문제와 시도 횟수와 성능 사이의 비용 문제가 있었다
- SAPO는 하나의 언어모델이 문장을 만들어가는 순서(앞부분은 상태 요약, 중간은 행동 생성, 끝부분은 그 행동 평가) 안에서 정책과 가치를 동시에 읽어내도록 설계했다
- 행동 하나마다 발생하는 보상을 뒤에서부터 거슬러 계산하는 방식(람다-리턴)과 배치 단위 정규화를 결합해 각 턴의 기여도를 안정적으로 추정한다
- Qwen2.5-1.5B와 7B 모델로 ALFWorld, WebShop에서 실험한 결과 PPO 대비 평균 15.1퍼센트포인트, GRPO 대비 12.1퍼센트포인트 성공률이 올랐고, 별도 비평가 모델의 메모리 비용이 없어졌으며 반복당 실행 시간이 PPO 대비 33.2% 줄었다

| Type | Method | ALFWorld | WebShop | |||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Pick | Look | Clean | Heat | Cool | Pick2 | All | Score | Succ. | ||
| Closed-Source Model | ||||||||||
| Prompting | GPT-4o | 75.3 | 60.8 | 31.2 | 56.7 | 21.6 | 49.8 | 48.0 | 31.8 | 23.7 |
| Prompting | Gemini-2.5-Pro | 92.8 | 63.3 | 62.1 | 69.0 | 26.6 | 58.7 | 60.3 | 42.5 | 35.9 |
| Qwen2.5-1.5B-Instruct | ||||||||||
| Prompting | ReAct | 17.4 | 20.5 | 15.7 | 6.2 | 7.7 | 2.0 | 12.8 | 40.1 | 11.3 |
| Prompting | Reflexion | 35.3 | 22.2 | 21.7 | 13.6 | 19.4 | 3.7 | 21.8 | 55.8 | 21.9 |
| RL Training | RLOO | 88.3±3.0 | 52.8±8.6 | 71.0±5.9 | 62.8±8.7 | 66.4±5.5 | 56.9±4.7 | 69.7±2.5 | 73.9±5.6 | 52.1±6.7 |
| RL Training | EMPG | 85.5 | 33.5 | 78.9 | 76.2 | 74.7 | 89.1 | 73.7 | 80.4 | 60.8 |
| RL Training | GiGPOw/ std | 94.4±5.9 | 67.5±4.6 | 94.8±3.8 | 94.4±7.8 | 79.8±4.7 | 76.4±5.4 | 86.7±1.7 | 83.1±1.6 | 65.0±3.2 |
| RL Training | GiGPOw/o std | 96.0±1.4 | 76.5±3.9 | 91.8±5.5 | 91.3±6.3 | 71.7±8.4 | 79.5±7.7 | 86.1±4.7 | 83.5±1.8 | 67.4±4.5 |
| RL Training | PPO (with critic) | 64.8±3.5 | 40.5±6.9 | 57.1±4.9 | 60.6±6.6 | 46.4±4.0 | 47.4±1.9 | 54.4±3.1 | 73.8±3.0 | 51.5±2.9 |
| RL Training | GRPO | 85.3±1.5 | 53.7±8.0 | 84.5±6.8 | 78.2±7.9 | 59.7±5.0 | 53.5±5.6 | 72.8±3.6 | 75.8±3.5 | 56.8±3.8 |
| RL Training | SAPO | 92.0±2.9 | 76.9±6.3 | 100.0±0.0 | 100.0±0.0 | 82.8±4.7 | 82.4±5.0 | 90.1±2.3 | 82.21.4 | 63.71.6 |
| Qwen2.5-7B-Instruct | ||||||||||
| Prompting | ReAct | 48.5 | 35.4 | 34.3 | 13.2 | 18.2 | 17.6 | 31.2 | 46.2 | 19.5 |
| Prompting | Reflexion | 62.0 | 41.6 | 44.9 | 30.9 | 36.3 | 23.8 | 42.7 | 58.1 | 28.8 |
| RL Training | RLOO | 87.6±4.3 | 78.2±8.3 | 87.3±5.8 | 81.3±7.6 | 71.9±5.2 | 48.9±8.4 | 75.5±4.6 | 80.3±3.2 | 65.7±4.0 |
| RL Training | EMPG | 92.9 | 75.2 | 74.8 | 86.3 | 73.7 | 65.3 | 78.5 | 81.0 | 69.3 |
| RL Training | GiGPOw/ std | 97.7±1.6 | 82.7±7.9 | 98.8±1.6 | 83.7±7.2 | 89.3±8.2 | 79.2±6.6 | 90.8±1.3 | 84.4±2.9 | 72.8±3.2 |
| RL Training | GiGPOw/o std | 91.8±5.4 | 88.6±6.3 | 95.9±3.2 | 90.2±2.6 | 86.5±5.5 | 85.2±7.5 | 90.2±2.3 | 86.2±2.6 | 75.2±3.8 |
| RL Training | PPO (with critic) | 92.3±4.0 | 64.0±8.4 | 92.5±2.4 | 89.5±7.0 | 80.3±2.0 | 68.8±8.3 | 80.4±2.7 | 81.4±3.1 | 68.7±5.1 |
| RL Training | GRPO | 90.8±5.1 | 66.1±6.7 | 89.3±5.4 | 74.7±6.9 | 72.5±5.4 | 64.7±7.3 | 77.6±5.2 | 79.3±2.8 | 66.1±3.7 |
| RL Training | SAPO | 99.0±1.4 | 82.3±2.1 | 100.0±0.0 | 97.9±4.7 | 79.7±3.9 | 91.7±1.6 | 94.0±1.7 | 88.6±1.8 | 82.4±2.0 |
왜 중요한가
여러 단계를 거쳐 문제를 해결해야 하는 AI 에이전트를 훈련시킬 때 드는 메모리와 계산 비용을 크게 줄이면서도 성능은 오히려 높일 수 있다는 뜻이다. 이는 제한된 컴퓨팅 자원으로 장기 상호작용 에이전트를 훈련해야 하는 연구자와 회사들에게 실질적인 비용 절감으로 이어질 수 있다.
이 논문의 용어
- 정책(policy) · 주어진 상황에서 어떤 행동을 할지 결정하는 AI의 규칙
- 가치함수(value function) · 어떤 상태나 행동이 앞으로 얼마나 좋은 결과를 가져올지 미리 예측하는 함수
- 비평가(critic) 모델 · 정책과 별도로 두어 행동의 좋고 나쁨을 평가하는 보조 모델
- PPO · 정책을 급격히 바꾸지 않도록 제한하며 학습하는 대표적인 강화학습 기법
- GRPO · 같은 문제를 여러 번 풀어본 결과들을 서로 비교해 비평가 모델 없이 학습하는 기법
논문 원문 초록 (영문)
Agentic reinforcement learning (RL) has become a critical stage in the post-training of large language models. Existing critic-free, group-relative methods estimate policy advantages from multiple rollouts, avoiding the substantial memory overhead of conventional proximal policy optimization (PPO) and achieving strong performance on long-horizon interactive tasks. Despite their success, recent studies revealed three limitations: (1) Lack explicit value generalization and effective temporal credit assignment; (2) Suffer from potential advantage collapse in long-horizon complex tasks; (3) Require a costly trade-off between sampling budget and policy performance. In this work, we propose Single-rollout Autoregressive Policy Optimization (SAPO), a low-memory and compute-efficient framework in which the policy and value functions share a single autoregressive backbone. SAPO exploits the autoregressive structure of LLMs to produce policy and value predictions at distinct causal boundaries with shared parameters, while independently optimizing the PPO objectives and auxiliary on-policy SARSA objectives. To robustly estimate the contribution of each turn, we further introduce a trajectory-level generalized advantage estimator that combines lambda-returns with batch normalization. Experiments across ALFWorld and WebShop with Qwen2.5-1.5B/7B show that SAPO trains stably and outperforms PPO and GRPO by mean +15.1 and +12.1 percentage points, respectively, while eliminating the memory cost of a separate critic model and reducing per-iteration runtime by 33.2% over PPO.
arXiv에서 원문 보기최신 논문
- Specification-delta-driven data governance: an empirical study of the {\guillemotleft}spec-delta{\guillemotright} as the unit of change in lakehouse data platforms데이터 플랫폼 변경도 코드처럼 '설계도 조각'을 붙여서 검토하면 어떨까: 실험 설계 논문
- Are LLMs becoming similarly creative? Evidence from three years of models최신 AI 챗봇일수록 서로 비슷한 답을 내놓는다는 3년치 조사 결과
- Auditing Cross-Lingual Fairness in Language Model WatermarkingAI 생성 텍스트를 잡아내는 워터마크 기술이 영어 아닌 언어에서는 훨씬 부실하게 작동하고, 그 격차는 개별 언어가 아니라 언어 계열 단위로 나타난다
- TESTNAV: Pareto-Guided Search for Compositional Robustness TestingAI 모델을 여러 손상이 겹친 입력으로 시험할 때, 굳이 다 테스트하지 않고도 '진짜 위험한 실패'만 골라내는 탐색법
- Optimal Skill Selection for LLM Agents with Provable Bicriteria GuaranteesAI 에이전트에게 어떤 '스킬 문서'를 몇 개나 줘야 잘 작동하는지, 수학적으로 최적해를 보장하며 골라주는 방법
- Reliable Financial Named Entity Recognition under Domain Shift금융 AI가 서류체 문장에서 배운 자신감은 트위터로 가면 거짓말이 된다
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction텍스트가 빠지거나 망가져도, AI가 그 자리를 대신할 '가짜 텍스트'를 한 번에 만들지 않고 여러 번 고쳐가며 감정을 더 정확히 읽어낸다
METAL LAB 최신 기사
그림 출처: Dayang Liang et al., arXiv:2608.19842, CC BY 4.0