반사실적 최적화
counterfactual optimization
AI 에이전트의 실행을 특정 시점에서 여러 갈래로 나눠 실행해보고 그중 가장 좋은 결과를 고르는 최적화 기법
쉽게 말하면
반사실적 최적화는 AI 에이전트가 일을 처리하던 중 한 지점으로 되돌아가 여러 다른 선택지를 동시에 실행해보고, 그중 가장 결과가 좋은 갈래를 골라 쓰는 방식이다. 게임을 하다가 중요한 순간에 세이브 파일을 만들어두고, 그 지점부터 여러 번 다르게 플레이해본 다음 가장 잘 풀린 판을 이어가는 것과 비슷하다.
보통 AI 에이전트는 한 번 진행한 작업을 되돌리려면 처음부터 다시 시작하거나, 잘못된 부분 위에 땜질하듯 수정을 얹는 방법밖에 없었다. 두 방법 다 시간과 비용이 많이 들고, 같은 상황을 다시 만들기도 어려웠다. 반사실적 최적화는 실행 도중의 상태를 그대로 복제해 여러 갈래로 나눠볼 수 있게 되면서 가능해진 방식으로, 하나의 정답을 미리 정하지 않고 여러 가능성을 실제로 실행한 뒤 비교해서 고른다는 점이 핵심이다.
이 방식은 에이전트가 스스로 훈련하는 과정에도 쓰인다. 특정 갈림길에서 실행을 여러 개 뻗어나가게 한 뒤, 그중 성과가 좋았던 경로를 학습에 반영하는 식이다.
