트리 강화학습
Tree-RL
실행 도중 여러 갈림길로 나뉘어 각각을 시도해보며 배우는 강화학습 훈련 방식
쉽게 말하면
트리 강화학습은 AI가 시행착오를 거쳐 더 나은 판단을 배우는 훈련 방법인데, 한 번의 시도를 하나의 길로만 끝까지 가지 않고 중간 지점마다 갈림길을 만들어 여러 갈래로 나눠서 동시에 시도해보는 방식이다.
비유하자면 게임을 한 번 플레이하고 끝내는 대신, 중요한 순간마다 저장 지점을 만들어놓고 그 지점에서 서로 다른 선택을 여러 번 다시 시도해보는 것과 비슷하다. 나무가 줄기에서 여러 가지로 뻗어나가듯, 같은 출발점에서 여러 방향으로 갈라져 각 가지의 결과를 비교하면 어떤 선택이 더 좋았는지 훨씬 효율적으로 배울 수 있다.
이 방식이 실제로 쓰이려면 AI가 작업하던 상태를 특정 시점으로 되돌려 복제하는 기술이 필요하다. 앞으로 계속 진행할 수밖에 없다면 갈림길을 만들 수 없기 때문이다.
기사에서 이렇게 나와요
기사는 "선택한 시점에서 롤아웃을 분기하는 Tree-RL 훈련에서는 TerminalBench-2 점수가 34.2%에서 39.4%로 올랐다"고 전한다. Tree-RL은 특정 회사의 제품명이 아니라, 실행 상태를 되감고 복제하는 런타임(Shepherd)이 있어야 가능해지는 훈련 기법이라는 점을 함께 봐야 한다.
