METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

AI 용어사전ㅌ기사에 자주 나오는 기술 용어

트리 강화학습

Tree-RL

실행 도중 여러 갈림길로 나뉘어 각각을 시도해보며 배우는 강화학습 훈련 방식

쉽게 말하면

트리 강화학습은 AI가 시행착오를 거쳐 더 나은 판단을 배우는 훈련 방법인데, 한 번의 시도를 하나의 길로만 끝까지 가지 않고 중간 지점마다 갈림길을 만들어 여러 갈래로 나눠서 동시에 시도해보는 방식이다.

비유하자면 게임을 한 번 플레이하고 끝내는 대신, 중요한 순간마다 저장 지점을 만들어놓고 그 지점에서 서로 다른 선택을 여러 번 다시 시도해보는 것과 비슷하다. 나무가 줄기에서 여러 가지로 뻗어나가듯, 같은 출발점에서 여러 방향으로 갈라져 각 가지의 결과를 비교하면 어떤 선택이 더 좋았는지 훨씬 효율적으로 배울 수 있다.

이 방식이 실제로 쓰이려면 AI가 작업하던 상태를 특정 시점으로 되돌려 복제하는 기술이 필요하다. 앞으로 계속 진행할 수밖에 없다면 갈림길을 만들 수 없기 때문이다.

기사에서 이렇게 나와요

기사는 "선택한 시점에서 롤아웃을 분기하는 Tree-RL 훈련에서는 TerminalBench-2 점수가 34.2%에서 39.4%로 올랐다"고 전한다. Tree-RL은 특정 회사의 제품명이 아니라, 실행 상태를 되감고 복제하는 런타임(Shepherd)이 있어야 가능해지는 훈련 기법이라는 점을 함께 봐야 한다.

함께 볼 용어

이 용어가 나온 기사

ㄱㄴㄷ 전체 찾아보기