METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

AI 용어사전ㅇ기사에 자주 나오는 기술 용어

에이전트 강화학습

Agent RL

모델이 도구를 실제로 써보고 성공·실패 결과를 보상 삼아 점점 나아지도록 훈련하는 방법

쉽게 말하면

에이전트 강화학습은 AI 모델에게 도구 쓰는 법을 직접 몸으로 익히게 하는 훈련 방식이에요. 요리를 배울 때 레시피만 외우는 것과 실제로 주방에 서서 칼질하고 불 조절을 해보는 것은 다르죠. 처음엔 서툴러서 재료를 태우기도 하지만, 성공하면 칭찬을 받고 실패하면 다시 시도하면서 점점 손에 익어요. 에이전트 강화학습도 똑같아요. 모델에게 코드를 고치거나 터미널 명령을 실행하거나 인터넷을 검색하는 실제 작업을 시켜보고, 결과가 맞았는지 점수를 매겨서 그 점수를 기준으로 모델을 조금씩 다듬어요.

보통 이 훈련은 순서대로 진행돼요. 정답이 명확한 수학 문제 같은 것부터 시작해서, 그다음 소프트웨어 작업, 터미널 사용, 웹 검색 순서로 난이도와 영역을 넓혀가는 식이에요. 앞 단계에서 만들어진 결과물을 이어받아 다음 단계를 훈련하는 계주 경기와 비슷해요.

다만 이 훈련은 비용과 복잡도가 크기 때문에 모든 크기의 모델에 똑같이 적용되지는 않아요. 규모가 작은 모델은 지시를 따르는 능력까지만 갖추고, 규모가 큰 모델에만 도구를 실제로 다루는 훈련을 추가로 넣는 경우가 많아요.

기사에서 이렇게 나와요

IBM은 그래닛 4.2를 소개하며 8B와 30B 모델에는 소프트웨어 엔지니어링, 터미널 사용, 웹 검색 순서로 이어지는 에이전트 강화학습 블록을 넣었지만, 3B 모델은 이 단계를 건너뛰었다고 밝혔어요. 여기서 오해하기 쉬운 점은, 에이전트 강화학습이 모델 하나에 한 번에 적용되는 단일 과정이 아니라 모델 크기별로 선택적으로 넣거나 뺄 수 있는 별도의 훈련 단계라는 거예요. 같은 이름의 모델이라도 크기에 따라 도구를 실제로 다룰 줄 아는지가 달라질 수 있어요.

함께 볼 용어

이 용어가 나온 기사

ㄱㄴㄷ 전체 찾아보기