METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

AI 용어사전ㅅ인프라와 칩

서빙 엔진

serving engine

학습이 끝난 AI 모델을 실제 서비스에서 빠르고 안정적으로 실행시켜 주는 소프트웨어를 뜻한다.

쉽게 말하면

서빙 엔진은 이미 만들어진 AI 모델을 실제로 사람들이 쓸 수 있게 돌려 주는 실행 프로그램이다. 모델을 요리 레시피에 비유하면, 서빙 엔진은 그 레시피를 받아 실제 주방에서 수백 수천 명의 손님 주문을 동시에 처리하는 주방 시스템에 가깝다. 아무리 좋은 레시피라도 주방이 느리거나 한 번에 한 접시만 만들 수 있다면 손님을 많이 받을 수 없듯, 모델이 아무리 성능이 좋아도 서빙 엔진이 부실하면 응답이 느려지거나 동시에 많은 사람이 쓰지 못한다.

구체적으로 서빙 엔진은 여러 사람의 질문을 한꺼번에 묶어 처리하고(마치 배달 앱이 근처 주문을 묶어 한 번에 배달하듯), 컴퓨터 그래픽 처리 장치의 메모리를 낭비 없이 나눠 쓰도록 관리한다. 새로운 오픈 모델이 공개될 때 이 서빙 엔진이 그 모델을 바로 지원하느냐 아니냐가, 그 모델을 실제 서비스에 얼마나 빨리 쓸 수 있는지를 가른다.

기사에서 이렇게 나와요

기사에서 vLLM의 리드 메인테이너가 「50만 GPU 규모」에서 오픈 모델을 프로덕션에서 운영한 경험을 언급했다는 대목이 나온다. 여기서 vLLM 같은 프로젝트가 하는 일이 바로 서빙 엔진 역할이다. 흔한 오해는 「모델이 좋으면 서비스도 저절로 잘 돌아간다」는 생각인데, 실제로는 모델과 별개로 그것을 대규모로 안정적으로 실행하는 서빙 엔진이 따로 필요하다.

직접 해보기

새 오픈 모델이 공개되는 소식을 볼 때, 그 모델을 지원하는 서빙 엔진이 함께 언급되는지 살펴보자. 공개 당일부터 지원된다는 표현이 나오면, 그 모델이 얼마나 빨리 실제 서비스에 쓰일 준비가 됐는지를 가늠하는 단서가 된다.

함께 볼 용어

이 용어가 나온 기사

ㄱㄴㄷ 전체 찾아보기