서버리스 추론
Serverless Inference
서버를 직접 사거나 관리하지 않고, AI 모델을 쓴 만큼만 돈을 내고 호출해 쓰는 방식
쉽게 말하면
서버리스 추론은 인공지능 모델을 돌리기 위한 컴퓨터를 직접 사거나 관리할 필요 없이, 필요할 때마다 호출해서 쓰고 쓴 만큼만 요금을 내는 방식이다.
전기를 생각하면 쉽다. 집에 불을 켜려고 발전소를 직접 짓는 사람은 없다. 콘센트에 플러그만 꽂으면 되고, 요금은 쓴 전력량만큼 청구서에 찍힌다. 서버리스 추론도 똑같다. AI 모델을 돌릴 컴퓨터(주로 GPU라는 고성능 연산 장치)를 회사가 사서 24시간 켜두는 대신, 요청을 보낼 때마다 필요한 만큼만 컴퓨터를 빌려 쓰고 그 사용량만큼 돈을 낸다.
반대편에는 미리 일정량의 컴퓨터 자원을 통째로 예약해두는 방식이 있다. 트래픽이 많을 걸 미리 아는 큰 회사라면 예약이 더 쌀 수도 있지만, 이제 막 서비스를 시작하는 팀에게는 언제 얼마나 쓸지 예측이 안 되니 예약 자체가 위험 부담이다. 서버리스 추론은 이 부담을 없애서, 쓴 만큼만 내고 트래픽이 늘면 자동으로 따라 늘어나는 구조를 제공한다.
