온디맨드 추론
on-demand inference
AI 모델을 미리 계약하지 않고 쓴 만큼만 값을 치르며 실시간으로 답을 받는 이용 방식.
쉽게 말하면
온디맨드 추론은 택시를 부르는 것과 비슷하다. 자동차를 사서 주차장에 세워두지 않아도, 필요할 때 호출해서 타고 목적지에 도착하면 그만큼만 요금을 내면 된다. AI 모델도 마찬가지로, 회사가 별도의 전용 서버를 통째로 빌리거나 장기 계약을 맺지 않아도 질문을 보내면 즉시 답이 오고, 그 질문과 답의 분량만큼 요금이 매겨진다.
이 방식의 요금은 보통 입력한 글자 분량과 돌아온 답변 분량을 잘게 쪼갠 단위로 계산된다. 그래서 모델을 만든 회사가 가격을 내리면, 그 모델을 쓰는 모든 사람이 설정을 따로 바꾸지 않아도 다음 이용분부터 자동으로 싼 값이 적용된다. 대량으로 미리 예약해 쓰는 방식과 달리, 쓰는 만큼만 청구되기 때문에 사용량이 들쭉날쭉한 서비스에 특히 잘 맞는다.
