
요약
- Amazon SageMaker Python SDK v3가 생성형 AI 추론 추천 기능을 노트북 워크플로우에 직접 노출한다
- sagemaker.serve.ai_inference_recommender 패키지(v3.17.0 이상)로 벤치마킹, 추천, 배포를 한 번에 수행할 수 있다
- LMI와 vLLM 서빙 스택을 나란히 비교하는 기능도 지원되는 것으로 알려졌다
- 발표 매체
- AWS ML Blog (작성자 Dan Ferguson)
- 발행일
- 2026-08-06
- 핵심 패키지
- sagemaker.serve.ai_inference_recommender
- 최소 버전
- sagemaker >= 3.17.0
- 측정 지표
- throughput, TTFT(첫 토큰까지 시간), end-to-end latency
- 지원 경로
- SageMaker Python SDK, SageMaker AI UI, Boto3 API
- 비교 프레임워크
- LMI, vLLM
노트북에서 끝내는 추론 최적화
AWS가 Amazon SageMaker Python SDK v3에 생성형 AI 추론 최적화 기능을 통합했다고 밝혔다. AWS ML Blog에 게재된 글에서 저자 Dan Ferguson은 SageMaker AI의 생성형 AI 추론 추천 기능이 이제 노트북 워크플로우 안에서 직접 노출된다고 설명했다. 기존에는 SageMaker Studio를 사용하거나 Boto3 API 호출을 직접 구성해야 했던 작업이, 이번 통합으로 SDK 오퍼레이션 하나로 처리 가능해졌다.
벤치마킹부터 배포까지 자동화
생성형 AI 모델을 프로덕션에 올릴 때는 최적의 인스턴스 유형, 프레임워크 설정, 서빙 파라미터를 찾기 위해 수작업 시행착오를 반복해야 했다. 새 SDK는 이 과정을 자동화한다. 실제 배포된 엔드포인트를 합성 워크로드 또는 실트래픽으로 벤치마킹해 처리량, TTFT(첫 토큰까지 시간), 종단 지연시간을 측정하고, 사용 패턴에 기반해 비용 대비 성능으로 순위를 매긴 배포 구성을 추천한다. 이후 최상위 추천 구성을 실시간 엔드포인트에 곧바로 배포할 수 있다.
새로운 API 인터페이스
해당 기능은 sagemaker.serve.ai_inference_recommender 패키지 아래 3.17.0 버전부터 제공되며, 다음과 같은 주요 오퍼레이션으로 구성된다.
| 엔트리 포인트 | 기능 |
|---|---|
| ModelBuilder.from_jumpstart_config(…) | JumpStart 모델 ID와 컴퓨트 구성으로 ModelBuilder 생성 |
| start_benchmark(endpoint, …) | 배포된 엔드포인트에 설정 가능한 합성 워크로드로 부하 테스트 실행 |
| mb.generate_deployment_recommendations(…) | 인스턴스·프레임워크 구성을 탐색해 순위화된 추천 반환 |
| mb.deploy(…) | 최상위 추천을 실시간 엔드포인트에 배포 |
| ModelBuilder.from_recommendation_job(job_name) | 완료된 추천 작업으로부터 ModelBuilder 복원, 다른 프로세스·세션에서 배포 가능 |
사용을 위해서는 pip install --upgrade sagemaker >= 3.17.0 명령으로 최신 SDK를 설치해야 하며, SageMaker 실행 권한이 있는 IAM 역할과 배포된 실시간 엔드포인트(또는 배포할 JumpStart 모델)가 필요하다.
LMI와 vLLM 비교 지원
워크플로우는 배포 추천 생성, 결과 검토 및 선택, 배포, 실사용 부하 조건에서의 검증, 그리고 선택적으로 LMI와 vLLM 서빙 스택을 나란히 비교하는 단계로 구성된다. AWS는 관련 노트북 예제를 통해 전체 엔드투엔드 여정을 안내하고 있다고 밝혔다.
AI 인프라 최적화 도구의 발전 흐름에 관심 있는 독자라면 metallab.ai의 관련 기사에서 클라우드 추론 비용 절감 트렌드를 함께 확인할 수 있다.
정리
이번 업데이트는 생성형 AI 모델을 운영 환경에 배포할 때 수동으로 반복하던 인스턴스·프레임워크·동시성 설정 실험을 SDK 오퍼레이션 몇 줄로 대체한다는 데 의미가 있다. 다만 이번 발표는 AWS 자체 블로그를 통해서만 확인되며, 실제 성능 개선폭이나 비용 절감 수치는 별도로 공개되지 않았다.





댓글