
이미지: METAL LAB 생성
摘要
- Amazon SageMaker Python SDK v3将生成式AI推理推荐功能直接开放到笔记本工作流程中
- 通过sagemaker.serve.ai_inference_recommender软件包(v3.17.0及以上版本)可一次性完成基准测试、推荐和部署
- 据悉该功能还支持并排比较LMI与vLLM服务栈
- 발표 매체
- AWS ML Blog (작성자 Dan Ferguson)
- 발행일
- 2026-08-06
- 핵심 패키지
- sagemaker.serve.ai_inference_recommender
- 최소 버전
- sagemaker >= 3.17.0
- 측정 지표
- throughput, TTFT(첫 토큰까지 시간), end-to-end latency
- 지원 경로
- SageMaker Python SDK, SageMaker AI UI, Boto3 API
- 비교 프레임워크
- LMI, vLLM
在笔记本中完成推理优化
AWS宣布已将生成式AI推理优化功能整合进Amazon SageMaker Python SDK v3。在AWS ML Blog发布的文章中,作者Dan Ferguson介绍称,SageMaker AI的生成式AI推理推荐功能现已直接开放到笔记本工作流程中。此前需要使用SageMaker Studio或直接构建Boto3 API调用才能完成的工作,如今通过这次整合,只需一个SDK操作即可处理。
从基准测试到部署实现自动化
将生成式AI模型部署到生产环境时,以往需要反复进行手动试错,以找到最优的实例类型、框架配置和服务参数。新版SDK将这一过程实现了自动化。它可以对实际部署的端点使用合成工作负载或真实流量进行基准测试,测量吞吐量、TTFT(首个token生成时间)和端到端延迟,并基于使用模式,按性价比对部署配置进行排序推荐。之后可以将排名最高的推荐配置直接部署到实时端点。
全新API接口
该功能自3.17.0版本起纳入sagemaker.serve.ai_inference_recommender软件包,主要由以下核心操作构成。
| 入口点 | 功能 |
|---|---|
| ModelBuilder.from_jumpstart_config(…) | 根据JumpStart模型ID和计算配置创建ModelBuilder |
| start_benchmark(endpoint, …) | 对已部署端点使用可配置的合成工作负载执行负载测试 |
| mb.generate_deployment_recommendations(…) | 探索实例与框架配置,返回排序后的推荐结果 |
| mb.deploy(…) | 将排名最高的推荐配置部署到实时端点 |
| ModelBuilder.from_recommendation_job(job_name) | 从已完成的推荐任务恢复ModelBuilder,可在其他进程或会话中进行部署 |
使用该功能前,需通过pip install --upgrade sagemaker >= 3.17.0命令安装最新版SDK,并需具备拥有SageMaker执行权限的IAM角色,以及已部署的实时端点(或待部署的JumpStart模型)。
支持LMI与vLLM比较
该工作流程包括生成部署推荐、审查并选定结果、执行部署、在实际负载条件下进行验证,以及可选的LMI与vLLM服务栈并排比较等步骤。AWS表示,已通过相关笔记本示例对整个端到端流程进行了说明。
对AI基础设施优化工具发展趋势感兴趣的读者,可在metallab.ai的相关报道中一并了解云端推理成本削减的趋势。
小结
此次更新的意义在于,将过去在生产环境部署生成式AI模型时需要手动反复试验的实例、框架、并发设置调整工作,替换为几行SDK操作即可完成。不过,此次发布仅通过AWS官方博客得到确认,实际性能提升幅度或成本削减数据尚未单独公开。



