
이미지: 마이크로소프트
摘要
- 微软Foundry正式上线Fireworks AI开源模型推理服务,初创企业无需自建GPU集群即可在Azure环境中使用高性能推理能力。
- 该服务支持按token计费的无服务器推理模式,并可通过Azure Cache for Redis缓存重复请求以降低成本。
- Microsoft for Startups信用额度适用于Data Zone Standard部署,但不适用于PTU(预留吞吐量)方式。
Azure Foundry正式上线Fireworks AI服务
微软在Azure Foundry(Microsoft Foundry)上正式推出了Fireworks AI开源模型推理服务。此次上线后,初创企业无需自行搭建或运维GPU集群,即可在Azure环境内使用高性能、低延迟的开源模型推理能力。Fireworks AI负责推理层,而Foundry则通过统一的控制入口处理部署、治理和计费。

微软在此次发布的同时,还公布了面向AI原生初创企业的部署设计蓝图。该蓝图旨在帮助小型团队以可复用的Azure原生方式,从创意快速走到MVP,再到产品市场契合度(PMF)阶段。
为何是现在:摆脱对单一闭源模型的依赖
许多初创企业为了快速搭建初期原型,往往从单一闭源模型起步。问题在于,这一决定会在整个产品生命周期中,对成本和差异化战略产生累积性影响。在Fireworks AI被整合进Foundry之前,若想在Azure上直接提供开源模型服务,团队必须自行搭建独立的推理基础设施。
此次上线后,模型选择、微调以及行为调整都掌握在开发团队自己手中。团队可以根据工作负载特性选择合适的模型,当性能或成本要求发生变化时,借助统一的API和部署工作流切换模型,从而减少重复开发的工作量。
实际应用:架构构成与计费方式
基础技术栈完全运行在Azure订阅内,应用基础设施只需一个模型端点即可启动。起步方式是部署单一模型,并通过Azure API Management路由流量。之后可以进一步扩展,使用Azure Cache for Redis缓存重复的推理请求,根据工作负载特性调优性能,或对多个模型变体进行A/B测试。
计费方式以按token付费的无服务器推理为基础。加入Microsoft for Startups计划的团队,可将初创企业信用额度用于Data Zone Standard部署中的Fireworks模型使用,最高支持额度为15万美元。不过,PTU(Provisioned Throughput Units,即预留容量方式)不适用初创企业信用额度。官方建议将每百万token成本作为核心工程指标进行追踪。
构成该架构的主要组件如下:Azure Container Apps用于托管发送推理请求的应用程序或API,Azure Container Registry用于存储容器镜像。Azure Key Vault用于安全保管凭证和端点信息,Azure Monitor作为可选项提供可观测性和性能洞察。
微调与自定义模型权重导入
在工作负载趋于稳定后,团队可以利用评估套件、提示词库以及经过评级的生产流量作为训练数据,对模型进行微调。该服务支持通过Fireworks Training完成微调后,以“自带权重”(Bring Your Own Weights)方式将模型导入Azure的路径。也支持直接导入自定义模型权重。
局限性与尚未公开的信息
初创企业信用额度不适用于PTU方式,这是计划基于预留容量进行扩展的团队需要提前了解的限制。通过Azure Monitor实现的可观测功能为可选项,并非必需。目前信息来源中未明确说明具体支持的开源模型列表以及每token的具体单价。



