Serverless Inference
不用自己购买或管理服务器,按调用次数付费使用AI模型的方式
简单来说
无服务器推理(Serverless Inference)指的是不需要自己购买或管理运行AI模型所需的计算机,而是在需要时随时调用模型,只为实际使用的部分付费。
可以拿电力来类比。没有人会为了在家开灯而自己建发电站,只需要把插头插进插座,账单会根据实际用电量来计费。无服务器推理也是同样的道理。公司不需要购买用于运行AI模型的计算机(通常是被称为GPU的高性能运算设备)并让它们24小时开着,而是每次收到请求时,只租用当下所需的计算资源,并按使用量付费。
与之相对的是提前整块预订一定量计算资源的方式。对于早已预知流量规模的大公司来说,预订方式可能更便宜,但对于刚起步的团队而言,由于无法预测何时会用、会用多少,提前预订本身就是一种风险。无服务器推理消除了这种负担,提供了一种只为实际用量付费、并能随流量增长自动扩展的结构。
在报道中是这样出现的
文章提到,微软在Azure Foundry上推出Fireworks AI模型时说明,计费方式默认采用按令牌付费(pay-per-token)的无服务器推理。这里容易产生的误解是,因为名字里有"无服务器",就以为完全没有服务器存在,但实际上服务器仍在后台持续运行。之所以称为"无服务器",是因为用户不需要自己购买或管理这些服务器,只需按调用量付费即可。
