MLOps
让训练好的机器学习模型能在实际服务中持续稳定运行的运维方式
简单来说
MLOps 是指在机器学习模型开发完成之后,管理它使其在实际服务中持续稳定运行、不出问题的一套运维方式。
厨师研发一道新菜谱,和用这道菜谱每天做出几百份菜卖给顾客的餐厅经营,完全是两件事。研发菜谱是一次性完成的工作,但经营餐厅却要不断确认食材品质、检查味道有没有走样、应对客流高峰——这些事情永无止境。机器学习模型也是一样。把数据喂给模型进行训练是一次性的工作,但一旦把这个模型接入实际服务,就要持续关注输入数据是否发生变化、预测结果是否开始出现异常、流量高峰时响应速度如何。这整套持续监控、修复、再部署的循环工作,就是 MLOps。
这个概念所涵盖的范围随着时代不断扩大。在把预测数字的模型部署到生产环境的年代,这被称为 MLOps;后来随着像聊天机器人那样能生成文本的语言模型出现,管理提示词和模型版本等内容也被纳入进来,发展成了 LLMOps。最近,随着能够自主选择工具、经过多个步骤执行任务的智能体(agent)出现,这个概念又在向下一个阶段扩展。
在报道中是这样出现的
文章中提到,Databricks 解释说,过去把预测模型部署到生产环境的做法被称为 MLOps,随着语言模型的出现演变为 LLMOps,如今则进一步发展为面向智能体的 AgentOps。容易被误解的一点是,人们常以为 MLOps 是一种把模型训练得更好的技术,但实际上它指的是把已经训练好的模型部署到服务中、并发现问题加以修复的运维流程。
