
摘要
- Oumi推出了一个开发平台,能让LLM持续从自身的生产流量中学习
- 该平台形成了模型自我评估、将评估结果合成为数据、再据此重新训练的循环结构
- Oumi表示,由此打造的专用模型在特定任务上的运行成本比前沿模型便宜10到100倍
生产日志本身就是训练数据
Oumi发布了一个全新的开发平台。其核心在于让LLM持续利用实际服务中积累的流量——也就是用户真实往来的请求与响应——作为素材进行学习。模型会先对自己的回答进行自我评估,再将评估过程中发现的数据合成为新的训练数据,然后用这些数据重新训练自己。这次发布的要点在于,这三个阶段被整合成了一个闭环结构。Oumi方面表示,由此打造出的专用模型在特定范围的任务中,运行成本比前沿模型便宜10到100倍。据介绍,训练得到的权重完全归用户所有,从数据合成、评估、训练到部署的整个流程都可以在该平台内完成。
这意味着什么
到目前为止,企业针对特定业务对LLM进行定制主要有两条路径。一是通过提示词或检索增强生成(RAG)对大模型进行临时性引导,二是对公开的基础模型进行微调,单独打造小型专用模型。Oumi瞄准的正是将后者自动化的环节。也就是说,不再依靠人工收集数据、打标签后重新训练,而是让模型自行对实际使用日志打分,再用合成数据填补不足之处,循环往复地重新训练。这与近期开源阵营中持续出现的趋势相呼应。8月11日发布的Unsloth Desktop推出了一款可在本地环境中同时支持模型运行与训练的开源应用;同一天披露的AISquared与Domyn案例也表示,通过对Ai2的Olmo系列模型进行微调,将自有基础设施的托管成本降低了一半。种种迹象表明,重心正在从依靠单一前沿模型处理一切,转向以低成本持续运行针对特定业务定制的小型模型。不过此次发布仅停留在X平台帖子级别的简短介绍,循环训练的具体算法、以及究竟采用何种基准测出10到100倍的成本节省,目前尚未得到证实。
这会带来什么变化
如果企业能够将自身服务的日志直接回收作为训练素材,那么“模型必须持续依靠人工调整”这一前提就会动摇。运营服务本身就会成为训练模型的过程。Oumi同时提供了指南,方便用户直接测试这一平台,但这种自我学习循环实际能稳定运行到何种程度、是否存在错误自我放大等副作用,仍需更多案例积累后才能判断。





评论