
摘要
- Databricks于9月2日发布《Big Book of AgentOps》,讲解如何在生产环境中运营AI智能体
- DXC已有3个智能体投入运营、8个处于试点阶段,迁移到Databricks后平台总拥有成本降低了30%
- Intercontinental Exchange(ICE)的文本转SQL智能体在约50次查询测试中,语法准确率达77%,执行匹配率达96%
企业在把生成式AI从试点推向真正运营时,卡壳的地方往往出奇地相似——这是Databricks给出的诊断。Databricks通过官方博客发布了AI智能体运营指南《Big Book of AgentOps》。文章指出,设计一个智能体本身并不难,真正让大多数团队止步不前的,是接下来一连串运营层面的问题:这个智能体该被赋予多大权限?失败了会发生什么?成本又由谁来承担?
为什么需要AgentOps
Databricks将AI智能体定义为一种在执行过程中会自主选择工具、调取企业数据、调用API并逐步完成多阶段任务的系统,而不只是给出回答的模型。每一项这样的能力都可能出问题——错误的工具调用、过于宽泛的权限、意料之外的成本飙升,都是文中给出的具体例子。
换个角度说,过去把预测模型推向生产运营的实践叫作MLOps;随着ChatGPT这类语言模型的出现,又衍生出加入了提示词和模型版本管理的LLMOps。这次提出的AgentOps则是再往下一步,是专门针对能自主选择工具、通过多个步骤执行任务的智能体而制定的运营规范。
试点卡在哪里
Databricks还总结了那些始终无法落地生产的智能体项目的共同模式。常见的问题包括:一开始就选了范围过大的应用场景、在复杂度尚未被证明合理之前就急着上多智能体编排、加入了不必要的推理循环、或者把评估环节一拖再拖。文章特别指出,即便是技术方案打磨得很好的项目,也常常因为组织内部没有对齐而卡住——执行层的发起人、产品负责人、领域专家、安全、合规、财务等各个部门必须朝同一个方向协同一致。
六章构成的实战指南
全书按照从概念到落地实施的顺序,划分为六个章节。开篇先梳理智能体的类型和常见反模式,接着介绍了从单一工作区到跨多账户、多智能体的企业级拓扑结构在内的四种部署架构。书中还给出了一份七阶段路线图,内容涵盖团队组建、数据基础设施、评估闭环直到治理体系。其中成本管理被特别强调——一个请求可能会经过子智能体、重试、护栏检查等环节,从而触发多次模型调用,因此明确用量归属和设置上限是必不可少的。
在评估部分,书中介绍了如何把源自《DevOps手册》的流动、反馈和持续学习原则应用到智能体系统中——具体做法是利用真实执行记录构建黄金评估数据集,并依据领域专家的判断来校准自动化评估器。最后一章则围绕利益相关方对齐展开,介绍了RACI责任矩阵以及上线前后的沟通节奏安排。

用数据说话的落地案例
书中还收录了实际落地企业的具体数据。
| 企业 | 智能体案例 | 已确认成效 |
|---|---|---|
| FactSet | 文本转代码知识智能体 | 从单一基础模型升级为完整智能体系统,准确率提升44% |
| DXC Technology | 多智能体组合 | 3个已投入生产、8个处于试点/开发阶段,平台总拥有成本降低30% |
| ICE | 引入治理机制的文本转SQL | 约50次查询中语法准确率达77%,执行匹配率达96% |
| Block | 面向商户运营的AI智能体 | 生产力收益达1000万美元(Databricks披露) |
Databricks介绍称,DXC迁移到该平台后正在扩大其AI版图;Block则通过Unity Catalog管理多个业务部门的数据访问权限,让AI业务和运营业务在同一环境下协同运转。
Databricks平台提供的支撑
Databricks解释道,随着智能体数量增多,散落在各个独立应用程序中的控制机制会变得越来越难以审计。为此提出的对策是一种平台化方案,将数据访问、模型与工具使用、追踪、评估和策略执行统一管理在一处。在Databricks的架构中,评估与追踪由MLflow负责,模型与工具流量由Unity Gateway管理,而数据与AI资产的发现、权限、血缘及访问控制则交由Unity Catalog统一处理。
编辑视角
Databricks选在这个时间点推出运营指南,并非偶然。去年8月,AWS发布了面向Bedrock的开源智能体技能并公开了本地MCP桥接方案;英伟达也展示了仅靠更换执行框架、不改动模型本身,就能把同一模型的基准测试得分从30%提升到100%。这说明模型本身的性能竞赛已经打得差不多了,业界现在纠结的问题已经转向"如何安全、可预测地运行这个模型"。像Databricks这种更看重数据与治理层、而非自研模型的公司,在这波趋势中存在感增强,也是顺理成章的事。
过去介绍AI落地案例时,往往一个准确率或基准分数就交差了;但这本书里收录的DXC、ICE、Block案例,摆出来的清一色是运营指标。把TCO降幅、生产与试点的数量对比、语法准确率与执行匹配率并列展示,本身就是在承认一件事:做出一个智能体和让人持续放心使用这个智能体,是两码事。实际上手过这种规模的智能体项目就会发现,结论总是差不多——比起换模型,先把权限设计和评估闭环搭建好,往后能省下的时间要多得多。
对国内企业来说,与其现在就急着设计多智能体编排,不如先在一个范围较窄的应用场景上明确成功指标,用真实执行记录先把评估集攒起来。如果不先把成本归属和最小权限原则立好规矩,一旦子智能体和重试次数增多,成本和风险很难不同时飙升。可以预见,接下来几个月里,不只是Databricks,其他云厂商和平台公司大概率也会陆续推出类似的运营框架,AI智能体竞争的重心也会进一步从模型性能转向运营的稳定性。





评论