每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Databricks将智能体基础设施压缩进一个数据库

会计师事务所CLA公开案例:不用队列、调度器、缓存,而是用Lakebase Postgres运行AI智能体

이미지: METAL LAB 생성

摘要

  • Databricks公开了会计咨询事务所CLA(CLAconnect)的AI智能体编排案例
  • CLA以Lakebase Postgres为骨干,实现了持久化任务队列、失败重试以及感知速率限制的调度
  • 据悉,这种方式用单一数据库取代了长时间运行AI智能体所需的队列、调度器、缓存、监控整套堆栈
발표 주체
Databricks (X 게시, 2026-08-10)
사례 기업
CLA (@CLAconnect)
핵심 기술
Lakebase Postgres — Databricks의 Postgres 기반 오케스트레이션 백본
구현 기능
내구성 있는 작업 큐, 재시도, 레이트리밋 인식 스케줄링, 실시간 모니터링
배경 문제
장시간 실행 에이전트는 통상 큐·스케줄러·캐시·모니터링 도구 스택이 계속 늘어난다
관련 동향
AWS도 Bedrock AgentCore로 유사한 에이전트 인프라 문제를 다루고 있음

会计师事务所为何谈起数据库

8月10日,Databricks通过其X官方账号介绍了会计咨询事务所CLA(CLAconnect)运营AI智能体的案例。引人注目的是CLA所采用的方式。这次谈的不是新的AI模型或基准测试,而是"如何让智能体长时间稳定运行"这一基础设施问题。

据Databricks介绍,长时间运行的AI智能体通常需要不断扩张的队列、调度器、缓存、监控工具堆栈。这是因为它不像聊天机器人那样一问一答即可,而是要持续数分钟到数小时执行多阶段任务,失败时需要重试,还要控制对外部API的调用频率。据悉,CLA用一种"Databricks原生"的方式解决了这个问题,即以Lakebase Postgres作为编排骨干。

Lakebase做了什么

Lakebase是Databricks提供的基于Postgres的数据库服务。据发布内容显示,CLA借助它实现了持久化任务队列(即便任务中途中断状态也能保留的队列)、失败重试逻辑、感知API调用限额的调度,以及实时监控。也就是说,CLA没有分别接入独立的消息队列系统、工作流管理工具和缓存服务器,而是在单一数据库层中处理了这些功能。

组成部分典型堆栈CLA基于Lakebase的方案
任务队列独立消息队列系统Lakebase Postgres表
重试处理工作流管理工具数据库内重试逻辑
调度独立调度器感知速率限制的调度
监控独立仪表盘实时监控集成

为何"长时间运行的智能体"是个难题

随着AI智能体朝着代替人类调研文档、跨多个系统完成任务的方向发展,单个任务耗时从几秒延长到数小时的情况越来越多。这类智能体即便中途失败,也需要能从中断处继续、而不是从头开始;需要控制调用频率以免过度调用外部API而被封锁;还需要让人能实时确认当前进度。这三项需求叠加在一起,最终导致开发团队不得不拼凑出队列、调度器、缓存、监控各自独立的堆栈。

AWS也在处理类似问题。8月初,AWS ML Blog公开了一个案例:让运行在Bedrock AgentCore上的智能体通过桥接方式访问用户本地电脑上的MCP服务器。据介绍,该案例中的内部财务助手上线一年来已处理超过41,000次对话。虽然各云服务商的表述各异,但"如何为长时间运行的智能体构建稳定管理基础设施"似乎正成为共同议题。

与Databricks近期动向对照来看

Databricks近期宣布重启覆盖20座城市的"Data + AI World Tour"巡回活动,目标聚集4万人规模的参会者。此次CLA案例与这一动向相呼应,可以解读为Databricks正试图通过真实客户案例证明:自己不只是数据平台,还能在自身生态系统内解决智能体运营基础设施的问题。

由此带来了什么变化

此前,要运营长时间运行的AI智能体,开发团队必须分别挑选并组合队列系统、调度器、缓存、监控工具。CLA的案例表明,这套组合可以压缩进一个基于Postgres的单一服务中。这意味着已经在使用Databricks的组织,无需另建基础设施团队,也能搭建起智能体运营体系。不过,这只是Databricks给出的单一案例,是否能同样适用于其他规模或行业的智能体工作负载,仍有待观察。