工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

Databricks提出治理工具选型七大标准

Databricks建议企业不要看品牌,而要按数据编目、血缘追踪、访问控制等六项功能和七项评估标准来比较治理工具

픽셀 도형들이 사람 얼굴 실루엣과 회로 패턴으로 변하는 AI 그래픽

이미지: Databricks

摘要

  • Databricks于8月25日在官方博客发布了企业数据治理工具选型指南
  • 指南将工具分为独立目录、单点方案、企业套件、平台原生、开源五大类,并列出六项核心功能
  • 将AI与智能体治理列为第六项核心功能,也是一条全新的评估维度
발행
Databricks 블로그, 2026-08-25
핵심 기능 6가지
카탈로깅·디스커버리, 리니지, 접근제어·정책집행, 품질 모니터링, 컴플라이언스·감사, AI·에이전트 거버넌스
도구 유형 5가지
독립형 카탈로그, 포인트 솔루션, 엔터프라이즈 스위트, 플랫폼 네이티브, 오픈소스
평가 기준 7가지
확장성, 통합성, 사용성, 정책 집행 세밀도, AI 거버넌스 준비도, 총소유비용, 벤더 지원
플랫폼 네이티브 예시
Databricks Unity Catalog
엔터프라이즈 스위트 예시
SAP Master Data Governance
언급된 규제
GDPR, HIPAA

建议按功能而非品牌来比较

Databricks于8月25日在官方博客发布了一份指南,教企业如何挑选数据治理工具。这篇文章不推荐任何具体产品,而是建议按六项核心功能——从数据编目到AI智能体治理——以及七项评估标准来比较各类工具。原文写道,这份指南是为那些希望"抛开厂商打分表"来比较数据治理方案的数据治理负责人、平台架构师和IT决策者所写。其出发点在于:如果只看品牌签合同,很可能买到一个恰好缺了关键功能的工具。

仓库、湖仓与SaaS中分散的数据通过实线汇聚到统一目录,该目录又通过虚线延伸至AI智能体治理。这说明数据整合已经成熟,而AI智能体治理仍是一块尚未定型的新领域。

数据分散这个老问题

大多数企业的数据分散在数据仓库、数据湖、SaaS应用和各部门的电子表格里,没有哪一个系统能说清楚什么数据在哪里、由谁负责。指南指出,数据团队每周要花好几个小时去找资产,敏感数据也常常因为缺乏统一的访问控制而被搁置在一边、无人管理。治理工具的作用,就是在这些分散的数据之上搭建一层可检索的共享目录,让数据无论存在哪里,负责人和数据管家都能查看、分类并加以保护。

六项核心功能

指南列出,一个成熟的治理平台应具备以下六项功能。任何一项缺失,实际运行中都会出现漏洞。

功能作用
编目与发现将表、文件、仪表盘、模型整理成可检索的索引
数据血缘追踪数据从源头到报表、模型的完整流转路径
访问控制与政策执行按行、列、字段级别集中统一分配权限
质量监控持续检查完整性、准确性、时效性,并对异常发出警报
合规与审计生成满足GDPR、HIPAA等监管要求的审计记录
AI与智能体治理将同样的访问控制和血缘追踪应用于模型、提示词和自主智能体

工具可分为五大类

指南没有按品牌,而是按范围和架构把市面上的治理工具分成五类。独立数据目录能广泛连接多种数据源,但访问控制或质量监控往往要依赖其他工具。单点方案则只在质量、血缘或分类中某一项功能上做深,但如果把多个单点方案拼接起来,反而会重新制造出治理工具本该解决的碎片化问题。企业套件把编目、质量管理、主数据管理、政策管理整合进一个产品,不过像SAP Master Data Governance这类内嵌在ERP里的模块,管理的往往只是某个特定系统,而不是全部数据资产。平台原生治理则把编目、血缘、访问控制和质量监控直接内置在数据平台本身,无需在多个系统之间做同步,可以直接作用于同一批表、文件和AI资产。指南以Databricks的Unity Catalog为例,把它列为湖仓场景下这一类型的代表。开源治理工具让人能够深入了解内部结构并自行扩展,但代价是要承担更高的实施和运维负担,以换取更低的许可成本。

框架和工具是两个不同的概念

指南明确区分了治理框架和治理工具。框架是关于如何对数据分类、界定归属、设定访问权限和使用方式的政策、角色与标准;工具则是把这些规则真正落实到系统中的软件。如果只有政策没有工具,就得每天靠人工检查所有表格,一旦数据表超过几十个就会崩溃;而如果只有工具没有政策,那就只是一个昂贵的目录摆在那里,起不到实际作用。

用七项标准来评估

指南建议,无论面对哪种工具,都先按可扩展性、集成能力、易用性、政策执行的精细度、AI治理准备度、总体拥有成本、厂商支持这七项标准打分。其中可扩展性尤为关键,意味着数据量从GB级增长到PB级时,目录的更新时效和查询性能都不能下降,这也包括能否同时处理好Delta Lake、Apache Iceberg等开放表格式。

AI智能体被纳入治理范围

指南把AI与智能体治理列为第六项功能,并非偶然。文中解释,随着越来越多AI智能体开始读取并操作企业数据,原本只用在表格上的访问控制和血缘追踪,现在同样需要延伸到模型的输入输出上。这项功能目前仍处于成熟阶段,指南补充说,它正是区分"止步于结构化数据"的工具和"真正为AI时代打造"的工具的分水岭。

编辑视角

这份指南有意思的地方在于,Databricks没有一上来就打自家产品的招牌,而是先把评估标准立起来。当然,Unity Catalog最终作为"平台原生"这一类别的唯一示例出现,说明这份文档终究没脱离营销文档的本质,但按功能拆解、逐项比对的建议本身,放到实际工作中确实可以直接拿来用。几年前,治理工具只要把目录和访问控制做好基本就够了,但现在多了一项新要求:提示词和智能体的输出结果也要纳入同一套政策体系。AnthropicClaudeMCP连接器加上企业统一认证,GS建设用Snowflake整合工地数据,其实都处在同一条脉络上——当AI开始直接接触企业数据,治理就不再只是管人的访问权限,还要管模型的访问权限。对国内企业来说,眼下更该做的不是急着换一套全新的企业级治理套件,而是先看看自己正在用的数据平台,是不是已经具备了针对AI智能体的访问控制和血缘追踪能力。指南里提到的那个警告很准确:东拼西凑地叠加单点方案,最终只会把碎片化问题重新制造出来。可以预见,未来几个月里,Snowflake、微软等竞争平台也会按同样的逻辑,在自家目录产品上加入AI与智能体治理功能——因为这一项,如今已经成了治理工具的标配项。

评论