METAL

OpenAI 发布 Astra for Law

OpenAI 于 9 月 17 日推出 Astra for Law,把 GPT-6 Astra 配置成面向法律业务的形态。它不是新模型,而是在模型之上加了覆盖 2.3 亿个以上网址的法律检索索引、法律分析与写作指令,以及面向律所的管控。

OpenAI 发布 Astra for Law

摘要

  • OpenAI 于 9 月 17 日发布基于 GPT-6 Astra 的法律配置 Astra for Law。
  • 核心是自建的法律检索索引,覆盖美国判例、成文法与法规,规模超过 2.3 亿个网址。
  • 在 OpenAI 自己的评测中,整体正确性检查通过率为 54.0%,而仅用网页搜索的 GPT-6 Astra 为 38.7%。
Introducing Astra for Law

OpenAI 于 9 月 17 日公开了面向法律业务配置的 Astra for Law。它不是新模型。公司把自己最强的模型 GPT-6 Astra 与法律检索索引、法律分析与写作指令,以及面向律所的管控装置组合在一起。公告说,它在模型选择器中显示为 GPT-6 Astra Law,在 API 中为 gpt-6-astra-law。获选律所先通过 ChatGPT 与 Codex 的 Trusted Access 计划使用,API 随后开放。

用读合同的眼光看,这次公告里被标价的不是模型,而是索引。OpenAI 自行搭建了法律检索索引,覆盖美国判例、成文法、法规、法院规则与行政裁决,规模超过 2.3 亿个网址,并且每天新增来源。判例来自非营利机构 Free Law Project 运营的 CourtListener 收录,公告称该收录覆盖了已公布的美国先例判例的 99.9% 以上。公司说明,这个索引不是取代律所依赖的专业厂商授权内容,而是与之互补。

性能依据来自公司自己挑选的一项测试。OpenAI 从 Vals AI 的 Legal Research Bench 非公开验证集中抽取 200 道美国法律检索题,在两套系统都设为最高推理强度的条件下运行,称 Astra for Law 通过整体正确性检查的比例为 54.0%。仅用网页搜索的 GPT-6 Astra 在同一批题目上为 38.7%。这在相对值上是 40% 的提升,反过来说也意味着这套配置在接近一半的题目上没有通过正确性检查。在以判例为主的题目上,它多找到 24% 的参考判例;在另一组受审计的目标段落集合中,它从正确的判决书里多取回最多 54% 的相关段落。

公告里还放了与竞争模型的并列对比。题目要求在一起虚假陈述主张中找出事实最接近的先例:当事人在签署五年制造合同前,被告知了一个过往平均订单额。OpenAI 写道,Astra for Law 以 Oliver Wyman, Inc. v. Eielson 为依据写了备忘录,而 Fable 5.1 引用了一项已被上诉审推翻的判词。公告还说,在交易类例子中 Fable 5.1 报告说找不到相应判例。测试和对比都由 OpenAI 自行完成,据报道,两边的结果都没有经过独立第三方审计。

先行试用一方的评价以引语形式写进了公告。Sullivan & Cromwell 合伙人 John Savva 说:“在诉讼与交易两类事务上,这些模型展现出令人印象深刻的研究深度,以及对权威来源的敏感度。”Harvey 应用研究负责人 Niko Grupen 说:“在我们的早期测试中,Astra for Law 在法律检索的关键环节上都显示出优势,包括把答案建立在切题的权威来源上、精准引用,以及给出务实的咨询性指引。”

让律所在 AI 面前停住脚步的从来不是性能,而是保密,这次公告正对着这一处。OpenAI 为符合条件的律所单设 Trusted Access 计划,让律师及在其监督下工作的人员用于专业法律业务。适用律所在 API 上获得零数据保留,ChatGPT Enterprise 的使用默认排除在人工审阅之外。公司表示,信息权限、利益冲突隔离墙、客户指示与律所监督的设计,正与 Latham & Watkins 一起制定。

Latham 人工智能战略委员会主席 Michael Rubin 说:“随着 AI 能力增强,把它部署到那些要求严格治理、监督与问责的环境中的能力也在同步增强。”利益冲突隔离墙是同一家律所内部阻止其他团队看到某一案件材料的装置。模型能看什么、什么时候能看,必须落到权限设计里才转得动,而律所在这次公告中标价的也正是这一块。

OpenAI 工程师进驻律所内部打造的工具也一同公开。Sullivan & Cromwell 做了合同分析器,把谈判手册与精选先例带入新交易的审阅,找出条款合读时才显现的风险,并转成建议修订与客户咨询草稿。Ropes & Gray 做了尽职调查系统,把律师翻阅资料室、判断什么对交易重要的方式搬了进去。Cooley 做了处理上市准备的 GO Public,公告称交易条件变化时,它会把这一变化贯穿整份文件。

同一天还开放了 26 个由合作伙伴开发的插件。通过 iManage,可以把在 ChatGPT 里写的谈判简报存入案件档案;Intapp 会提示可能需要计时记录的活动;DeepJudge 把过往交易调出来做比较。Relativity 与 Clio 也在连接名单上,律师和法律工程师做的 9 个社区插件带来了 47 个可修改、可延展的自定义技能。ChatGPT for Word 也在同一天正式发布。

如何称呼这个生态,是这次公告里写得最谨慎的一段。公告写道:“在 OpenAI 之上构建,应该意味着从生态中获得更多,而不是取代生态。”但在同一份公告里,OpenAI 一次握住了模型、检索索引、分发界面与插件目录,专业厂商则站在守住各自数据与工作流的一侧。据报道,六家厂商在纽约时间下午四点到四点十五分之间发出新闻稿,其中五家一字不差地放进了 OpenAI 法律行业负责人的同一段引语。

被列为 API 客户的 Harvey 与 Legora,是把法律 AI 当作独立目的地来卖的代表。据报道,Harvey 本月获得 156 亿美元估值,Legora 正在争取 100 亿美元估值。两家公司如今要在一家同时向律所直接销售法律检索的公司的基础之上做产品。在 METAL 查看的公告全文中,OpenAI 把这层关系称作开放且可组合的路径,并写道合作伙伴可以继续开发自己的应用与工作流,由律所来选择这些能力如何组合。

这套设计本身是 OpenAI 近来反复使用的形态。METAL 曾报道GPT-6 Astra 在对齐改善与致命风险等级上同时拿到结果,两周之后,这个模型已经落到一个行业的默认配置里。已经有公司盯上同一块地方。METAL 曾报道谷歌以 Gemini Enterprise for Legal 自动化合同与检索。

留下来的是价格、名单与管辖。公告里没有价格,没有 Trusted Access 内部有哪些律所,也没有何时进入欧洲。索引覆盖的只有美国法,拿到答案的律师仍要自己去核对权威来源。即便如此,决定先看到哪一条判例的位置,已经朝持有索引的一方挪了一格。法律市场接下来要争的不是模型分数,而是那个索引归谁。

评论