工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

汤森路透放弃租用AI,斥资4000万美元自建模型

这款没有依赖OpenAI、而是基于阿里巴巴Qwen打造的律所专用模型,只在自家数据上略胜一筹

이미지: METAL LAB 생성

摘要

  • 汤森路透基于阿里巴巴的Qwen3.5-397B推出了自研语言模型"Thomson"。公司表示,两年多来在人力和算力上投入了约4000万美元。
  • 仅比较网络检索能力时,该模型不敌GPT-5.4;但一旦接入Westlaw等自家内容,就能小幅反超。
  • 汤森路透认为,在法律文件审查这类工作量巨大的业务上,自研模型更划算。
모델명
Thomson (톰슨)
기반 모델
Alibaba Qwen3.5-397B
투자 규모
2년 이상 인력·컴퓨팅에 약 4천만 달러, 최종 학습 자체는 45만 달러
안전 재학습 버전
Snowdon (임페리얼칼리지와 공동 개발)
학습 데이터 활용률
보유 콘텐츠 전체의 10% 미만
벤치마크(LegalBench)
0.823 — Gemini 3.1 Pro·GPT-5.5에 뒤처짐
자체 Deep Research 벤치마크
웹 접근만 0.53(GPT-5.4 0.65) → 자사 콘텐츠 포함 시 0.83(GPT-5.4 0.82)
공개 계획
소형 버전을 Hugging Face에 비상업 라이선스로 공개 예정

为什么没有依赖OpenAI,而是自己动手做

法律与财务信息服务企业汤森路透(Thomson Reuters)推出了自研语言模型"Thomson"。这款模型没有借用OpenAIAnthropic等前沿实验室的模型,而是基于阿里巴巴的开源模型Qwen3.5-397B自行打造而成。公司公布的投入规模是:两年多时间里,在人力和算力上花费约4000万美元。媒体广泛引用的45万美元,其实只是最后一次训练所耗费的成本,而在此之前真正沉淀下来的资本,是Westlaw、Practical Law、Checkpoint、Reuters数十年积累的内容,以及数百名领域专家投入的劳动时间。

在OpenAI和Anthropic为了遏制中国AI的追赶而大幅降价的当下,汤森路透索性选择了完全不租用前沿模型的路线。与其使用越来越便宜的API,公司选择把钱投入自建模型,背后的逻辑是:业务量越大、越重复,自建模型的运营成本就越低于订阅他人模型的费用。

从Qwen到Snowdon,再到Thomson

汤森路透与伦敦帝国理工学院(Imperial College London)合作,先按照安全性、伦理和政治中立性标准对Qwen进行了再训练,并给这个中间阶段的模型起名"Snowdon",取自威尔士一座山峰的名字。此后又用自家内容做预训练,与领域专家一起进行后续训练,最后还在自家工具环境中叠加了智能体式强化学习。据公司介绍,尽管经历了这么多阶段,目前使用的内容量还不到公司全部储备的10%。

首席技术官Joel Hron表示,"开源起点已经换了差不多五六次";研究负责人Jonathan Schwartz则指出,比起单个模型本身,这一过程中形成的"模型工厂"才是更大的成果。

只在自家数据上领先的基准测试

公司博客公开的说明把Thomson描述为全球顶尖模型之一,但公司自己公布的数据呈现出一幅更为谨慎的图景。

基准测试Thomson比较结果
Stanford LegalBench0.823落后于Gemini 3.1 Pro、GPT-5.5
Harvey Legal Agent Benchmark-仅次于Opus 4.8
自有Deep Research(仅网络检索)0.53GPT-5.4为0.65
自有Deep Research(含自家内容)0.83GPT-5.4为0.82

在指令遵循和高难度法律问题的基准测试PrBench Legal中,Thomson占优,但在推理和编程方面明显落后。比较方式也并非完全公平——Thomson在测试时使用了更多计算量来应战,而GPT-5.5则是在未开启推理模式的情况下参与比较的。

评测负责人Andrew Bean也承认,仅就网络检索能力而言,Thomson"处于其他模型的水平区间内,但还谈不上明显领先"。有意思的是,一旦接入自家内容,GPT-5.4的表现也会以几乎相同的幅度提升。这说明造成性能差距的,与其说是专门训练,不如说是数据访问权本身;而且要注意的是,公司并未拿更新的模型来做对比。

为何仍坚持自建模型

汤森路透明明可以用法律数据对OpenAI或Anthropic的前沿模型做微调,为什么却要从头另起炉灶?公司给出了三个理由。

第一是经济性。Schwartz指出,标准微调方式"很容易削弱模型的通用性能",而且一旦微调,就会在推理成本和路线图上持续依赖那家提供商。业务量越大——比如文件审查这类工作——体积小、成本低的自建模型就越划算。

第二是数据。在Westlaw等自家工具环境中直接进行训练时,性能会大幅提升,而公司表示不会把这种访问权开放给任何外部企业。

第三是复利效应。Hron将其比喻为"租房子和买房子的区别"。每次更新产品,专家审核过的内容都会沉淀为训练数据;如果是自建模型,这些积累会随时间越滚越大、成为长期资产,而使用别人的模型,这份价值就会流向提供商那一边。

Hron表示,未来AI的竞争力将取决于"如何协调调度,以及能否判断哪些智能重要到值得自己拥有"。

目前如何使用

发布之初,Thomson将负责法律AI产品CoCounsel Legal中的表格分析(Tabular Analysis)功能。公司判断,这类任务用体积小、成本低的模型来处理也完全划算。产品本身依然采用多模型协同的架构,管理员可以更换模型,Thomson并不是统筹全局的角色,而是承担引文核实之类的下游任务。公司表示客户数据不会被用于训练。

小型版本计划以非商业许可的形式发布在Hugging Face上,随后还会公布技术报告和开发者门户。据Hron透露,与各家律所就直接授权展开的初步磋商也已在进行,但目前尚不具约束力。

编辑视角

这个案例有意思的地方在于,它提出的不是"谁能造出更聪明的模型",而是"谁有资格拥有自研模型"这个问题。汤森路透之所以能算清这笔账,是因为同时具备三个条件:独有数据、数百名全职领域专家,以及能够客观评分结果的工作流程。这个组合表明,在开源社区仅用几个月就能追上前沿实验室的当下,具备这三个条件的企业,用4000万美元也能打造出足够有竞争力的专用模型。反过来说,如果一家公司既没有独有数据,也没有评分结果的方法,走同样的路,往往只会留下无休止的维护成本。

从代际比较来看,还有一个值得注意的细节:仅靠网络检索能力比较时,Thomson不敌GPT-5.4;但GPT-5.4一旦接入自家内容,性能提升幅度也和Thomson相当。这说明起决定作用的不是专门训练本身,而是数据访问权,等于公司自己也承认了——领先的原因不是"我们的模型特别",而是"只有我们拥有这些数据"。国内企业中,如果同时拥有法律、医疗、金融等领域的独家数据和专家审核体系,这套算法完全值得照搬。反之,如果既没有这样的数据,也没有评分体系,仅仅跟风"我们也要有自研模型",很可能只会让成本不断攀升。

未来几个月内,很可能会换用更强的Qwen变体,推出突破10%内容使用上限的下一代版本。届时,仅凭网络检索能力能否超越前沿模型,将成为检验这场实验是否真正奏效的下一道试金石。

评论