Thomson Reuters 构建了法律 AI 模型。它证明了什么?

Thomson Reuters 发布了用于 CoCounsel 的专有模型,也开放了一个较小版本的权重。以下是买方可以验证的内容,以及仍属于供应商主张的内容。

分享这篇文章

Thomson Reuters 已推出 Thomson,这是一系列为法律、税务、会计和其他专业工作训练的语言模型。首个生产用途很窄:Thomson 预计将为 CoCounsel Legal 中的结构化文档审查功能 Tabular Analysis 提供动力,而 CoCounsel 会继续将其他工作路由到外部模型。

该公司还发布了 Thomson-1.0-Small 的权重。这改变了买方和研究人员可以获得的证据,因为现在可以在 Thomson Reuters 之外检查和测试该家族的一个成员。但这并不能独立验证更大的专有模型,不能证明任一模型都能给出可靠的法律答案,也不能表明拥有训练数据就足以让系统安全地用于专业场景。

证据中有两个 Thomson 模型

8 月 24 日的发布公告将 Thomson 描述为该公司首个内部开发的大型语言模型。Thomson Reuters 表示,它以强大的开放基础模型起步,在人才和算力上投入了 4,000 万美元,使用了不到 10% 的内容进行训练,并保留了对模型及其运行的控制。这些是公司披露,而不是经过审计的成本或性能结论。

生产系统并不是简单的“Thomson 取代所有外部模型”。Thomson Reuters 表示,Tabular Analysis 将是首个使用 Thomson 的 CoCounsel Legal 功能,而产品在设计上仍是多模型的。SiliconANGLE 报道,管理员将能够选择其他模型,且 Thomson Reuters 会继续在第三方系统更合适的地方使用它们。The New Stack 也报道,CoCounsel 仍在使用 Anthropic 技术,Thomson Reuters 也没有声称每条生成的陈述都能逐行追溯到某项法规或裁决。

该公司还在 Hugging Face 上发布了 Thomson-1.0-Small。其模型卡描述了一个混合专家模型:总参数 350 亿,激活参数 30 亿,原生上下文窗口为 262,144 个 token,权重采用 BF16。混合专家模型只会让每个输入经过总参数集合中的一部分,因此 350 亿和 30 亿描述的是同一架构的不同部分,而不是两个模型大小。

小模型基于 Qwen3.6-35B-A3B,并经由 Snowdon-1.1-Small 检查点构建。其权重以 PolyForm Strict 1.0.0 许可证公开。因此,“开放权重”意味着研究人员可以下载和检查参数;不应悄然将其扩大为每种用途都被允许,或生产模型的权重已经公开的主张。

证据层当前公开内容它没有确立的内容
Thomson 生产模型发布范围、选定的大模型基准结果、公司训练和成本披露,以及计划中的 CoCounsel 部署位置独立准确率、生产失败率、特权信息保护,或买方工作上的等效表现
Thomson-1.0-Small可下载权重、架构、训练概要、基准表、对比设置和技术报告更大的生产模型或完整 CoCounsel 系统的行为
CoCounsel 产品在 Tabular Analysis 中的首个计划用途,以及披露的多模型路由策略每项任务由哪个模型处理、每条引用的质量,或安全的无人监督法律使用

这种区分很重要,因为模型基准、开放权重检查点和产品工作流是三个不同的对象。关于其中一个对象的证据不会自动转移到另外两个对象。

专有数据改变训练流程,而不是证明责任

Thomson Reuters 的开发流程说明描述了三个大致阶段。团队首先围绕已发布的价值框架重新调整开放基础模型。随后,它使用持续预训练,从 Westlaw、Practical Law、Checkpoint 和 Reuters 加入选定材料,同时重放通用数据,以减少灾难性遗忘——即专业化过程中有用的通用能力丧失。后训练使用专家偏好、领域量规和强化学习来塑造行为与工具使用。

小模型卡补充了有用的规模信息。Thomson Reuters 表示,其中期训练语料包含 2,000 亿个 token,从超过 19 万亿个 token 的池中筛选而来,大致分为专有文档、这些文档的合成改写,以及通用能力重放数据。它报告开发流程使用了 35,207 个 Nvidia B200 GPU 小时,以及约 1.63 × 10²³ 次浮点运算。

这些细节支持一个具体结论:Thomson Reuters 做的不只是给冻结的通用模型接上搜索工具。它使用领域内容和专家生成的训练信号改变了模型权重,然后公开了足够多的小型检查点,使第三方测试成为可能。

但它们并没有显示专有内容自动就是高质量训练数据。权利、新鲜度、司法管辖区、重复、标注一致性,以及训练样本与专业任务之间的关联,仍会影响结果。模型所有权本身也不能证明保密性。推理时发送的数据、日志、检索系统、访问控制、留存、事件响应和合同,仍然是产品层面的控制。

基准表提供了信息,但仍是供应商证据

Thomson Reuters 披露的不只是单个标题分数。其7 月基准文章在七个法律和通用类别中比较了 Thomson-1-Large、Gemini 3.1 Pro、Claude Opus 4.8 和 GPT-5.5。Thomson 在发布表格中的三行领先,其他模型在剩下四行领先。文章还表示,其 53 个查询的深度研究比较使用了内部代理工具链;Thomson 使用 Thomson Reuters 的来源,外部模型使用开放网络搜索;大型语言模型评审者则根据领域专家进行校准。

这比声称一个模型简单地“最好”更容易解释,但这一设置把模型行为、检索权限、专有语料、代理工具链和评审流程结合在一起。在这些条件下,该比较可以支持一个产品系统层面的主张,却不能分离出结果有多少来自基础模型、持续训练、来源访问、提示、工具或评分。

发布的小模型提供了第二组供应商运行的结果。其模型卡报告列出基准的未加权平均分为 74.6,而 Snowdon-1.1-Small 和 Qwen3.6 基础模型均为 71.7。逐行结果是混合的:Thomson-1.0-Small 在模型卡的“Human Queries”和深度研究指标上相较基础模型有明显提升,但 Gemma 4-31B 在数项列出的法律测试中领先,包括 Stanford LegalBench 和合同理解。在通用基准上,Thomson 的基础模型或某个对比模型也在数行获胜。

混合结果不是需要隐藏的尴尬。它们说明专业化有其具体形状。有用的问题是哪些任务在什么工具链下得到改善,而不是一个平均分是否能把领域模型变成一个普遍更安全的律师。

供应商主张可用证据部署决策仍需要的证据
Thomson 与前沿模型具有竞争力指定的对比模型、逐行结果、部分推理设置,以及已描述的评审方法独立重跑、置信区间、污染分析、完整提示,以及匹配条件下的成本和延迟
领域训练改善了专业工作与基础模型的小模型对比,以及公司深度研究和专家查询测试有代表性的买方事务、司法管辖区覆盖、盲法专业评分、失败分类和可复现的任务级结果
引用使输出更可靠公司事实性指标检查所引用来源是否支持提取出的主张缺失权威测试、错误但有来源支持的主张、引用完整性、来源新鲜度和人工验证时间
所有权改善了控制和经济性披露的模型所有权、4,000 万美元项目投入、公开的小模型权重和多模型产品路由总拥有成本、服务测量、变更控制证据、数据流文档和合同保证

现有的 AI News 评估说明提供了一个有用基线:在把分数当作产品结论之前,先确定任务、数据、评审者,以及它与真实运行条件的匹配程度。

专业可靠性属于整个系统

法律工作提高了看似合理的错误所带来的成本,但在训练中加入法律文本并不会消除这种错误模式。一个来源可能支持某项陈述,而总体结论却遗漏了具有控制效力的权威依据。正确的规则可能被应用于错误的司法管辖区或日期。文档审查模型可以准确提取文本,而周围的工作流却可能把特权信息暴露给错误的用户。

Thomson Reuters 自己也划出了这条边界。The New Stack 报道该公司的立场:没有任何 AI 模型,包括 Thomson,都保证不会出错,最终验证仍由专业人士负责。SiliconANGLE 称,早期结果尚未得到广泛的独立验证。这些谨慎与公司的“Fiduciary-Grade”品牌并置时既显得不协调,却也很有用:这个标准是一个愿景和产品主张,不是由基准表创建的认证。

因此,对于买方来说,验收材料应将确切模型与确切工作流联系起来:

  1. **版本和路由:**记录模型修订版、检索来源、工具、提示或代理策略,以及任务被路由到 Thomson 或其他模型的情况。
  2. **代表性工作:**在系统实际会遇到的司法管辖区、文档类型、语言和截止期限中,使用冻结的事务或现实的合成案例进行测试。
  3. **权威与引用检查:**衡量每个重要命题是否有支持,是否遗漏相反或具有控制效力的权威,以及合格审查需要多长时间。
  4. **数据边界:**记录提示、上传文档、检索来源、日志和反馈的流向;谁可以访问;保留多久;以及任何路径是否用于训练。
  5. **失败与恢复:**记录拒答、不受支持的答案、工具失败、路由错误、审查者覆盖、事件处理,以及首选路径不可用时经过测试的回退方案。
  6. **独立审查:**要求具备足够证据、时间和权限的合格人员,在输出影响客户或事务之前拒绝该输出。

最后一项控制需要的不只是一个批准按钮。AI News 的有意义的人类审查指南(中文)展示了证据访问权、覆盖权限、记录理由和申诉路径如何将名义上的审查者变成实际的保护措施。本文是技术和产品分析,而不是法律建议;专业义务和特权规则取决于司法管辖区和用途。

开放权重带来了下一项真正的测试

Thomson-1.0-Small 给外部研究人员提供了发布时没有的东西:一个可以在新的提示、评分者、语言、司法管辖区和失败测试下运行的检查点。其限制性许可证和较小规模意味着它不是生产模型的完整代理,但独立结果现在可以测试:报告的专业化是否能在公司工具链之外继续成立。

下一步最有信息量的披露,应当把这些小模型的重跑结果与更大的系统连接起来:完整的生产模型技术报告、匹配的成本和延迟、任务级不确定性、来源覆盖失败、外部专业评分,以及发布后 Tabular Analysis 的证据。在此之前,Thomson 是领域模型开发的可信展示,也是一个有前景的评估对象,但还不能证明专有数据已经解决了法律 AI 的可靠性问题。

资料来源

  1. Thomson Reuters launch announcement for Thomson
  2. Thomson-1.0-Small model card and benchmark disclosures
  3. Thomson Reuters account of how Thomson was built
  4. Thomson Reuters early benchmark disclosure for Thomson-1-Large
  5. The New Stack reports on Thomson and continued Anthropic use
  6. SiliconANGLE reports on Thomson deployment and validation limits