Claude 水印无法承担欧盟 AI 法案的全部披露责任

Claude 可以标记部分生成的文本和文件,但这些信号证明的是处理历史,而不是作者身份、真实性或完整的第 50 条合规性。

分享这篇文章

Anthropic 表示,2026 年 8 月 2 日或之后在欧盟推出的 Claude 模型从发布起就支持机器可读标记。受支持模型生成的文本会获得嵌入式水印;受支持的 SVG、PNG 和 JPG 文件会获得签名的来源元数据。

这并没有给产品团队一套完整的欧盟 AI 法案合规层。它只给团队提供了更长链条中的一个信号;这条链条还包括模型覆盖范围、文件处理、检测、可见披露、人工审查,以及这些部分在产品转换输出后仍然有效的证据。

检测到 Claude 标记意味着内容可能经过受支持的 Claude 模型处理。它不能证明想法由 Claude 首创,不能证明内容完全由 AI 撰写,也不能证明其中的主张真实。缺少标记也不能证明没有 AI 参与。

这一点现在很重要,因为第 50 条透明度义务已于 8 月 2 日开始适用。在该日期前已经上市的系统的提供商,可以在 2026 年 12 月 2 日前满足标记和检测要求。Anthropic 的公开实现显示,技术信号能够承担其中多少义务,以及还有多少内容在信号之外。这不是法律建议;具体角色和义务取决于产品、用途、市场和内容。

Claude 水印实际上覆盖什么

Anthropic 8 月 10 日的指南描述了两种不同机制。

对于文本,受支持的 Claude 模型会将不可感知的水印嵌入生成的文字。Anthropic 表示,该信号会随复制的文本一起传播,并且可能在某些编辑后保留,因为它是输出的一部分,而不是文件附件。公司尚未公布检测器,也没有提供足够的技术细节供外部人士独立评估算法。

对于文件,Claude 会为受支持的 SVG、PNG 和 JPG 输出附加签名的来源元数据。元数据遵循 内容来源与真实性联盟(Coalition for Content Provenance and Authenticity,简称 C2PA)标准。有效凭证可以将关于文件处理历史的签名声明绑定到该资产,并揭示后续篡改。

两种机制都不是普遍适用的:

  • Anthropic 表示,8 月 2 日或之后推出的模型支持标记,而对旧模型的支持仍在进行中。
  • 嵌入式文本标记旨在跨 Claude、Claude Platform API、Claude Code、Claude Cowork、Claude Tag,以及受支持的云合作伙伴访问方式工作。
  • 签名文件来源取决于平台、功能和文件类型。
  • 检测器及其置信度报告目前尚未公开。

因此,“我们使用 Claude”不是测试结果。团队需要知道确切的模型、端点、地区、输出类型和转换路径。

标记证明的是处理,而不是作者身份或真实性

Anthropic 对限制的说明格外重要。Claude 可能只是校对人类文档、翻译文档、总结文档,或将其转换为另一种格式。即使底层想法和大部分文本来自人类,最终输出也可能带有 Claude 标记。

反过来也不成立。Anthropic 表示,文本过短、经过大量编辑、改写、翻译或与其他文字混合时,检测可能消失。文件凭证可能在重新保存、格式转换、截图或不受支持的处理过程中丢失。旧模型和不受支持的界面也可能完全不产生可检测标记。Axios 的独立报道强调了这两个运营问题:以人为主的文字可能获得标记,而实质性编辑可能移除标记。

C2PA 也有类似边界。其 Content Credentials 说明表示,凭证可以显示来源声明格式正确、经过签名且未被篡改,但它不会判断图像是否描绘真实事件,也不会判断文档中的陈述是否准确。

应把检测器输出视为带有范围和不确定性的来源观察,而不是对作者身份、抄袭、事实性或政策合规性的裁决。这与我们的 如何阅读 AI 评测指南所描述的测量纪律相同:结果只能回答测试设计要回答的问题。

第 50 条拆分了提供商和部署者的职责

“AI 标签”一词掩盖了两个不同层次。第 50 条将生成式 AI 系统的机器可读标记和检测职责交给提供商,同时在包括深度伪造和为公众利益事项提供信息而发布的文本等明确用途上,将可见披露职责分别交给部署者

第 50 条下提供商和部署者职责的区别
角色 第 50 条的核心任务 Claude 标记无法解决什么
生成式 AI 系统提供商 在技术可行范围内,使用有效、可互操作、稳健且可靠的方案,使范围内的输出具备机器可读性并可被检测。 下游产品是否是拥有自身提供商、界面和检测责任的独立 AI 系统。
使用 AI 系统的专业部署者 首次展示时清楚披露范围内的深度伪造和某些公共利益文本,但须遵守规则中的例外。 该用途是否需要可见通知,或实质性人工审查和编辑责任是否满足文本例外。
仅传输第三方内容的分发商或托管服务 仅因承载内容可能不构成部署者,尽管委员会鼓励保留标记和标签。 仍可能适用的其他平台、媒体、消费者或国家法律义务。

委员会 7 月 20 日的指南明确了两个产品设计后果。

第一家公司可以同时承担两种角色。如果公司在欧盟市场提供品牌化生成式应用,即使上游模型执行生成,它也可以是该系统的提供商。如果公司还专业地使用该系统发布范围内的内容,也可能是部署者。因此,“Anthropic 负责水印”并没有完成对 Claude 驱动应用的角色分析。

第二,机器可读标记和人类可见披露不可互换。只有检测器能读取的水印,并不能提供部署者必须提供的可见通知。醒目的“AI 生成”徽章,也不会让底层输出对提供商义务而言具备机器可读性。

标准编辑暴露了一个有用的不匹配

第 50(2) 条将执行标准编辑,或没有实质改变输入或其含义的系统排除在外。委员会的例子包括语法纠正、拼写检查、轻微风格润色、翻译、格式转换、压缩,以及在不实质改变含义、风格或意图时进行有限的图像修正。

然而,Anthropic 表示,受支持的模型会对所有生成文本应用嵌入式水印,包括校对或翻译产生的输出。这一更宽泛的技术政策并不能证明每段带标记的文字都属于法律上的标记义务。这是另一个不要把“检测到标记”翻译成“法律将其归类为 AI 生成”的理由。

部署者对公共利益文本的例外则不同。委员会表示,它要求实质性人工审查或编辑控制,以及一名承担编辑责任的、可问责的自然人或法人。事实核查是实质性审查的最低组成部分;仅检查语法或自动化审查都不够。在这一目的下,签字确认后进行的实质性 AI 改写也会使先前的审查失效。

因此,发布新闻摘要、安全通知、财务报告或其他公共利益文本的应用,需要记录操作顺序。如果最终生产步骤又将已批准的文本送回生成式改写,“人工审查过”就没有实际意义。

标记可能在完整输出路径中消失

Anthropic 记录的是预期行为,而不是公开的一致性测试套件。在检测器和技术规范到来之前,团队仍可以建立版本化测试计划,并找出证据缺口。

Claude 文本水印和签名文件来源的测试矩阵
待测试路径 已记录的预期 应保留的证据
每个生产模型和端点直接生成的长文本 受支持模型应嵌入文本标记。 模型 ID、端点、时间戳、精确输出、检测器版本、结果以及可用时的置信度。
复制并粘贴到发布系统 嵌入式文本信号可能在复制后保留。 复制前后的文本哈希或差异,以及检测结果。
校对、翻译、改写、缩短和混合人类文本 检测可能保留或消失;短文本和大量编辑的文本可靠性更低。 转换类型、变更比例、语言、长度,以及两次检测结果。
通过每个受支持产品界面生成的 SVG、PNG 和 JPG 受支持文件应携带签名的 C2PA 来源。 原始资产、凭证验证输出、签名者、声明和篡改结果。
调整大小、重新保存、导出、格式转换、优化和截图 即使像素看起来没有变化,元数据也可能被移除。 移除或保留凭证的管线步骤,以及所使用的后备披露。
不受支持的模型、文件类型、云界面或检测器故障 不应假定存在可靠标记。 明确的覆盖状态、面向用户的后备方案、日志和告警行为。

不要等待检测器决定产品应显示什么。检测器可以支持生成后的验证,但应用已经知道调用了哪个模型、执行了哪些转换以及适用哪项披露政策。对于产品行为而言,这段第一方事件历史比反复从最终工件中猜测更可靠。

12 月 2 日前关注什么

Anthropic 仍需向构建者提供最重要的运营细节:检测器、置信度含义、技术规范、确切的受支持模型列表,以及在不同语言、编辑、短文本、代码和云合作伙伴场景下的测量行为。只有这些工具可用后,独立测试才能开始。

对于已经上市的系统,12 月 2 日的过渡期限是下一个确定检查点。有用的证据将包括旧 Claude 模型的覆盖矩阵、可互操作的检测访问、记录在案的误报和漏报行为,以及展示签名来源如何经受常见生产管线的实例。

Claude 的标记是一个真实的实现步骤。它们的价值来自将其视为一个有类型、可测试的信号,然后设计产品的其余部分,确保来源、披露、审查和问责不会在信号消失时一并消失。

资料来源

  1. Anthropic guide to marking Claude-generated content
  2. European Commission Article 50 implementation guidelines
  3. EU AI Act Service Desk text of Article 50
  4. EU AI Act Service Desk enforcement timeline FAQ
  5. European Commission study of AI text-marking techniques
  6. C2PA and Content Credentials explainer
  7. Axios report on Anthropic text watermarks