AI News字数 3213阅读时长9 分钟

欧盟《人工智能法案》规则下,未来 Claude 模型将在全球为文本添加水印

Anthropic 将在全球范围内为未来 Claude 模型添加基于 SynthID 的文本水印和 C2PA 文件凭证。

文章目录 · 12
  1. 一、标记将覆盖 Claude 产品和云端访问
  2. 二、Claude 将使用 SynthID-Text 的一个版本
  3. 三、文件将使用 C2PA 元数据,而非文本技术
  4. 四、检测仍具有概率性,Claude API 尚未推出
  5. 五、这一变更落实了一项法定标记要求
  6. 常见问题
  7. 每一条 Claude 回复现在都已包含水印吗?
  8. 复制 Claude 文本可以移除水印吗?
  9. 水印能证明 Claude 撰写了整份文档吗?
  10. 水印会增加 Claude 的词元用量或价格吗?
  11. Claude 的水印检测器已向公众开放吗?
  12. 参考来源

Anthropic 将在未来 Claude 模型中内置机器可读的溯源信号:为生成文本添加统计水印,并为受支持文件添加经签名的 C2PA 元数据。尽管这一变更旨在遵守欧盟《人工智能法案》,Anthropic 计划在全球应用该文本水印,而非仅限于欧洲用户。

该政策适用于自 2026 年 8 月 2 日起在欧盟推出的 Claude 模型。这些模型将从发布时起支持标记;Anthropic 表示,正在努力于未来数月内将该系统扩展至在该日期之前发布的模型。该公司尚未点名具体哪一款新 Claude 模型将率先实施。

水印不会以标签、隐藏 Unicode 字符或回复中的额外一行形式出现。相反,它会改变 Claude 在生成过程中选择词元时所使用的统计过程。Anthropic 表示,这不应改变含义、可读性、延迟或定价,但该公司尚未发布其 Claude 专用检测器、阈值、误报率或完整技术评估。

一、标记将覆盖 Claude 产品和云端访问

Anthropic 表示,受支持模型将在 Claude 消费者服务、Claude Platform API、Claude Code、Claude Cowork 和 Claude Tag 中应用文本水印。通过 AWS、Google Cloud 或 Microsoft Foundry 访问这些模型时,水印同样会生效。

这种模型层面的实施方式很重要,因为标记不依赖于某个特定用户界面。调用 API 的开发者和直接使用 Claude 的个人,在使用受支持模型时,都应获得通过同一水印流程生成的文本。

此次推出覆盖全球。Anthropic 表示,目前尚无持久可靠的方法可按地区限制该机制,因此只要 Claude 在某地提供服务,受支持模型就会在那里标记文本。这使一项欧盟合规要求也成为欧盟以外 Claude 用户和开发者的产品变更。

这一广泛范围也存在限定条件。经签名的文件元数据可能并非在每个云平台、产品功能或文件类型中都可用。现有 Claude 模型也可能在 Anthropic 更新前仍不带标记。因此,检测不到标记并不能证明某段文字不是由 Claude 生成的。

Anthropic 表示,水印不携带有关生成文本的用户、组织、账户或对话的信息。它识别的是与 Claude 生成过程相关的统计模式,而非某个个体来源。该机制也不会产生额外输出词元,因此 Anthropic 表示不会增加使用费用。

二、Claude 将使用 SynthID-Text 的一个版本

Claude 的文本水印基于 SynthID-Text,这一方法由 Google DeepMind 在 2024 年发表于《Nature》的论文中描述,随后向其他模型开发者开放。

语言模型通常会根据前文的条件概率分布选择下一个词元。许多段落中存在多个同样合适的选择。水印系统可以利用这些选择形成反复出现的统计模式,而无需插入可见符号或单独的元数据字段。

Anthropic 描述称,其实施方式会使用私钥和前面的词语,来确定适用于合格选择的随机性来源。能够访问相关密钥的检测器可以检查一段文字,并评估其词元序列与 Claude 带水印生成过程的一致程度。

Google 的参考实现将 SynthID-Text 描述为在 top-k 和 top-p 过滤后应用的 logits 处理器。一个伪随机函数会对模型词汇表中的词元分配分数,水印配置会影响词元选择。无需进行额外模型训练,但密钥和配置必须保持私密;否则第三方可能复现该信号。

因此,水印是生成措辞的一部分,通常能在复制和粘贴后保留。轻度编辑或摘录可能仍保留足够的模式,从而可被检测。彻底改写、翻译或与其他文本混合,可能降低检测器的置信度,或消除可用信号。

水印密度也取决于任务。开放式文本提供了许多无关紧要的措辞选择,而事实性回答中有更多词元的某一种续写显然比其他选择更准确。Anthropic 表示,当水印引导可能损害正确性时,将避免施加这种引导。

同样的限制也会影响源代码。精确的语法、标识符和程序行为限制了可互换词元选择的数量,因此代码中可检测到的水印可能少于散文。不过,注释或其他任意措辞仍可能携带这一模式。校对也是如此:当 Claude 保留大部分个人原始措辞时,可能留下很少的信号;而翻译更可能携带水印,因为 Claude 会选择译文中的每一个词。

三、文件将使用 C2PA 元数据,而非文本技术

对于 SVG、PNG 和 JPEG 输出等受支持文件,Anthropic 将附加一份小型、经过加密签名的溯源记录,遵循内容溯源与真实性联盟的标准。

C2PA 凭证会记录文件的来源和处理历史。兼容的验证工具可以检查签名记录,并判断文件是否以破坏其与该记录加密关系的方式发生变化。

这一机制不同于 Claude 的文本水印。C2PA 信息位于文件元数据中,而不是以统计方式编码进像素或措辞之中。其存在可以表明 Claude 曾生成或处理某个文件,但不能证明 Claude 创作了其中的每一个元素。

元数据也比文本层面的统计模式更容易丢失。Anthropic 警告,格式转换、重新保存、截取屏幕截图或其他处理都可能剥离文件凭证。一些平台可能一开始就不保留或不支持该元数据。

因此,缺少凭证并不能证明 Claude 没有参与某个文件。反过来,有效凭证也只能证明已记录的处理事件;它并不是对内容是否准确、是否在更广泛的编辑意义上真实,或是否主要由人类创作的判断。

四、检测仍具有概率性,Claude API 尚未推出

Anthropic 表示将提供水印检测 API,但截至 8 月 27 日,尚未发布该 API、其上线日期、判定阈值或详细的 Claude 专用性能结果。其帮助文档称,进一步的技术指南即将发布。

这些缺失的信息使人们无法准确评估 Claude 的误报概率。SynthID-Text 检测本身具有概率性,Google 的公开实现可以返回“带水印”“不带水印”或“不确定”。运营者可以配置阈值,以权衡误报与漏报。

Anthropic 的检测器将回答一个有限的问题:Claude 参与生成所提交文本至少一部分的可能性有多大。它不能证明 Claude 撰写了整份文档,不能区分生成与大幅编辑,不能识别用户,也不能检测由使用不同水印密钥的无关模型生成的文本。

阳性结果可能覆盖其基本思想或原始措辞来自个人的材料。Claude 可能对这些材料进行了翻译、摘要、重新排版或大幅编辑。阴性结果同样没有定论,因为该段文字可能太短、经过大量改写、与其他写作混合、由较旧的 Claude 模型生成,或通过不受支持的界面产生。

Anthropic 报告称,其内部测试发现对内容、创造力或可读性没有影响,但尚未发布底层的 Claude 评估。最接近的公开大规模证据来自 Google DeepMind 的 SynthID-Text 研究:该研究比较了近 2,000 万条带水印和不带水印的 Gemini 回复的反馈,报告用户评分没有统计显著差异。这一结果支持这一通用方法,但并不是对 Anthropic 未披露实施方案的独立测量。

这些限制使检测器不适合作为就业、教育、抄袭或纪律处分决定中的独立证据。即使 API 推出后,负责任的使用仍需考虑已发布的阈值、评估数据、段落长度、语言、编辑历史及其他溯源证据。

五、这一变更落实了一项法定标记要求

欧盟《人工智能法案》第 50 条于 2026 年 8 月 2 日开始适用。该条要求生成式 AI 系统提供者使用在技术可行范围内有效、可互操作、稳健且可靠的技术,以机器可读格式使合成音频、图像、视频和文本输出可被检测。

Anthropic 是签署《AI 生成内容透明度行为准则》的组织之一。该准则是自愿性的,但其基础的第 50 条义务具有法律约束力。欧盟委员会和 AI 委员会已认可该准则,将其作为签署方可以借此证明合规的框架。

提供者一方的标记要求不同于关于可见披露的规则。Anthropic 等提供者必须在适用系统中内置机器可读信号。部署者还面临额外义务:对深度伪造内容,以及为就公共利益事项告知公众而发布的某些 AI 生成或篡改文本进行标注,但人类审查和编辑责任等情形可适用例外。

对于将 Claude 嵌入其他产品的开发者,Anthropic 的模型层面水印可能提供所需溯源基础设施的一部分,但并不能解决开发者自身的合规义务。Anthropic 明确建议下游构建者评估第 50 条如何适用于其产品和服务。

常见问题

每一条 Claude 回复现在都已包含水印吗?

不是。该承诺涵盖于 2026 年 8 月 2 日或之后推出的受支持模型,而针对旧模型的标记功能仍在开发中。

复制 Claude 文本可以移除水印吗?

普通复制和粘贴应会保留水印,因为该模式编码在用词选择中。大量改写、翻译或与其他文本混合,可能削弱或移除可检测信号。

水印能证明 Claude 撰写了整份文档吗?

不能。它可以表明 Claude 很可能参与其中,但无法区分完整生成与大幅编辑、翻译或摘要。

水印会增加 Claude 的词元用量或价格吗?

Anthropic 表示不会产生额外词元,且该机制对生成速度的影响微乎其微,因此定价不会因水印而改变。

Claude 的水印检测器已向公众开放吗?

尚未开放。Anthropic 表示检测 API 和更多技术文档即将推出,但尚未公布上线日期或 Claude 专用错误率。

参考来源

Share

分享这篇文章