Claude引入SynthID文本水印:写在每个token里的隐形标记,正面迎战去水印攻防

2026/08/17 18:11阅读量 2

Anthropic为Claude生成文本引入基于SynthID的隐形水印,水印并非事后添加,而是在生成每个token时通过轻微调整概率写入。这类统计水印可被改写工具破坏,由此引发水印与反检测的持续攻防,并引发对语言表达本身的思考。

事件概述

Anthropic宣布为Claude生成的文本加入“隐形水印”,并随后公布了技术细节:采用Google DeepMind开发的SynthID。水印并非在生成后盖上,而是在模型写出每一个token的过程中被写进文字里。

核心信息

  • 水印原理:大语言模型生成文本时,每一步都会基于上下文为下一个token计算概率分布。SynthID会按照一套只有检测方知道的规则,在模型做选择前轻微调整部分候选token的得分,让某些词更容易被选中。单独看不出异样,但大量生成选择会累积成可检测的统计模式。
  • 攻击方式:水印与文字本身深度绑定,无法通过删除元数据或清理Unicode字符去除。最直接的破坏方式就是改写——换同义词、改语态,或干脆让另一个模型重新“洗”一遍。GitHub上已经出现针对文本水印的移除工具。
  • 攻防循环:为了让水印经得起改写,水印系统需要提高强度;用户则继续寻找尽量保留原意、却更能破坏统计信号的方法。与图片、音频水印不同,文本水印能利用的空间就是词语、句式和表达选择,因此攻防每一步都会直接改变文字本身。

值得关注

  • 这套机制对有意规避者和普通用户并不对称。真正想作弊的人可以绕道非水印模型、重写工具或反复洗稿;没有规避意识的人则会默认接受带水印约束的生成结果。到头来,最容易被水印标记的,恰恰是那些没想躲着它的人。
  • Anthropic和Google强调水印不改变语义、质量和可读性,但模型的生成过程从此多了一个与“怎样把这句话写好”无关的优化目标。当技术系统为了识别身份而调整措辞,用户为了隐去身份而重新措辞时,语言本身的风格、节奏和表达精确度可能被逐渐挤压。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。