Anthropic:未来Claude模型将内置文本水印,符合欧盟AI法案
Anthropic宣布未来Claude模型生成的文本将包含水印,用于判断文本是否由Claude生成,且不影响输出质量。
AI解读:Anthropic为遵守欧盟《人工智能法案》和 2026 年 7 月签署的《生成式AI内容透明度实践准则》,决定在未来Claude模型的所有文本输出中嵌入水印。水印通过改变模型选词的随机源来隐藏模式,肉眼不可见,也无需额外token,因此不会增加成本。它可以检测文本是否由Claude生成,但不能证明文本由人类撰写,也无法追踪到个人或组织。检测API目前仅向欧盟法律要求的机构(如监管机构、执法部门、媒体、事实核查员等)和企业开放。普通用户无需行动,但依赖AI生成内容合规审核的机构(如出版社、新闻平台)将更容易验证来源,而完全重写文本可规避水印。此前Anthropic已对于图像和SVG等文件在元数据中附带C2PA内容凭证。
Anthropic于 2026 年 9 月 1 日更新官方新闻,确认未来所有Claude模型生成的文本都将包含水印。这一措施旨在帮助判断一段文本由Claude参与生成的可能性,以符合欧盟《人工智能法案》的要求。
根据Anthropic的说明,水印对文本质量、内容、创造力或可读性没有实际影响,读者无法区分水印文本与普通文本。文本中不会添加隐藏字符,也不会产生额外token,服务成本与速度不受影响。
水印原理与检测方式
该水印技术采用的是Google DeepMind在 2024 年Nature论文中提出的SynthID-Text方法,其设计原则可追溯到 2022 年Scott Aaronson的提议。其核心机制是:在模型选择下一个词时,原本使用随机数决定,加入水印后,改用一个密钥和之前几个词来决定,但选择仍是随机的。因此,文本序列会留下一种模式,只有持有密钥的人才能检测。
Anthropic用大富翁游戏做类比:如果玩家不再用骰子,而是用圆周率数字序列来决定走几步,移动依然是随机的,但之后可以回溯判断游戏是否使用了圆周率。
需要说明的是,检测水印只能回答“这段文本有多大可能是由Claude生成”,不能确认文本是否由人类撰写,也无法判断是否由其他AI工具生成(不同AI有不同密钥)。水印在较短文本上效果不佳,文本越长,置信度越高。对于事实性内容(如数学、科学事实)或代码,因正确用词唯一,水印难以应用;不过,在代码注释或可灵活选词的部分仍可嵌入水印。
- 水印不会增加成本,因为不产生额外token。
- 检测API目前已进入私有预览,首批开放给符合欧盟法律要求的组织,如监管机构、执法部门、媒体、事实核查员、独立研究者、教育机构和欧盟公民社会团体,以及有合规义务的企业。
- Anthropic计划逐步扩展检测API的访问范围,并开放了登记兴趣的入口。
- 对于图片和文件,Claude会在元数据中添加C2PA内容凭证(加密签名注记),说明文件由Claude制作或处理,该凭证不包含任何可识别信息。
合规原因与全球应用
Anthropic表示,实施水印是为了遵守欧盟《人工智能法案》。2026 年 7 月,Anthropic与其他约 190 家签署方共同签署了欧盟《生成式AI内容透明度实践准则》,该准则要求AI提供商标记AI生成的文本。由于目前无法按地区限定水印,Anthropic将水印应用于全球范围内的所有Claude模型输出。
对于 2026 年 8 月 2 日之前发布的旧版Claude模型,欧盟法律设有过渡期,Anthropic计划在接下来几个月内为这些模型逐步加入水印。
- 水印不包含任何可追踪到个人、组织或聊天记录的信息。
- 检测只能判断Claude是否可能参与了内容生成,无法区分是“Claude撰写”还是“Claude大量编辑”。
- Claude生成的翻译文本同样带水印,因为所有词都由Claude选择。
- 水印可被完全改写(每个词都替换)而绕过,轻微编辑则难以完全移除。