Anthropic 宣布从 2026 年 8 月 2 日起,新发布的 Claude 模型将内置 AI 生成内容标记功能。两种技术:文本嵌入式水印和 C2PA 签名来源元数据。全球全场景覆盖,包括 API、Claude、Claude Code、Claude Cowork 和 Claude Tag。
文本水印是不可见的——它被编织到文本本身中,随复制粘贴一起转移,不影响含义、质量或可读性。文件水印遵循 C2PA 开放标准,目前支持 .svg、.png、.jpg 格式。

Anthropic 没有披露具体的水印算法。但有社区用户猜测这与 Gemini 的 SynthID 类似——通过微调 token 的对数概率实现,而非插入明显的标记词。"人类不会注意到,但一个在 Claude 输出上训练的分类器会检测到。"
也有人进一步解释了红绿 token 分组方案:对每个位置的下一个 token 选择施加轻微偏向(红组/绿组),累积后统计上几乎不可能偶然重现。原理不复杂,但问题在于:这对代码意味着什么。
simonw 的担忧最具代表性:"如果那些重构代码的文本里被植入某种奇怪的模式来充当水印,那是绝对不行的。" akersten 更直接:"我的代码会因为水印在随机位置变差,而这只是为了迎合欧盟的一项自愿性建议。"
这触及了核心矛盾。水印在散文、邮件、营销文案中可能无伤大雅,但在代码生成中——每一行都要精确、每一个 token 都要最优——任何对概率分布的干扰都是对输出质量的直接损害。
Anthropic 的文档中列出了一系列限制条件:标记被检测到不代表完全确证,未检测到标记不代表内容不是 AI 生成。文本经过大量编辑、改写、翻译或混入其他内容后,水印可能失效。段落太短时信号不够可靠。
但最尖锐的批评来自 Dilettante_:"Anthropic 应该明确承认,完全由人类撰写的内容也可能被误标为 AI 生成。太多机构手握足以毁掉一个人生活的权力,却难以理解这个概念。"
aabhay 则提出了一个更微妙的观察:Claude 独特的写作风格本身就是一种指纹——"Anthropic 实际上有意强化了 Claude 独特的写作方式,因为这会让文本更明显地像是 AI 生成的。" 这比水印更隐秘,也更难规避。
stranded22 已经做出了决定:"我取消 Claude Max 5x 订阅,转投 ChatGPT Pro。作为 ADHD 和阅读障碍用户,我本来就有足够困难确保自己的意思正确传达,不希望再和一个在我表达上额外添加了一层偏见的系统合作。"
检测工具还在开发中,具体技术细节将在后续文档公布。但目前看来,最难的从来不是技术实现,而是分清谁在保护用户,谁在保护平台。
参考来源: