AI 见闻
精选· 重要性 4/5

程序员称已找到绕过Claude隐形水印的方法

Wired — AI··Isabella Ward·约 6 分钟阅读
中文导读

Anthropic为遵守欧盟AI法案在Claude中嵌入隐形水印,但开发者迅速发布去除工具,引发关于AI内容标识与透明度的争议。

在Anthropic确认Claude模型将在全球范围内将隐形、机器可读的水印嵌入到任何AI生成内容中后的四小时内,开发者Guillaume Meyer就发布了他的破解方法。

他从Claude生成的文本中去除水印的代码此后在GitHub上疯传,在X上被收藏超过2万次,并吸引了100多名贡献者,还有更多人将该技术整合到自己的项目中。

“Anthropic正在其Claude文本中嵌入水印……仅仅一天后,这个问题实际上就成为了历史,”一位AI专家写道,并配上了Meyer挣脱锁链、站在皱巴巴的欧盟和Anthropic旗帜上的图片。

Anthropic上周宣布Claude将采用水印技术以遵守欧盟的AI法案后,Meyer和其他人开始研究水印的工作原理。Meyer告诉《连线》杂志,一些人试图规避水印,因为他们不同意所有AI生成内容都应被标记的观点,而包括他本人在内的其他人则表示,他们只是享受技术挑战。

他说,自由内容作家和社交媒体创作者也联系了Meyer,请求使用该代码的帮助。

本月早些时候生效的新规规定,Anthropic和OpenAI等模型提供商必须标记合成音频、图像、视频或文本,以便机器能够检测到这些材料是AI生成的,否则将面临高达年营业额3%的罚款。虽然规则规定提供商不能营销规避工具,但对独立工具没有法律限制。

“我并不反对透明度,我完全支持内容归属,”Meyer说。“我只是认为水印本身是一个非常糟糕的解决方案,因为它有重大缺陷和风险。

”他担心误报的风险,以及水印可能无法区分AI使用的轻度或重度,尤其是因为他作为法语母语者,经常使用Claude和Grammarly等其他AI工具来编辑自己的写作。

他说,使用水印作为证据——即使Anthropic也承认它只能生成文本被Claude处理过的概率——可能会导致雇主不公平地拒绝候选人,或者仅仅因为检测器标记就过度指责研究人员使用AI。

Anthropic通过Claude在措辞和短语选择上留下一种模式来无形地标记文本,这种模式对人类读者来说难以察觉,但知道如何寻找它的机器可以检测到。

由于这会影响Claude的输出,一些用户担心这会降低Claude回复的质量,尽管Anthropic坚称不会如此。这项名为SynthID的技术由谷歌开发,自2023年以来,谷歌一直用它来标记其AI生成的内容。

计算机科学家Scott Aaronson在OpenAI工作时提出了类似方法,但该公司从未部署,因为担心水印会让客户对其产品望而却步。Meyer的去除方法使用非水印大语言模型生成多次重写,替换同义词并稍微重新组织内容。

当然,这依赖于使用其他不插入水印的大语言模型——这可能不是一个稳妥的选择,因为包括OpenAI、微软和Meta在内的190个组织已签署欧盟的透明度实践准则。这些实验室中有多少会实施水印还有待观察,水印必须包含在8月发布的所有新模型中,并必须在12月前集成到现有模型中。

总部位于硅谷的主权AI初创公司Haimaker的首席技术官兼联合创始人Wayne Pan表示,虽然在Anthropic发布用于检测水印的软件之前,该工具是否有效尚无定论,但了解Claude水印所基于的SynthID文本方法,让他们相当确信该方法有效。

他将Meyer的开源工具整合到自己的平台中,因为他同样不喜欢Claude对内容加水印的想法,即使内容只是经过轻微编辑,也不同意水印对用户不可见。

其他程序员也开发了自己的去除工具:软件工程师Erik Hughes花了15分钟用Claude构建了一个工具,可以删除不可见和相似字符、重新排列段落中的句子,并将几个单词替换为同义词。

牛津大学客座研究员Leon Chlon表示,可以通过浓缩Claude的回复、将其翻译成阿拉伯语等与英语语义差异很大的方言,然后再翻译回来,从而去除水印。Anthropic自己也承认,经过大量编辑、改写或翻译的内容可能不会带有水印。

Anthropic发言人在给《连线》杂志的一份声明中表示:“我们正在对Claude的输出添加标记,以遵守欧盟AI法案,其他实验室也在采取类似措施。识别AI生成的文本很困难,这为人们提供了更好的识别工具。

来自受支持的Claude模型的文本(包括Claude Code的输出)将带有隐形水印,这不会改变Claude回复的含义、质量或可读性。我们还计划推出一个文本检测API,以便用户自己进行更多此类操作。

Anthropic表示,它正在研究如何实现文本水印检测,并计划很快发布一个工具来实现这一目标,届时开发者将最终能够看到他们的方法是否万无一失。它还在继续改进水印系统。“我认为他们想表明他们是真诚地这样做的,”Pan说,“但我认为你不可能拥有一个能抵御一切的水印。

原文出处
Coders Say They Already Found Workarounds to Claude’s Invisible Watermarks

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读