AI 见闻
精选· 重要性 4/5

Anthropic在Claude中嵌入文本水印是对写作的亵渎

Hacker News (AI)··ropbear·约 8 分钟阅读
社区热度 790
中文导读

Anthropic宣布为遵守欧盟法规,将在所有Claude模型生成的文本中嵌入语义水印,但该技术会微妙改变措辞选择,影响文本质量,引发对写作纯洁性的担忧。

作者:John Gruber使用Drata的智能体信任管理平台,更快地管理GRC本周我撰文提到,Anthropic宣布全球所有Claude模型将很快开始对其生成的所有内容(包括文本)添加“水印”,以遵守欧盟法规。

当时我们只能猜测其运作方式,因为Anthropic甚至没有提供模糊的描述——尽管公告标题荒谬且带有侮辱性地写着“Claude如何标记AI生成的内容”。我最初的猜测是,他们可能会在文本中隐藏不可见的非打印Unicode字符,但这只是随口一说。

事实证明,他们并非如此。他们要做的是应用一种隐写术,在推理时通过选择特定的词语(或其他token输出)留下指纹,这些指纹日后或许能被概率性检测出来。我最初猜测“隐形字符”,并非因为我没想到语义层面的词语选择技术,而是因为我太天真,轻信了Anthropic对其做法的描述。

他们最初的支持文档声称:当受支持的Claude模型生成文本时,它会将一种难以察觉的水印直接编织进文本本身。你看不到它,它也不会改变Claude回复的含义、质量或可读性。他们用了“难以察觉”和“不会改变含义、质量或可读性”这样的措辞。

这是他们的原话,而不是“几乎难以察觉”。

不是“略微改变含义、质量或可读性”。这对我来说是合理的,因为这正是我对我个人使用的任何工具所期望的——不,是要求的。一个工具为了在文本中嵌入隐藏线索以暗示其来源,而牺牲哪怕一丝的清晰度、连贯性、含义或质量,都是不可接受的。

这就是我所期望并会坚持要求的。而Anthropic(最初的)支持文档明确声称他们的系统将实现这一点。因此,如果这是真的,除了在文本中隐藏不可见字符之外,我看不出还有什么其他可能。我的错误在于相信了Anthropic,相信他们的系统不会篡改和破坏其模型生成文本的语义。

而事实上,这正是他们计划要做的。我竟然相信了一份题为“Claude如何标记AI生成内容”的文档中的任何一个字,而该文档根本没有解释Claude如何(或将如何)标记AI生成的内容,我真是该检查一下自己的脑子。

昨天,在另一个完全不同的网站上,Anthropic发布了“Claude的文本水印如何工作”,这篇文章确实用通俗易懂的语言解释了其工作原理。我将在下文回到Anthropic这篇高度委婉且略带误导性的新描述。

关于这个主题已有大量研究,其中一些我也在下方附上了链接。

但对该技术背后总体思路的最佳描述,是James Padolsey的一篇互动文章《AI文本水印如何工作》。这是一篇极具说服力的文章,互动元素精彩地阐释了核心概念,堪称A+之作。如果你对此有任何兴趣,我敢说,你务必阅读并动手体验Padolsey的这篇文章。

不过,让我尝试用外行能懂的语言做个高层次的总结。如果你抛一枚硬币N次并记录结果,你就能在一定程度上判断这枚硬币是公平的还是偏向的。LLM在其主流形态中是非确定性的。对同一个模型提出同样的问题,你往往会得到至少略有不同的答案。

也许含义相同,但措辞不同。在生成下一个token的每个决策点,模型都会做出选择。借助这些语义水印技术,模型会根据可称为“绿色”和“红色”的词语列表,对某些token做出不同的选择。在每个决策点,它们从绿色列表中选择词语的概率会略高于红色列表。

这并不意味着它们永远不会选择红色列表中的词语,只是与未采用这种掺假标记技术时相比,选择红色词语的可能性更低。(就像一枚偏向的51-49硬币,平均每100次仍会有49次落在“错误”的一面。)在每个“下一个token”生成点,词语或短语会被确定性地动态分入绿色和红色列表。

因此,某个特定词语有时会出现在绿色列表上,有时则会出现在红色列表上。拥有密钥的人可以确定在每个token生成点该词语会出现在哪个列表上(这正是水印检测的方式);而没有密钥的人则无法做到。这意味着永远不会存在一个Claude偏好或回避的固定词语列表。

以抛硬币为例,N越大——即抛的次数越多——你就越能确信硬币是公平的还是偏向的。语义水印也是如此。文本中的词语越多,分析结果就越准确,越能判断该文本是否由特定AI模型生成。如果抛硬币次数太少,你就无法对硬币的公平性建立任何信心。

同样,如果词语(或token)太少,就无法对一段文本是否由AI生成建立任何信心。

当检查一段文本是否带有特定水印系统的痕迹时,如果标记为绿色的词语多于预期,而标记为红色的词语少于预期,那么该文本就可以被标记为——在一定的置信度下——由应用该特定密钥水印系统的AI系统生成或仅修改过。

这种判断的置信度显然会因文本字符串的大小以及赋予绿色和红色列表词语的随机权重而有显著差异。

但只有Anthropic能够确定文本是否看似由Claude生成,而且Anthropic只能检测Claude所应用的水印。

Claude无法检测出例如Gemini生成的隐藏水印信号,Gemini也无法检测出Claude创建的隐藏水印信号,因为每种实现都依赖于仅由LLM提供商持有的密钥。我对此的一个根本性问题是:没有任何两个同义词具有完全相同的含义。

“He leaped at the chance”和“He jumped at the opportunity”是非常相似的句子,表达了相同的大致情绪,但它们并不相同。我们在写作时选择的精确词语至关重要。

我希望我使用的任何LLM都能在每个决策点选择最好、最精确的词语。我接受的一个明显约束是时间和算力。在快速执行推理、且每个token有一定成本的约束下,我想要最好的词语。这个约束与人类写作相符。

如果花更长时间写作,我肯定能写出更好的专栏。我写作时会意识到,我需要对每一个词语和标点选择投入多少心思。当我的直觉告诉我应该时,我会在某些段落、句子甚至个别词语选择上花更多时间。换句话说,这些都是必要的权衡。

这些因素都符合我的利益:速度、成本、质量。理想情况下,我希望以零成本、瞬时生成速度获得完美的写作。

但这些都不可能实现。算力并非免费(使用领先模型进行基于云的LLM推理实际上很昂贵)。推理并非瞬时完成。而伟大的写作,无论是自然的还是人工的,都只能接近完美。认为除了我的需求之外,任何其他因素都应影响为我生成的文本,这显然是一种冒犯。

这不仅仅关乎那些可能意图冒充自己原创作品的文本,甚至也不仅仅是LLM对手写稿的校对。Anthropic声称,所有新的Claude模型都将在每一段超过一定长度的文本中掺入水印。

原文出处
Anthropic's 'Watermark' Text Adulteration in Claude Is a Perversion of Writing

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读