AI 见闻
精选· 重要性 4/5

Claude 私密聊天记录被谷歌和必应搜索索引暴露

Wired — AI··Maddy Varner·约 4 分钟阅读
中文导读

Anthropic 的 Claude 聊天机器人共享对话因缺少“noindex”标签被搜索引擎索引,导致用户隐私泄露,暴露了 AI 聊天记录在搜索引擎中的可见性风险。

你和 AI 聊天机器人之间的事,并不总是只停留在你们之间。问问谷歌就知道了。上周末,人们惊讶地发现,一些 Anthropic Claude 的聊天记录可以通过网络搜索轻松找到。

这个问题似乎最早由一位 Reddit 用户指出,暴露的聊天内容包括人们询问应该加入哪个政党、堪萨斯州的律师在认为自己违反道德规范时是否需要自我报告,以及色情角色扮演。Claude 允许用户通过创建特定聊天线程的公开 URL 与他人分享聊天的“快照”。

这些 URL 被主流搜索引擎索引的原因,归根结底在于网站和搜索引擎的基本功能,以及生成式 AI 介入时两者之间的碰撞。基本上,Anthropic 通过 robots.txt 文件指示 Google 和 Bing 等搜索引擎使用的网络爬虫不要索引用户决定分享的聊天记录。

根据 Wayback Machine 的快照,至少从 2025 年 9 月起,Anthropic 的 robots.txt 就已将“共享”聊天设置为爬虫禁区。但防止页面被纳入搜索引擎结果,比想象中要困难。

在撰写本文时,如果你在 Bing 上搜索“site:claude.ai/share”,仍会显示“约 612 条结果”。Bing 在其技术文档中表示,开发者可以使用 robots.txt 阻止搜索引擎的网络爬虫,但网页开发者还应在各个页面上添加“noindex”标签。

Reddit 帖子中指出的搜索结果中出现的部分聊天记录,在 WIRED 查看时已被删除,而在 Google 上搜索那个在 Bing 上仍然有效的“share”查询时,结果已不再显示。

在开发者指南中,Google 表示,如果页面从互联网其他地方被链接,且页面所有者没有在页面上添加特殊的“noindex”HTML 标签或在页面响应头中添加“x-robots-tag”,那么 Google 会忽略 robots.txt 指令。

WIRED 查看了部分被暴露的 Claude 聊天页面样本,发现它们没有包含 Bing 和 Google 都表示在决定是否索引页面时会考虑的“noindex”标签。微软(Bing 的所有者)在发布前未予置评。

Anthropic 未回应多次置评请求。Google 发言人 Ned Adriance 告诉 WIRED,共享 Claude 聊天的索引是 Anthropic 的责任。

“谷歌或任何其他搜索引擎都无法控制哪些页面在网络上公开,这些页面已在多个搜索引擎中被索引,”Adriance 说。

“我们为网站所有者提供明确的控制权,让他们决定页面是否可以被抓取或索引,并且我们始终尊重这些指令。”Anthropic 没有回应关于为何不在共享聊天页面上添加“noindex”标签的问题。

去年 9 月,Anthropic 就因同样的问题受到批评,当时它告诉 Forbes,它使用 robots.txt 让爬虫知道不应访问共享聊天。但正如 Forbes 报告指出的,这并不能保证阻止搜索引擎索引特定网页。

即使 robots.txt 并不总能阻止页面被搜索引擎索引,AI 实验室仍将其用于其他目的。许多实验室向创作者承诺,只要开发者确保在其 robots.txt 文件中“禁止”某些爬虫,他们的网站就不会被用作 AI 训练素材,而实验室本身也遵循这一建议。

Anthropic、Meta 和 OpenAI 都在其聊天机器人的 robots.txt 文件中加入了指令,“禁止”竞争对手的网络爬虫访问聊天机器人托管的网站的任何部分。OpenAI 和 Meta 未回应关于此做法的评论请求。

Google 没有回应 WIRED 关于其竞争对手正在阻止其 AI 训练爬虫 Google-Extended 访问其聊天机器人网站的问题。

尽管共享聊天不再出现在 Google 搜索结果中,但 WIRED 审查的页面仍然没有“noindex”标签,这意味着它们可能再次出现在搜索引擎中。Claude 用户可以前往“设置”>“隐私”>“共享聊天”来管理访问权限,并保持他们的秘密对话私密。

Andrew Couts 补充报道。

原文出处
Private Claude Chats Exposed in Google and Bing Search Results

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读