首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

在搜索中保持可发现性,同时禁止人工智能训练

2026-09-16 1 阅读 约5分钟阅读 djfergus
分享:
字号:
如果没有适当的控制,网站所有者长期以来一直面临着艰难的权衡:允许您的内容用于人工智能培训,或者冒着失去搜索可发现性的风险。这种权衡的存在是因为互联网上一些最大的组织使用混合用途的爬虫:一个爬虫同时服务于搜索和人工智能训练。拒绝其中一个,也就拒绝了另一个。今天,Cloudflare 宣布推出新的“禁止 AI 训练”设置,让您可以轻松保持搜索索引,同时拒绝让同一个爬虫训练您的内容。 Apple、Google 和 Microsoft 兑现或已承诺(在指定时间范围内)兑现此设置。混合用途爬行器是训练问题的难点。接下来是人工智能摘要。网站范围内的“是”或“否”过于生硬:摘要中出现的内容数量与是否出现一样重要。选择退出人工智能摘要已经是我们为混合用途爬虫操作员设定的要求之一。到明年初,我们的目标是让您控制包含的内容量 - 在 Cloudflare 上设置一次,而不是分别由每个运营商设置。为什么仅仅询问还不够 大多数网站所有者都希望被人类、代理和(好的)机器人找到。但开放互联网的很大一部分是通过广告、订阅或与访问者的直接关系来资助的,而这些模式只有在有人真正到达时才付费。几乎每个网站所有者都认为搜索有益:不到 1% 的 Cloudflare 网站选择阻止搜索机器人。然而,培训却是另一回事:17% 的站点选择启用某种机制来阻止培训。这正是我们认为网站所有者需要更精细的控制,而不是一刀切的“区块人工智能”的原因。仅靠 robots.txt 指令无法解决此问题。任何人都可以发布一个爬虫,但它无法识别谁在爬行,确定他们为什么爬行,也无法阻止忽略它的爬虫。然而,网络可以解决这个问题:我们发布偏好,识别谁在爬行,对他们爬行的原因进行分类,并阻止那些忽略它的人 - 然后报告每个操作员在 Radar 上实际做了什么。但阻止会删除爬虫。它不会改变爬虫的行为方式。更好的结果是运营商根本不让你选择。因此,自七月以来,我们一直在直接与他们交谈。反应令人鼓舞:几乎所有人都同意网站所有者应该对其内容的使用方式拥有控制权和透明度,并保证他们的选择将受到尊重。为了帮助网站所有者理解这一点,我们创建了一个名称:负责。负责任的称号既认可了当今可用的能力,也认可了交付这些能力的具体承诺。要获得资格,机器人操作员必须满足或承诺满足以下要求: 网站所有者可以通过 robots.txt 或类似标准选择退出 AI 培训的机制。网站所有者可以直接选择退出由运营商设置的 AI 摘要的机制,明年将通过 Cloudflare 选择退出(更多详细信息,请参阅下文)。 URL 级别的可见性可了解哪些页面可用于训练,以及显示内容在搜索中如何显示的指标。确保选择退出人工智能培训不会影响传统搜索结果。苹果、谷歌和微软都证明他们符合负责任的资格。每一个都结合了当今可用的功能和仍在开发中的有时限的承诺。下面分享了这些公司的爬虫程序的详细信息。新的安全设置选项 Cloudflare 按行为对机器人进行分类,单个机器人可以表现出多种行为。三种行为可用作控件: 搜索 - 爬行以构建搜索索引。训练 - 爬行以训练或微调模型。代理 - 代表人类访问页面的用户控制代理,例如聊天获取机器人和浏览器使用代理。混合用途爬虫是同时执行搜索和训练的单个爬虫。如果没有控制,这种组合就会产生上述的权衡:网站所有者不能在不拒绝另一种用途的情况下拒绝一种用途。为了避免阻止负责任的混合用途爬虫(那些不会强迫网站所有者进行权衡的爬虫),我们引入了一个新设置:禁止人工智能训练。 Disallow AI Training 因其在 robots.txt 中发布的 Disallow: 指令而命名。 “阻止”设置现在意味着不同的内容 阻止和“阻止带有广告的页面”以前不适用于混合用途爬虫,因为阻止它们也可能影响搜索可发现性。现在我们有了新的“禁止人工智能训练”设置,“阻止”和“阻止带有广告的页面”适用于所有训练爬虫,包括混合用途爬虫。训练、搜索和代理控制应用于域级别。添加“禁止 AI 训练”后,可用设置为: 允许:允许所有爬网程序,除非被其他设置或 WAF 规则阻止。禁止 AI 训练:Bot Preference Sync 发布 ap
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱