Cloudflare 推出新工具:平衡搜索引擎收录与 AI 训练拒绝

2026/09/16 11:01阅读量 2

Cloudflare 发布了一项新功能,旨在帮助网站所有者在允许搜索引擎抓取内容的同时,明确拒绝人工智能模型进行数据训练。该功能通过扩展 robots.txt 标准,为网站提供了更精细的控制权,以应对生成式 AI 对网络数据的广泛抓取需求。此举反映了互联网基础设施提供商在保护内容创作者权益方面的最新尝试。

事件概述

Cloudflare 宣布推出一项新功能,允许网站管理员在保持网站对搜索引擎可见的同时,阻止人工智能(AI)模型抓取其内容进行训练。这一举措旨在解决日益增长的关于 AI 公司未经授权使用受版权保护数据的争议。

核心信息

  • 技术实现:该功能基于 robots.txt 标准的扩展。网站所有者可以通过添加特定的指令(如 User-agent: * 配合针对 AI 的排除规则),向 AI 爬虫发送“禁止抓取”的信号,而无需影响传统搜索引擎蜘蛛的访问权限。
  • 控制粒度:用户可以选择性地屏蔽特定的 AI 模型或所有未授权的 AI 训练活动,同时确保 Google、Bing 等主流搜索引擎仍能正常索引网站页面。
  • 背景动因:随着大型语言模型(LLM)对高质量网络数据需求的激增,许多出版商和内容创作者担心其作品被无偿用于训练商业 AI 产品。Cloudflare 的这一工具为中小网站提供了一种低门槛的技术解决方案。

值得关注

  • 行业影响:如果该功能被广泛采用,可能会改变当前 AI 训练数据的获取格局,迫使 AI 公司寻求更合规的数据授权途径。
  • 用户操作:网站管理员只需在 Cloudflare 控制面板中配置相应的 robots.txt 规则即可启用此功能,无需修改网站源代码。
  • 局限性:目前该功能主要依赖 AI 公司的自愿遵守。尽管提供了技术层面的拒绝机制,但无法强制阻止那些不尊重 robots.txt 协议的恶意爬虫。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。