返回文章列表
行业动态

Cloudflare 将 AI 爬虫管控拆成搜索、智能体与训练三类

阅读约 3 分钟

导语

Cloudflare 宣布重构 AI 爬虫管控体系:过去用于“拦截所有 AI 机器人”的单一开关,被拆分为 Search、Agent、Training 三个独立类别。根据现有信息,这项能力面向包括免费版在内的全部客户开放,网站所有者可以按不同用途分别配置访问策略。

这不是一次简单的后台选项调整。随着生成式 AI 搜索、智能体浏览网页、模型训练数据抓取同时出现,网站面对的“AI 爬虫”已经不再是同一种流量。Cloudflare 的新分类,本质上是在承认一个现实:AI 访问网页的目的正在分化,治理方式也必须分层。

核心要点

  • Search:面向搜索与索引
    Search 类爬虫主要用于索引网页内容,并在用户查询时帮助生成搜索结果或答案。对许多网站来说,这类流量可能带来曝光,也可能引发“答案被平台直接呈现、原站点击减少”的担忧。因此,是否允许搜索类 AI 抓取,需要比过去更细的判断。

  • Agent:面向智能体访问
    Agent 类更接近代表用户执行任务的访问方式,例如 AI 助手根据用户请求读取网页、完成比对或辅助操作。它与传统搜索爬虫不同,访问行为可能更即时、更任务化,也更容易与真实用户需求绑定。

  • Training:面向模型训练
    Training 类则指向用于训练或改进模型的数据抓取。这通常是争议最大的部分,因为内容一旦进入训练流程,网站很难追踪后续使用路径。将其单独列出,有助于网站明确表达是否允许内容被用于模型训练。

意义与影响

过去的一键拦截足够简单,却不够精确。它把搜索索引、智能体代理访问和训练数据抓取都放进同一个篮子里,结果往往是网站只能在“全放行”和“全拒绝”之间选择。Cloudflare 的三段式分类,为网站提供了更贴近真实需求的中间地带:可以允许搜索索引,但拒绝训练抓取;也可以限制训练用途,同时保留某些面向用户请求的智能体访问。

这对内容网站尤其重要。媒体、论坛、博客和知识库并不一定反对所有 AI 流量,它们真正关心的是流量来源、内容使用方式以及价值回流是否合理。更细的控制项至少让站点能够把不同诉求拆开处理,而不是被迫采取极端策略。

对 AI 公司而言,这也意味着“AI 爬虫”这个笼统标签将越来越难以自证合理。未来,爬虫的用途、身份和遵循的规则可能需要更清晰地暴露给网站基础设施层。谁是搜索,谁是智能体,谁在训练模型,将成为网站能否接受访问的重要前提。

总体来看,Cloudflare 的调整并没有直接解决 AI 内容使用中的所有争议,但它提供了一个更实用的治理框架:先把不同类型的 AI 访问分清楚,再让网站所有者做选择。随着 AI 搜索和智能体产品继续扩张,这类基础设施级别的分类,可能会成为内容生态重新谈判规则的起点。

来源:OSChina

评论

正在确认登录状态……

正在加载评论……

相关文章