返回文章列表
行业动态

Cloudflare把AI爬虫分成三类:网站主将获得更细粒度控制

阅读约 3 分钟

导语

Cloudflare正在重新定义网站如何面对AI时代的自动化访问。过去一年,围绕AI爬虫的争论主要集中在“是否允许拿内容训练模型”。但随着搜索引擎变成答案引擎、AI代理开始替用户浏览网页,简单的“允许或封禁AI机器人”已经不够用了。

Cloudflare最新提出的方案,是把AI相关流量按用途拆成三类:Search、Agent和Training,并给网站主提供对应的管理选项。

核心要点

  • Search(搜索):指抓取或索引网站内容,以便未来回答查询。Cloudflare认为,这类行为通常应带来推荐流量或其他公平回报。
  • Agent(代理):指自动化程序代表用户实时完成任务,例如聊天产品的网页抓取机器人,或由AI驱动浏览器执行操作的代理。
  • Training(训练):指爬取内容用于训练或微调模型,关键特征是数据被吸收到模型能力之中。

这套分类的重点,不再是争论某个机器人“是不是AI”,而是追问它在网站上做什么、保存了什么、未来会如何重新分发内容。

Cloudflare还强调,拥有多重目的的爬虫不应只被标为一种用途。如果同一公司用自动化系统同时做搜索索引、用户代理和模型训练,Cloudflare希望它们拆分为不同爬虫,以便网站主能看清访问目的并分别授权。

新默认规则的含义

从素材披露的信息看,Cloudflare计划在2026年9月15日为新接入Cloudflare的域名设置新默认值:在展示广告的页面上,Training和Agent类别将默认被阻止,Search默认允许。其逻辑是,广告页面本身暗示网站主希望真人访问并产生可变现注意力,而训练和代理访问可能绕过或削弱这种注意力。

更值得关注的是,多用途爬虫也会按全部行为接受判断。也就是说,如果某个爬虫同时承担搜索和训练用途,而网站主选择阻止训练,那么该爬虫也可能因训练属性被拦截。素材中特别提到,Googlebot、Applebot和BingBot这类多用途爬虫会受到这一逻辑影响。不过,Cloudflare也表示客户可以在安全设置中选择不接受这些默认变更。

意义与影响

这次调整的核心,不只是多了几个开关,而是把内容生态的矛盾进一步制度化:搜索曾经以“抓取换流量”维持平衡,但AI答案和代理操作可能让用户不再访问原站点。对小网站而言,完全封禁可能失去被发现的机会;完全开放又可能让内容被吸收却没有回报。

Cloudflare的方案试图在两端之间建立中间层:让网站主区分“帮我带来访客的索引”“替用户即时办事的代理”和“拿走内容训练模型的爬虫”。这未必能直接解决补偿问题,但会提高透明度,并迫使大型平台更清楚地说明自己的爬虫用途。

同时,Cloudflare还面向企业客户推出BotBase,用于查看已知机器人和代理的数据库。短期看,这是可视化工具;长期看,它可能成为网站自动化访问控制的管理面板。

AI流量管理正在从单一封禁走向更细的协议化治理。对内容网站、搜索平台和AI代理公司来说,未来的关键问题将不只是“能不能抓”,而是“以什么身份抓、为谁抓、抓完之后如何回馈”。

来源:Hacker News

评论

正在确认登录状态……

正在加载评论……

相关文章