EN
AI 架构与应用

Cloudflare眼中的AI爬虫拐点:开放Web正在重写访问合同

Cloudflare称AI爬虫正在改写开放Web:重复抓取要转向更新信号,匿名访问要转向身份、授权与支付。本文拆解HTTP 402、Web Bot Auth及内容网站的应对。

Jacky Wang 5 分钟阅读 13 阅读

AI正在改变互联网的“访客”构成:越来越多请求不再来自会点击广告、订阅邮件或购买商品的人,而是来自搜索机器人、模型爬虫和可自主调用工具的Agent。Cloudflare在2026年9月27日发布的年度创始人信中给出一个值得网站经营者重视的判断:Agent和AI爬虫让Web重新增长的拐点提前到了2026年5月。

这并不意味着“AI自动让开放网络繁荣”。相反,旧有交换关系正在失效:网站承担内容生产与服务器成本,机器高频读取内容,却未必带回访问、品牌认知或收入。Cloudflare提出的方向,是把开放网络改造成一个能够识别访问者、减少重复抓取,并允许内容方设定访问条件的系统。

真正变化的不是流量,而是访问者

搜索引擎时代的默认交易很直观:站点允许索引,搜索引擎带回人类访问者;内容方再通过广告、订阅或交易转化获得回报。AI回答引擎和Agent打破了这条路径。机器可以读取网页、提取答案,并在另一个界面完成用户任务,原站点可能只得到一次抓取请求。

Cloudflare在创始人信中称,其数据表明,合规机器人抓取的内容中,超过一半相较上次访问并没有变化。这个比例属于Cloudflare对自身网络的观察,不能直接外推到整个互联网,但它揭示了一个明确的工程问题:大量计算、带宽和源站请求被消耗在“确认没有更新”上。

从反复爬取转向更新信号

如果机器访问成为常态,网站就不应只提供面向浏览器的HTML页面。更高效的方式是让站点主动表达内容是否更新、允许什么用途,以及机器应通过什么接口读取。

Cloudflare在8月发布的Agentic Internet构想中,把未来网络概括为四种能力:可读取、可发现、可调用、可支付。它描述的不是某一个按钮,而是一组基础设施:结构化索引帮助Agent发现内容,更新信号减少无效回源,Web Bot Auth让机器人以密码学方式证明身份,MCP或API则把网页背后的能力变成可调用服务。

对开发者来说,这更像从“页面抓取”迁移到“事件订阅”。抓取方不需要定时重读全部网页,而是在内容变化后获取差异或更新通知;发布方也能保留版本、用途和访问策略。Cloudflare称正在让爬虫只获取变化的内容,但最新创始人信尚未披露完整的开放范围和上线时间,因此现阶段应把它视为产品方向,而不是已经普及的Web标准。

HTTP 402为什么又被重新讨论?

机器能够识别“是否更新”只解决成本问题,没有解决价值分配。Cloudflare此前推出的Pay Per Crawl私测尝试启用长期闲置的HTTP 402 Payment Required:内容方可以对特定爬虫选择允许、收费或阻止;爬虫通过HTTP Message Signatures证明身份,并在请求头中表达可接受价格。

这种设计的关键不是把每篇网页都做成传统付费墙,而是让机器能够理解交易条件。人类浏览时看到“订阅后阅读”,Agent访问时则需要结构化响应:资源价格是多少、接受哪种支付方式、凭什么确认调用方,以及支付后可以执行什么操作。

Cloudflare今年7月进一步介绍了从“按抓取付费”走向按实际使用付费的实验。逻辑很合理:一次抓取可能被引用数千次,也可能完全没有产生答案,单纯按请求次数计价并不等于按价值计价。但这些仍是实验和基础设施建设,不能据此推断发布者已经获得稳定收入。

内容网站现在可以做什么?

先把抓取、训练和搜索区分开

同一个机器人可能用于训练、检索、生成答案或代表用户执行任务。站点策略不应只有“全部允许”和“全部禁止”。至少应记录User-Agent、访问路径、频率、缓存命中和来源,并将搜索可发现性与模型训练授权分别管理。

给原创内容稳定的机器入口

清晰的canonical、结构化数据、RSS、站点地图和可预测的URL,既服务传统搜索,也降低Agent理解内容的成本。技术站点还可以提供版本化文档、变更日志和API,而不是迫使机器从视觉页面猜测结构。对WordPress站点而言,持续维护分类、内部链接和来源说明,比追逐一个新的“AI SEO标签”更可靠。

不要过早把“可收费”当成商业模式

HTTP 402、x402或Pay Per Use解决的是结算接口,不会自动创造内容需求。真正需要验证的是:哪些内容具有不可替代性、Agent为何愿意付费、许可覆盖哪些用途,以及一篇内容被多次引用后如何归因。没有这些答案,收费开关可能只会减少可发现性。

对AI产品团队的反向要求

开放网络能否持续,也取决于Agent开发者是否减少无意义抓取。产品团队可以优先支持ETag、Last-Modified、缓存和增量更新;保存来源URL与抓取时间;在答案中保留可访问的引用;并对付费、禁止训练或限定用途的信号做出一致响应。

身份验证同样重要。仅靠User-Agent字符串很容易伪装,密码学签名能让站点把规则绑定到已知机器人运营方。它不能消灭恶意爬虫,却能让愿意守规则的参与者建立更精细的访问关系。

开放Web的下一份合同

Cloudflare的创始人信给出的不是已经完成的答案,而是一份路线图:机器访问需要从匿名、重复、无回报的抓取,转向可识别、可增量、可授权并可能付费的交互。

这条路线仍有巨大不确定性。Cloudflare看到的是自身网络样本,新的支付协议需要爬虫和发布者共同采用,内容价值也很难由一次HTTP请求衡量。但对网站经营者而言,现在已经可以做一件确定的事:把内容、权限、更新信号和归因设计成产品的一部分,而不是等到AI流量完全取代人类点击后才补救。

主要来源

说明:本文截至2026年9月28日。Cloudflare在最新创始人信中预告的部分能力尚未公布完整可用范围、价格与上线时间;本文讨论产品与基础设施趋势,不代表商业收益承诺。

发表评论