当 AI 爬虫把整个互联网当作免费语料库,谁还愿意继续生产内容?这是 The Verge 最新一期播客抛给 Cloudflare CEO Matthew Prince 的问题。

发生了什么

The Verge 的 Decoder 栏目邀请 Cloudflare CEO Matthew Prince 对话,主题是「能否把网络从 AI 手中救回来」。这期节目属于「商业的未来」两集系列。Prince 上一次做客是在大约两年半前,当时外界认为互联网正处在一个剧烈的转折点上;如今这个转折点的性质已经改变——从平台与内容的博弈,变成了 AI 与整个开放网络的关系。

需要说明的是,目前公开的只有节目摘要,具体论点尚未展开。因此本文不做具体引述,只讨论这一议题本身的背景与分量。

为什么重要

Cloudflare 的位置很特殊。它处在网站与访客之间,既提供 CDN 与安全防护,也长期承担反爬虫、反 DDoS 的角色。这意味着当 AI 公司大规模抓取网页用于训练时,Cloudflare 在技术上有能力识别、限流甚至阻断这些流量。换句话说,Prince 不只是一个评论者,他手里握着实际的基础设施杠杆。

这背后的结构性矛盾在于:过去二十年,开放网络默认「可被搜索引擎抓取」是划算的交易——网站让出内容索引权,换来搜索流量和广告收入。生成式 AI 改变了等式的一端:内容仍被拿走,但用户不再需要点击回源站,流量与收益的回路被切断。新闻出版商、独立博客、论坛的处境尤其明显。

于是出现了一批尝试:内容授权协议、robots.txt 的语义扩展、按抓取付费的设想,以及围绕「AI 爬虫是否应被默认允许」的行业争论。Cloudflare 是这些讨论中最有执行力的玩家之一,因为它能把这些规则直接落到网络层。

影响与看点

对开发者而言,最值得关注的是默认值的走向。如果主流基础设施开始把 AI 抓取视为需要显式授权、甚至需要付费的行为,那么数据获取的成本结构、爬虫的合规设计、以及依赖公开语料的小型模型团队都会受到直接影响。反过来,如果放任抓取,内容供给端的萎缩会进一步污染训练数据的质量。

对普通用户来说,这件事的体感是间接的:搜索结果的质量、独立站点的存活率、以及未来是否会出现更多「登录才能看」的围墙。

一个独立判断:真正的问题不是 Cloudflare 能否拦住爬虫,而是「授权」这件事在技术上可执行、在商业上却难以定价。基础设施能提供开关,但开不出一个各方都接受的价格。Prince 的这场对话,价值可能不在于给出答案,而在于把「谁来为开放网络续费」这个问题摆到台面上。