对内容站点来说,过去十年只需要回答一个问题:要不要被搜索引擎收录。现在这个问题裂成了两个——要不要被搜索引擎收录,以及要不要被 AI 拿去训练。
发生了什么
Hacker News 上出现了一则题为「Stay discoverable in search while disallowing AI training」的讨论,核心议题是:网站能否在保持搜索引擎可见性的同时,拒绝 AI 训练爬虫的抓取。这类讨论之所以反复出现,是因为传统的 robots.txt 协议正在被拆成两套语义:一套面向搜索索引,一套面向模型训练。
为什么重要
搜索引擎爬虫和 AI 训练爬虫在技术行为上高度相似——都是大规模抓取网页、建立索引、存储内容。区别在于用途:前者把用户导向原站,后者把内容吸收进模型权重,原站不再获得访问。对依赖搜索流量的站点而言,这两件事的收益结构完全不同。
于是出现了新的中间态需求:允许被索引,不允许被训练。robots.txt 本身并不区分「抓取用于索引」和「抓取用于训练」,它只表达允许或拒绝抓取。行业随后出现了若干补充机制,例如针对特定 AI 爬虫的 user-agent 规则、内容许可协议,以及让发布方声明内容使用边界的标准化尝试。这些机制的共同问题是:它们依赖抓取方自愿遵守,缺乏强制力。
从更长的脉络看,这是内容方与平台之间议价能力的又一次再平衡。早期是搜索引擎与新闻媒体的收录之争,后来是社交平台与内容创作者的流量分配,现在是模型厂商与全网内容之间的训练授权。每一次,技术协议都先于法律和商业模式出现。
影响与看点
对开发者和小型站点运营者,最直接的影响是运维复杂度上升:需要维护更细粒度的爬虫规则,区分搜索、AI 训练、AI 检索等不同用途的抓取方,并持续跟进新出现的 user-agent。规则写错,可能同时损失搜索流量和内容控制权。
对内容平台和媒体,这是一个可以转化为商业条款的抓手。把「可被搜索」和「可被训练」拆开定价,正在从技术配置演变为授权谈判的一部分。
对模型厂商,抓取合规性会逐渐成为可被审计的指标。当越来越多的站点明确表达拒绝,训练数据的来源结构会被迫调整,公开网页数据的边际收益下降。
值得关注的是,这类讨论目前仍停留在「如何配置」的层面,而不是「如何执行」。在缺乏统一强制标准的情况下,网站能做的更多是表态而非拦截。判断是:真正改变格局的不会是又一个 robots 扩展,而是当足够多的优质内容源集体选择退出训练抓取时,模型厂商的合规成本才会实质上升。



