Content-Signal 是在传统 robots.txt 的 Allow/Disallow 规则之外新增的一种声明方式,格式类似 Content-Signal: search=yes, ai-input=yes, ai-train=yes,可以针对“搜索收录”“AI 实时问答引用”“AI 模型训练”这三种不同用途分别表态,而不是像以前那样只能笼统地允许或拒绝某个爬虫。
为什么要拆开声明
一个网站可能希望内容被搜索引擎收录、也希望被 AI 实时引用来获得曝光,但不希望自己的内容被直接拿去训练模型(担心内容被无限复制而不产生引流)。以前的 robots.txt 只能整体允许或拒绝某个爬虫,没法表达这种细粒度的意愿,Content-Signal 补上了这个空白。
常见的一个坑
不少托管平台会提供“托管 robots.txt”这类便捷功能,一旦开启,平台可能会自动帮你写入“内容不用于 AI 训练”的声明,这和主动追求 AI 曝光的策略是矛盾的。如果网站的目标是最大化 AI 可见度,需要确认这类自动生成的声明有没有悄悄覆盖了自己原本的意愿。