返回全部文章
GEO 与内容

AI 爬虫与 robots.txt:放行还是屏蔽

AI 爬虫正在改变流量的入口。怎么对待 GPTBot、ClaudeBot、PerplexityBot,是内容网站的新选择题。

2026-06-223 分钟阅读robots.txtAI 爬虫GEO

AI 爬虫和搜索引擎爬虫不一样

搜索引擎爬虫把内容抓去建索引,用户通过搜索进入你的网站。AI 爬虫把内容抓去回答问题,用户可能永远不点进你的页面,但你的内容成了答案的一部分。

这让「被引用」成为新的流量和品牌指标。

主流 AI 爬虫

GPTBot(OpenAI)、OAI-SearchBot(ChatGPT 搜索)、ClaudeBot(Anthropic)、PerplexityBot、Google-Extended(AI 训练与生成)、Bingbot 等。它们在 robots.txt 里用各自的 User-agent 声明。

不同爬虫用途不同:有的用于搜索回答,有的用于模型训练,可以分别决策。

  • GPTBot:OpenAI 网页爬虫
  • OAI-SearchBot:ChatGPT 搜索
  • ClaudeBot:Anthropic 爬虫
  • PerplexityBot:Perplexity 搜索
  • Google-Extended:Google AI 相关用途

放行还是屏蔽

如果你的网站希望被 AI 搜索引用,放行搜索类爬虫。如果担心内容被无授权使用,可以屏蔽训练类爬虫,或用站点条款明确使用边界。

屏蔽前想清楚:你的内容是否已经通过其他渠道被 AI 获取?屏蔽 robots 并不能阻止所有抓取,只是表达意图。

和 llms.txt 配合

robots.txt 负责通行,llms.txt 负责导览。放行 AI 爬虫的站点,应该同时提供结构化摘要,让 AI 用最低成本理解你的站点。

AI 时代的内容可见性,是策略问题,不是技术问题。

建立自己的抓取日志

服务器日志里可以看到 GPTBot、ClaudeBot、PerplexityBot 是否真的来过、抓了哪些页面。定期查看,能发现内容是否被遗漏、目录是否被爬虫访问。

抓取日志和 llms.txt 配合,等于给 AI 访问做一次体检。

常见的 robots 配置误区

第一个误区是只屏蔽了部分 AI 爬虫,漏掉新增的 User-agent。第二个误区是屏蔽目录过于宽泛,把内容页也挡住了。第三个误区是写完 robots 从不复查,站点结构调整后规则早已过时。

建议每半年审一次 robots.txt,并在改动后检查爬虫日志确认生效。

配置策略的关键不是「放行还是屏蔽」的一刀切,而是按爬虫用途分别决策。

AI 爬虫的带宽成本

高频抓取会带来带宽和服务器压力,尤其大型站点。可以通过缓存、限速和内容分发网络缓解,而不是简单屏蔽所有爬虫。

观察抓取日志里的频率:正常爬虫有礼貌地限速,异常高频的抓取才需要单独处理。

成本可控时,开放给 AI 带来的曝光价值通常高于带宽成本。

参考资料

NEXT

有类似的项目想法?

从一次免费的想法梳理开始,把 AI 想法变成可验证、可上线的产品。

预约沟通看看作品
KEEP READING

继续阅读

2026-07-06GEO 与内容

llms.txt 是什么,为什么你的网站需要它

llms.txt 是给 AI 看的站点地图:用一段结构化文本告诉大模型你的网站有什么、重点是什么。

阅读全文
2026-06-29GEO 与内容

让 AI 引用你的网站:可引用内容写作法

AI 不会引用含糊的营销话术。它引用的,是清晰、独立、有依据的段落。

阅读全文
2026-06-15GEO 与内容

面向 AI 搜索的内容策略:从关键词到问题

AI 搜索在回答问题,而不是匹配关键词。内容策略要围绕问题组织,而不是围绕词密度组织。

阅读全文