← 内容与信源

问题解答 / 方法实操

AI 爬虫有哪些?robots.txt 该怎么设置

快速答案

AI 公司的爬虫按用途分三类:训练数据采集、AI 搜索抓取、用户在对话里让 AI 读取某个网页。三类可以分开放行或屏蔽。想在 AI 回答里被找到、被引用,至少要放行「搜索抓取」和「用户触发读取」两类;是否允许训练用途,是另一个独立的决定。屏蔽前先查清你的网站今天实际被哪些爬虫访问过。

详细说明

三类 AI 爬虫

用途 做什么 常见官方身份(User-Agent)
训练采集 采集公开网页,用于模型训练 GPTBot(OpenAI)、ClaudeBot(Anthropic)、KimiBot(月之暗面)、CCBot(Common Crawl)
AI 搜索抓取 为 AI 搜索或联网回答建立索引 OAI-SearchBot(OpenAI)、Claude-SearchBot(Anthropic)、PerplexityBot、Kimi-SearchBot
用户触发读取 用户在对话里让 AI 打开某个链接 ChatGPT-User、Claude-User、Perplexity-User、Kimi-User

以上身份以各公司公开的爬虫说明为准,部分公司同时公布了官方 IP 段,可以用来核实请求是否真的来自该公司。

还有两类常被混淆的名字:

  • Google-Extended、Applebot-Extended 不是独立的爬虫,而是写在 robots.txt 里的策略标记,用来声明内容能否用于这两家的 AI 训练,不影响普通搜索收录。
  • Bytespider 是字节跳动的爬虫。它来访不等于豆包正在引用你的页面,两者不能直接划等号。

国内模型的爬虫

截至发稿,Kimi 公开了三个爬虫身份(KimiBot、Kimi-SearchBot、Kimi-User)以及对应的 IP 清单。DeepSeek、通义千问等平台没有公开独立的专属爬虫身份。它们的联网回答通常依赖搜索引擎或平台自己的检索能力,不能凭某个爬虫名字推断「DeepSeek 来过」。百度(Baiduspider)、360、华为 Petal 等是搜索引擎爬虫,同样不能对应到某个具体的 AI 产品。

robots.txt 怎么写

先决定三件事:是否允许训练、是否允许 AI 搜索抓取、是否允许用户触发读取。一个「允许 AI 搜索与读取、不允许训练」的写法示例:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Google-Extended
Disallow: /

注意:

  1. 同一个爬虫只匹配最具体的那一组规则,别在两处写互相矛盾的规则。
  2. robots.txt 是公开声明,不是访问控制。守规矩的爬虫会遵守,伪装身份的请求不会。
  3. 私有页面、后台、报告链接不要依赖 robots.txt 保护,应该用登录和权限控制。

屏蔽会不会影响推荐

会有影响,但要分开看:

  • 屏蔽搜索抓取和用户触发读取:AI 联网回答时更难读到你的官网,引用来源会更多来自第三方页面,你对自己的描述失去主动权。
  • 屏蔽训练采集:影响的是未来模型版本的「记忆」,对当下的联网回答影响较小。

没有哪一种设置能保证被推荐。robots.txt 只决定「能不能读到」,被读到之后是否被采用,还取决于内容本身是否清楚、可信、与问题相关。

怎么知道 AI 爬虫来过没有

  1. 看服务器访问日志:按 User-Agent 过滤上表中的身份。
  2. 核实 IP:User-Agent 可以伪造,OpenAI、Anthropic、Perplexity、Kimi 公布了官方 IP 清单,匹配上的才算可信。
  3. 区分「返回成功」和「被使用」:日志里一条成功的 GET 只说明页面被读取过,不说明被收录、被训练或被引用。

用了 Cloudflare 等防护服务

很多 CDN 和防火墙默认会拦截或挑战 AI 爬虫。如果你希望被 AI 搜索读到,需要在防护设置里单独放行对应的搜索与用户读取爬虫,并用日志确认它们能拿到 200 响应,而不是验证页或 403。

常见问法

Q: GPTBot 要不要屏蔽?
A: GPTBot 是 OpenAI 的训练采集爬虫。屏蔽它不影响 ChatGPT 联网搜索时读取你的页面,后者用的是 OAI-SearchBot 和 ChatGPT-User。是否允许训练,按你对内容授权的态度决定。

Q: 国内有哪些 AI 爬虫?
A: 公开了专属身份的主要是 Kimi。字节的 Bytespider、百度的 Baiduspider 等不能对应到具体 AI 产品。其他平台没有公开专属身份时,不要按名字猜。

Q: 屏蔽 AI 爬虫会影响 AI 推荐吗?
A: 屏蔽搜索抓取和用户读取,会让联网回答更难读到你的官网;屏蔽训练采集,主要影响未来模型版本。任何设置都不能保证被推荐。

相关事实


联系:contact@winin.ai

FROM READING TO ACTION

从官网准备度开始,找到可以改进的地方。

检测我的官网