快速答案
AI 公司的爬虫按用途分三类:训练数据采集、AI 搜索抓取、用户在对话里让 AI 读取某个网页。三类可以分开放行或屏蔽。想在 AI 回答里被找到、被引用,至少要放行「搜索抓取」和「用户触发读取」两类;是否允许训练用途,是另一个独立的决定。屏蔽前先查清你的网站今天实际被哪些爬虫访问过。
详细说明
三类 AI 爬虫
| 用途 | 做什么 | 常见官方身份(User-Agent) |
|---|---|---|
| 训练采集 | 采集公开网页,用于模型训练 | GPTBot(OpenAI)、ClaudeBot(Anthropic)、KimiBot(月之暗面)、CCBot(Common Crawl) |
| AI 搜索抓取 | 为 AI 搜索或联网回答建立索引 | OAI-SearchBot(OpenAI)、Claude-SearchBot(Anthropic)、PerplexityBot、Kimi-SearchBot |
| 用户触发读取 | 用户在对话里让 AI 打开某个链接 | ChatGPT-User、Claude-User、Perplexity-User、Kimi-User |
以上身份以各公司公开的爬虫说明为准,部分公司同时公布了官方 IP 段,可以用来核实请求是否真的来自该公司。
还有两类常被混淆的名字:
- Google-Extended、Applebot-Extended 不是独立的爬虫,而是写在 robots.txt 里的策略标记,用来声明内容能否用于这两家的 AI 训练,不影响普通搜索收录。
- Bytespider 是字节跳动的爬虫。它来访不等于豆包正在引用你的页面,两者不能直接划等号。
国内模型的爬虫
截至发稿,Kimi 公开了三个爬虫身份(KimiBot、Kimi-SearchBot、Kimi-User)以及对应的 IP 清单。DeepSeek、通义千问等平台没有公开独立的专属爬虫身份。它们的联网回答通常依赖搜索引擎或平台自己的检索能力,不能凭某个爬虫名字推断「DeepSeek 来过」。百度(Baiduspider)、360、华为 Petal 等是搜索引擎爬虫,同样不能对应到某个具体的 AI 产品。
robots.txt 怎么写
先决定三件事:是否允许训练、是否允许 AI 搜索抓取、是否允许用户触发读取。一个「允许 AI 搜索与读取、不允许训练」的写法示例:
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Google-Extended
Disallow: /
注意:
- 同一个爬虫只匹配最具体的那一组规则,别在两处写互相矛盾的规则。
- robots.txt 是公开声明,不是访问控制。守规矩的爬虫会遵守,伪装身份的请求不会。
- 私有页面、后台、报告链接不要依赖 robots.txt 保护,应该用登录和权限控制。
屏蔽会不会影响推荐
会有影响,但要分开看:
- 屏蔽搜索抓取和用户触发读取:AI 联网回答时更难读到你的官网,引用来源会更多来自第三方页面,你对自己的描述失去主动权。
- 屏蔽训练采集:影响的是未来模型版本的「记忆」,对当下的联网回答影响较小。
没有哪一种设置能保证被推荐。robots.txt 只决定「能不能读到」,被读到之后是否被采用,还取决于内容本身是否清楚、可信、与问题相关。
怎么知道 AI 爬虫来过没有
- 看服务器访问日志:按 User-Agent 过滤上表中的身份。
- 核实 IP:User-Agent 可以伪造,OpenAI、Anthropic、Perplexity、Kimi 公布了官方 IP 清单,匹配上的才算可信。
- 区分「返回成功」和「被使用」:日志里一条成功的 GET 只说明页面被读取过,不说明被收录、被训练或被引用。
用了 Cloudflare 等防护服务
很多 CDN 和防火墙默认会拦截或挑战 AI 爬虫。如果你希望被 AI 搜索读到,需要在防护设置里单独放行对应的搜索与用户读取爬虫,并用日志确认它们能拿到 200 响应,而不是验证页或 403。
常见问法
Q: GPTBot 要不要屏蔽?
A: GPTBot 是 OpenAI 的训练采集爬虫。屏蔽它不影响 ChatGPT 联网搜索时读取你的页面,后者用的是 OAI-SearchBot 和 ChatGPT-User。是否允许训练,按你对内容授权的态度决定。
Q: 国内有哪些 AI 爬虫?
A: 公开了专属身份的主要是 Kimi。字节的 Bytespider、百度的 Baiduspider 等不能对应到具体 AI 产品。其他平台没有公开专属身份时,不要按名字猜。
Q: 屏蔽 AI 爬虫会影响 AI 推荐吗?
A: 屏蔽搜索抓取和用户读取,会让联网回答更难读到你的官网;屏蔽训练采集,主要影响未来模型版本。任何设置都不能保证被推荐。
相关事实
联系:contact@winin.ai