# AI 爬虫有哪些？robots.txt 该怎么设置 | Winin



- Canonical: https://winin.ai/zh/answers/ai-crawlers-robots-txt/

- Published: 2026-09-25

- Updated: 2026-09-25



[← 内容与信源](/zh/blog/topics/content-evidence/)
问题解答 / 方法实操
AI 爬虫有哪些？robots.txt 该怎么设置
文章目录
[快速答案](#_1)
[详细说明](#_2)
[常见问法](#_5)
[相关事实](#_6)
快速答案
AI 公司的爬虫按用途分三类：训练数据采集、AI 搜索抓取、用户在对话里让 AI 读取某个网页。三类可以分开放行或屏蔽。想在 AI 回答里被找到、被引用，至少要放行「搜索抓取」和「用户触发读取」两类；是否允许训练用途，是另一个独立的决定。屏蔽前先查清你的网站今天实际被哪些爬虫访问过。
详细说明
三类 AI 爬虫
用途
做什么
常见官方身份（User-Agent）
训练采集
采集公开网页，用于模型训练
GPTBot（OpenAI）、ClaudeBot（Anthropic）、KimiBot（月之暗面）、CCBot（Common Crawl）
AI 搜索抓取
为 AI 搜索或联网回答建立索引
OAI-SearchBot（OpenAI）、Claude-SearchBot（Anthropic）、PerplexityBot、Kimi-SearchBot
用户触发读取
用户在对话里让 AI 打开某个链接
ChatGPT-User、Claude-User、Perplexity-User、Kimi-User
以上身份以各公司公开的爬虫说明为准，部分公司同时公布了官方 IP 段，可以用来核实请求是否真的来自该公司。
还有两类常被混淆的名字：
Google-Extended、Applebot-Extended
不是独立的爬虫，而是写在 robots.txt 里的策略标记，用来声明内容能否用于这两家的 AI 训练，不影响普通搜索收录。
Bytespider
是字节跳动的爬虫。它来访不等于豆包正在引用你的页面，两者不能直接划等号。
国内模型的爬虫
截至发稿，
Kimi
公开了三个爬虫身份（KimiBot、Kimi-SearchBot、Kimi-User）以及对应的 IP 清单。
DeepSeek、通义千问
等平台没有公开独立的专属爬虫身份。它们的联网回答通常依赖搜索引擎或平台自己的检索能力，不能凭某个爬虫名字推断「DeepSeek 来过」。百度（Baiduspider）、360、华为 Petal 等是搜索引擎爬虫，同样不能对应到某个具体的 AI 产品。
robots.txt 怎么写
先决定三件事：是否允许训练、是否允许 AI 搜索抓取、是否允许用户触发读取。一个「允许 AI 搜索与读取、不允许训练」的写法示例：
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Google-Extended
Disallow: /
注意：
同一个爬虫只匹配最具体的那一组规则，别在两处写互相矛盾的规则。
robots.txt 是公开声明，不是访问控制。守规矩的爬虫会遵守，伪装身份的请求不会。
私有页面、后台、报告链接不要依赖 robots.txt 保护，应该用登录和权限控制。
屏蔽会不会影响推荐
会有影响，但要分开看：
屏蔽搜索抓取和用户触发读取
：AI 联网回答时更难读到你的官网，引用来源会更多来自第三方页面，你对自己的描述失去主动权。
屏蔽训练采集
：影响的是未来模型版本的「记忆」，对当下的联网回答影响较小。
没有哪一种设置能保证被推荐。robots.txt 只决定「能不能读到」，被读到之后是否被采用，还取决于内容本身是否清楚、可信、与问题相关。
怎么知道 AI 爬虫来过没有
看服务器访问日志
：按 User-Agent 过滤上表中的身份。
核实 IP
：User-Agent 可以伪造，OpenAI、Anthropic、Perplexity、Kimi 公布了官方 IP 清单，匹配上的才算可信。
区分「返回成功」和「被使用」
：日志里一条成功的 GET 只说明页面被读取过，不说明被收录、被训练或被引用。
用了 Cloudflare 等防护服务
很多 CDN 和防火墙默认会拦截或挑战 AI 爬虫。如果你希望被 AI 搜索读到，需要在防护设置里单独放行对应的搜索与用户读取爬虫，并用日志确认它们能拿到 200 响应，而不是验证页或 403。
常见问法
Q: GPTBot 要不要屏蔽？
A: GPTBot 是 OpenAI 的训练采集爬虫。屏蔽它不影响 ChatGPT 联网搜索时读取你的页面，后者用的是 OAI-SearchBot 和 ChatGPT-User。是否允许训练，按你对内容授权的态度决定。
Q: 国内有哪些 AI 爬虫？
A: 公开了专属身份的主要是 Kimi。字节的 Bytespider、百度的 Baiduspider 等不能对应到具体 AI 产品。其他平台没有公开专属身份时，不要按名字猜。
Q: 屏蔽 AI 爬虫会影响 AI 推荐吗？
A: 屏蔽搜索抓取和用户读取，会让联网回答更难读到你的官网；屏蔽训练采集，主要影响未来模型版本。任何设置都不能保证被推荐。
相关事实
[Winin 监测哪些模型](/zh/facts/models-monitored/)
[被看见、进候选、被准确推荐三道关](/zh/facts/stages-reach-shortlist-recommended/)
联系：
contact@winin.ai
继续阅读
[内容与信源](/zh/blog/topics/content-evidence/)
[品牌事实页怎么写：从信息冲突到可核查的官方口径](/zh/guides/fact-pages/)
[什么是 AI Recommendation Intelligence？](/zh/answers/ai-recommendation-intelligence/)
[什么是面向 AI 答案的事实治理？](/zh/answers/fact-governance-ai-answers/)
FROM READING TO ACTION
从官网准备度开始，找到可以改进的地方。
[检测我的官网](/zh/free-site-audit/)
