AI 爬虫要不要放行:GPTBot、OAI-SearchBot、PerplexityBot 规则
外贸网站想被 AI 引用,第一道门是 robots.txt。不少企业的 robots 是几年前建站时抄的模板,或者被安全插件一键「屏蔽所有 AI 爬虫」,结果 ChatGPT 与 Perplexity 的搜索爬虫根本进不来,后面的内容优化全白做。反过来,也有企业不想让内容被拿去训练模型,但又希望出现在 AI 搜索的引用里——这两件事是可以分开控制的。
这篇文章按「搜索与引用」「用户触发抓取」「模型训练」「控制令牌」四类整理主要 AI 爬虫的名称、用途与 robots 规则,给出一份「放行搜索、按需限制训练」的示例配置,以及怎么核验。名称与用途来自各公司的官方爬虫文档,核验日期见文末。
要点速览
同一家公司通常有多个爬虫,用途不同:OpenAI 有 GPTBot(训练)、OAI-SearchBot(ChatGPT 搜索索引)、ChatGPT-User(用户触发抓取)
想被 ChatGPT 搜索引用,必须放行 OAI-SearchBot;屏蔽 GPTBot 只影响训练,不影响搜索引用
Perplexity 的 PerplexityBot 只用于搜索索引,不用于模型训练;Perplexity-User 是用户触发的实时抓取
Google-Extended 与 Applebot-Extended 不是爬虫,是控制令牌:写在 robots 里控制内容是否用于 AI 训练与依据,日志里不会出现它们的请求
Google AI Overviews 与 AI Mode 使用 Googlebot,不能用 Google-Extended 屏蔽;不想出现在 AI 功能里要用 nosnippet 或 Search Console 的控制项
主要 AI 爬虫一览
| 公司 | 名称(robots 令牌) | 用途 | 想被 AI 搜索引用时 | 备注 |
|---|---|---|---|---|
| OpenAI | OAI-SearchBot | ChatGPT 搜索索引与引用 | 放行 | 不用于训练 |
| OpenAI | ChatGPT-User | 用户在 ChatGPT 里要求打开某页时的实时抓取 | 放行 | 用户触发 |
| OpenAI | GPTBot | 收集训练数据 | 按企业意愿 | 屏蔽不影响搜索引用 |
| Perplexity | PerplexityBot | Perplexity 搜索索引 | 放行 | 官方说明不用于训练 |
| Perplexity | Perplexity-User | 用户触发的实时抓取 | 放行 | 官方说明因用户触发,一般不受 robots 限制 |
| Anthropic | Claude-SearchBot | Claude 搜索结果索引 | 放行 | 三者都声明遵守 robots |
| Anthropic | Claude-User | 用户触发抓取 | 放行 | |
| Anthropic | ClaudeBot | 训练数据 | 按企业意愿 | |
| Googlebot | 搜索、AI Overviews、AI Mode | 放行 | 无单独 AI 搜索爬虫 | |
| Google-Extended | 控制令牌:内容是否用于 Gemini 训练与依据 | 一般放行 | 不影响搜索收录与排名;不是爬虫 | |
| Microsoft | Bingbot | Bing 搜索、Copilot | 放行 | 可配 IndexNow |
| Apple | Applebot / Applebot-Extended | Applebot 抓取;Extended 为 AI 训练控制令牌 | 放行 Applebot;Extended 按意愿 | |
| Meta | Meta-ExternalAgent | AI 训练与相关用途 | 按企业意愿 | |
| Common Crawl | CCBot | 公开数据集,被多家模型训练使用 | 按企业意愿 | 合规记录不一 |
| ByteDance | Bytespider | 训练与相关用途 | 按企业意愿 | 合规记录不一 |
| Amazon | Amazonbot | Alexa 等服务 | 按企业意愿 |
推荐配置:放行搜索,按需限制训练
下面是一份面向外贸 B2B 网站的示例。原则:搜索与引用类爬虫全部放行;训练类按企业意愿决定;不要用通配规则一刀切。
# 搜索与引用:放行 User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Claude-SearchBot Allow: / User-agent: Claude-User Allow: / # 训练:按企业意愿(示例为不允许) User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: CCBot Disallow: / # 控制令牌:内容是否用于 Gemini 训练与依据(示例为允许) User-agent: Google-Extended Allow: / # 常规 User-agent: * Disallow: /admin/ Sitemap: https://www.example.com/sitemap.xml
注意三点:① robots 里的 Allow 只是不禁止,页面还要能正常返回 200、不被防火墙或 CDN 的「AI 爬虫拦截」规则挡住;② 训练类是否屏蔽是企业的选择,屏蔽训练不会让你从 AI 搜索里消失;③ 改完先在浏览器打开 /robots.txt 核对,再用日志看对应 UA 有没有回来。
CDN 与安全插件的隐形拦截
CDN 的「AI 爬虫」开关:部分 CDN 提供一键阻止 AI 爬虫的选项,开启后通常连搜索类爬虫一起挡。检查该选项是否开启,需要的话改为只挡训练类
WordPress 安全插件:「屏蔽坏爬虫」列表里可能包含 OAI-SearchBot、PerplexityBot;逐条核对白名单
速率限制与验证码:爬虫触发验证码就等于被挡;各家爬虫文档提供官方 IP 段或验证方法,可按 UA + IP 核验后放行
robots 里的通配 Disallow:`User-agent: *` 下的 Disallow 对没有单独声明的 AI 爬虫同样生效,检查有没有误封 /blog/ 或产品目录
怎么核验放行是否生效
- 浏览器打开 /robots.txt,逐条核对上表里的令牌
- 用命令行模拟 UA 请求一个核心页面,确认返回 200 且是完整 HTML(不是验证码页)
- 看服务器或 CDN 日志,过滤 OAI-SearchBot、PerplexityBot、Claude-SearchBot 等 UA,确认有抓取记录
- 在 Bing Webmaster Tools 与 Search Console 里确认核心页面已收录(这两家是 Copilot 与 Google AI 功能的底座)
- 用固定题库在各平台实测,看引用是否出现;方法见《我们实测了 122 个外贸买家问题》
常见问题 FAQ
Q: 屏蔽了 GPTBot,ChatGPT 还会引用我的网站吗?
A: 会。ChatGPT 搜索的索引由 OAI-SearchBot 负责,GPTBot 只用于训练。两者在 robots 里分别控制。
Q: 要不要屏蔽训练类爬虫?
A: 取决于企业对内容被用于训练的态度,与 GEO 效果无直接关系。多数外贸企业的公开产品与技术内容本来就希望被广泛传播,不屏蔽也没有实际损失;有版权顾虑的内容可以单独处理。
Q: Google-Extended 写了 Disallow,会掉排名吗?
A: Google 官方说明 Google-Extended 不影响搜索收录与排名,它只控制内容是否用于 Gemini 的训练与依据。但屏蔽后 Gemini 应用可能不再引用你的页面。
Q: robots 放行了,为什么 AI 还是不引用?
A: robots 只是准入。之后还要看页面是否被对应平台收录、内容是否可引用、品牌实体是否一致,见《ChatGPT、Perplexity、Copilot、Gemini 各自从哪找答案》与《GEO 与 SEO 有什么区别》。
结语
AI 爬虫的放行规则只有一个原则:搜索与引用类全部放行,训练类按企业意愿,控制令牌按用途。把 robots、CDN 与安全插件三处一起核对,再用日志确认爬虫真的来过,GEO 的第一道门就打开了。外贸 GEO 优化服务的免费实测会先核对这一步。
资料核验日期:2026 年 9 月 29 日。平台文档与功能以各官方页面当前版本为准;本文不构成对被 AI 引用、推荐或询盘数量的承诺。
公司邮箱:
咨询热线:
B2B行业
电商行业
LinkedIn运营
Meta运营
YouTube运营
TikTok运营
SEM投放
Social投放
高端定制建站
高端模板站
Shopify独立站
WooCommerce独立站

深耕企业出海服务 8 年