一站式出海营销——AI原生引擎,助力中国品牌享誉全球
公司邮箱: [email protected]
咨询热线: +86-150-5046-0424
互旦科技微信客服二维码
首页/互旦博客/GEO/AI 爬虫要不要放行:GPTBot、OAI-SearchBo...

AI 爬虫要不要放行:GPTBot、OAI-SearchBot、PerplexityBot 规则

分类:GEO

作者:互旦科技内容团队

0

外贸网站想被 AI 引用,第一道门是 robots.txt。不少企业的 robots 是几年前建站时抄的模板,或者被安全插件一键「屏蔽所有 AI 爬虫」,结果 ChatGPT 与 Perplexity 的搜索爬虫根本进不来,后面的内容优化全白做。反过来,也有企业不想让内容被拿去训练模型,但又希望出现在 AI 搜索的引用里——这两件事是可以分开控制的。

这篇文章按「搜索与引用」「用户触发抓取」「模型训练」「控制令牌」四类整理主要 AI 爬虫的名称、用途与 robots 规则,给出一份「放行搜索、按需限制训练」的示例配置,以及怎么核验。名称与用途来自各公司的官方爬虫文档,核验日期见文末。

要点速览

  • 同一家公司通常有多个爬虫,用途不同:OpenAI 有 GPTBot(训练)、OAI-SearchBot(ChatGPT 搜索索引)、ChatGPT-User(用户触发抓取)

  • 想被 ChatGPT 搜索引用,必须放行 OAI-SearchBot;屏蔽 GPTBot 只影响训练,不影响搜索引用

  • Perplexity 的 PerplexityBot 只用于搜索索引,不用于模型训练;Perplexity-User 是用户触发的实时抓取

  • Google-Extended 与 Applebot-Extended 不是爬虫,是控制令牌:写在 robots 里控制内容是否用于 AI 训练与依据,日志里不会出现它们的请求

  • Google AI Overviews 与 AI Mode 使用 Googlebot,不能用 Google-Extended 屏蔽;不想出现在 AI 功能里要用 nosnippet 或 Search Console 的控制项

主要 AI 爬虫一览

公司名称(robots 令牌)用途想被 AI 搜索引用时备注
OpenAIOAI-SearchBotChatGPT 搜索索引与引用放行不用于训练
OpenAIChatGPT-User用户在 ChatGPT 里要求打开某页时的实时抓取放行用户触发
OpenAIGPTBot收集训练数据按企业意愿屏蔽不影响搜索引用
PerplexityPerplexityBotPerplexity 搜索索引放行官方说明不用于训练
PerplexityPerplexity-User用户触发的实时抓取放行官方说明因用户触发,一般不受 robots 限制
AnthropicClaude-SearchBotClaude 搜索结果索引放行三者都声明遵守 robots
AnthropicClaude-User用户触发抓取放行
AnthropicClaudeBot训练数据按企业意愿
GoogleGooglebot搜索、AI Overviews、AI Mode放行无单独 AI 搜索爬虫
GoogleGoogle-Extended控制令牌:内容是否用于 Gemini 训练与依据一般放行不影响搜索收录与排名;不是爬虫
MicrosoftBingbotBing 搜索、Copilot放行可配 IndexNow
AppleApplebot / Applebot-ExtendedApplebot 抓取;Extended 为 AI 训练控制令牌放行 Applebot;Extended 按意愿
MetaMeta-ExternalAgentAI 训练与相关用途按企业意愿
Common CrawlCCBot公开数据集,被多家模型训练使用按企业意愿合规记录不一
ByteDanceBytespider训练与相关用途按企业意愿合规记录不一
AmazonAmazonbotAlexa 等服务按企业意愿

推荐配置:放行搜索,按需限制训练

下面是一份面向外贸 B2B 网站的示例。原则:搜索与引用类爬虫全部放行;训练类按企业意愿决定;不要用通配规则一刀切。

# 搜索与引用:放行
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

# 训练:按企业意愿(示例为不允许)
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

# 控制令牌:内容是否用于 Gemini 训练与依据(示例为允许)
User-agent: Google-Extended
Allow: /

# 常规
User-agent: *
Disallow: /admin/
Sitemap: https://www.example.com/sitemap.xml

注意三点:① robots 里的 Allow 只是不禁止,页面还要能正常返回 200、不被防火墙或 CDN 的「AI 爬虫拦截」规则挡住;② 训练类是否屏蔽是企业的选择,屏蔽训练不会让你从 AI 搜索里消失;③ 改完先在浏览器打开 /robots.txt 核对,再用日志看对应 UA 有没有回来。

CDN 与安全插件的隐形拦截

  • CDN 的「AI 爬虫」开关:部分 CDN 提供一键阻止 AI 爬虫的选项,开启后通常连搜索类爬虫一起挡。检查该选项是否开启,需要的话改为只挡训练类

  • WordPress 安全插件:「屏蔽坏爬虫」列表里可能包含 OAI-SearchBot、PerplexityBot;逐条核对白名单

  • 速率限制与验证码:爬虫触发验证码就等于被挡;各家爬虫文档提供官方 IP 段或验证方法,可按 UA + IP 核验后放行

  • robots 里的通配 Disallow:`User-agent: *` 下的 Disallow 对没有单独声明的 AI 爬虫同样生效,检查有没有误封 /blog/ 或产品目录

怎么核验放行是否生效

  1. 浏览器打开 /robots.txt,逐条核对上表里的令牌
  2. 用命令行模拟 UA 请求一个核心页面,确认返回 200 且是完整 HTML(不是验证码页)
  3. 看服务器或 CDN 日志,过滤 OAI-SearchBot、PerplexityBot、Claude-SearchBot 等 UA,确认有抓取记录
  4. 在 Bing Webmaster Tools 与 Search Console 里确认核心页面已收录(这两家是 Copilot 与 Google AI 功能的底座)
  5. 用固定题库在各平台实测,看引用是否出现;方法见《我们实测了 122 个外贸买家问题》

常见问题 FAQ

Q: 屏蔽了 GPTBot,ChatGPT 还会引用我的网站吗?

A: 会。ChatGPT 搜索的索引由 OAI-SearchBot 负责,GPTBot 只用于训练。两者在 robots 里分别控制。

Q: 要不要屏蔽训练类爬虫?

A: 取决于企业对内容被用于训练的态度,与 GEO 效果无直接关系。多数外贸企业的公开产品与技术内容本来就希望被广泛传播,不屏蔽也没有实际损失;有版权顾虑的内容可以单独处理。

Q: Google-Extended 写了 Disallow,会掉排名吗?

A: Google 官方说明 Google-Extended 不影响搜索收录与排名,它只控制内容是否用于 Gemini 的训练与依据。但屏蔽后 Gemini 应用可能不再引用你的页面。

Q: robots 放行了,为什么 AI 还是不引用?

A: robots 只是准入。之后还要看页面是否被对应平台收录、内容是否可引用、品牌实体是否一致,见《ChatGPT、Perplexity、Copilot、Gemini 各自从哪找答案》与《GEO 与 SEO 有什么区别》。

结语

AI 爬虫的放行规则只有一个原则:搜索与引用类全部放行,训练类按企业意愿,控制令牌按用途。把 robots、CDN 与安全插件三处一起核对,再用日志确认爬虫真的来过,GEO 的第一道门就打开了。外贸 GEO 优化服务的免费实测会先核对这一步。

资料核验日期:2026 年 9 月 29 日。平台文档与功能以各官方页面当前版本为准;本文不构成对被 AI 引用、推荐或询盘数量的承诺。

互旦科技内容团队

江苏互旦网络科技有限公司内容团队,成员来自一线广告投放、Google SEO 与社媒运营岗位,只写经过实战验证的打法。

了解互旦科技 认识我们的团队

服务遍布中国乃至全球

谷歌 SEO · 独立站建设 · 海外社媒 · 广告投放,一客一案定制出海增长路径

与Hudoo-Tech一起成长

即刻咨询合作,共拓海外市场

  • 深耕企业出海服务 8 年
  • 一客一案提供私域解决方案
免费获取出海诊断方案
  • 验证码

一个工作日内回复 | 信息仅用于方案沟通,绝不外泄