GEO帮GEO 入门与自查
  1. 首页
  2. 文章
  3. 正文

AI 搜索引擎有哪些公开了爬虫规则,各自怎么取内容

AI 搜索引擎公开的爬虫规则并不完全一样:有的把搜索抓取、训练抓取和用户触发的访问分开,有的用同一个 Googlebot 控制搜索与 AI 功能。OpenAI、Anthropic、Perplexity、Google、Microsoft Bing、百度和 Kimi 都有一手公开材料,但它们对爬虫令牌、robots.txt 和用户触发访问的处理并不相同。

AI 搜索引擎的爬虫规则对照

下表先列出各平台公开的令牌及其文档对 robots.txt 的说明。注意,“遵守”只表示平台文档中的明确表述,不等于页面一定会被收录、引用或推荐。

产品 文档公开的爬虫令牌 文档是否说明遵守 robots.txt 是否有公开说明
OpenAI OAI-SearchBot、GPTBot、ChatGPT-User、OAI-AdsBot 搜索与训练规则可分别管理;ChatGPT-User 的用户触发访问可能不适用 有
Anthropic Claude-SearchBot、Claude-User 文档说明遵守 robots.txt 的“禁止抓取”指令 有
Perplexity PerplexityBot、Perplexity-User PerplexityBot 可用规则管理;Perplexity-User 通常忽略规则 有
Google Googlebot、Google-Extended 常见爬虫自动抓取时遵守;Google-Extended 是控制令牌 有
Microsoft Bing bingbot Bing 说明会尊重 robots.txt 及其他受支持控制 有
百度 Baiduspider、Baiduspider-render Baiduspider 遵守;Baiduspider-cpro 不遵守 有
Kimi Kimi-SearchBot、KimiBot、Kimi-User 搜索和训练爬虫支持标准规则;用户触发访问可能不直接适用 有

百度还公开了 Baiduspider-cpro,但它是百度联盟的抓取代理,不应与搜索爬虫混为一谈。Kimi 的搜索与训练令牌也分别承担不同用途;截至 2026 年 10 月,我们没有找到百度、豆包、DeepSeek 或腾讯元宝等面向 AI 答案的独立爬虫规则公开页。

OpenAI:搜索和训练可以分别控制

OpenAI 的爬虫说明把几个角色分开了。OAI-SearchBot 用于让网站出现在 ChatGPT 的搜索功能中;GPTBot 抓取的内容可能被用于训练 OpenAI 的生成式 AI 基础模型;ChatGPT-User 则是在用户提问触发 ChatGPT 或 Custom GPT 访问网页时使用的代理;OAI-AdsBot 只访问作为广告提交的页面,其数据不用于训练基础模型。

因此,站点可以允许 OAI-SearchBot、同时禁止 GPTBot。这两个设置彼此独立;如果两者都允许,OpenAI 表示可能合并一次抓取,避免重复访问。禁止 GPTBot 的含义是向 OpenAI 发出信号,不把你的内容用于生成式 AI 基础模型训练。

OpenAI 还建议,允许 OAI-SearchBot 的同时,应放行其公布的 IP 范围,并公布了对应的 OpenAI 搜索爬虫说明。这类配置解决的是是否允许访问和如何区分用途,不会自动带来引用、推荐或排名。

ChatGPT-User 不是自动批量爬虫。用户主动提出的访问请求可能不适用 robots.txt 规则,而且它不负责决定内容能否进入 ChatGPT Search;控制搜索退出仍应使用 OAI-SearchBot。

Anthropic 与 Perplexity:搜索爬虫和用户代理分工不同

Anthropic 的说明称,它使用多种机器人获取公开网页数据,用于模型开发、网页搜索和按用户指示取回网页内容。其中,Claude-SearchBot 用于改善搜索结果质量;Claude-User 用于用户问题导致 Claude 访问网站的情况。

Anthropic 表示,其机器人会尊重 robots.txt 中的“禁止抓取”信号,也支持非标准的 Crawl-delay 扩展来限制抓取活动。若要阻止整个网站,应在网站根目录的 robots.txt 中配置,并对每个希望阻止的子域名分别设置。不要只依赖封禁 IP,因为这可能妨碍机器人读取 robots.txt 本身。具体可参考 Anthropic 的爬虫与屏蔽说明。

Perplexity 则把 PerplexityBot 用于发现、呈现和链接搜索结果网站;官方说明它不用于抓取 AI 基础模型训练内容。站点主可用 robots.txt 标签独立管理这些设置,变更可能需要最多 24 小时才反映到其系统中。

Perplexity 允许用户问题触发 Perplexity-User 访问网页,并在回答中提供链接。由于这是用户请求触发的取内容,官方说它通常忽略 robots.txt 规则,同时它也不是训练内容收集器。控制搜索爬虫时,应使用 PerplexityBot,而不是把两者混写;详见 Perplexity Crawlers 文档。

Google、Bing 与百度:传统搜索规则会影响 AI 可见性

Google 明确说明,Google-Extended 没有独立的 HTTP User-Agent 字符串。Google 的常见爬虫在自动抓取时会遵守 robots.txt,而实际抓取仍使用既有的 Google 爬虫标识;Google-Extended 只是 robots.txt 中的控制令牌。写给 Googlebot 的抓取偏好会影响 Google Search 及其功能,也可能影响 Google Images、Google Video 和 Google News 等产品。

Google 还提醒,robots.txt 主要用于控制可访问的 URL、避免站点过载,不是把页面从 Google 中彻底移除的机制。被禁止抓取的页面仍可能只以 URL 形式出现在搜索结果中。规则按最具体的匹配 User-Agent 分组处理,而且 User-Agent 可以被伪造,日志中的自称不能单独证明访问者身份。参见 Google 常见爬虫列表 和 Google 对 robots.txt 的说明。

Bing 的公开材料更强调内容发现与控制,而非单独列出“AI 答案爬虫”。Bing 尊重站点通过 robots.txt 和其他支持机制表达的内容偏好;其 Bing Chat 控制示例包括 <meta name="robots" content="noarchive"> 与 <meta name="bingbot" content="nocache">。同时,Bing 说明没有任何工具能保证内容何时或如何出现在 AI 生成结果中。

发现页面方面,Bing 把 sitemap 视为覆盖全站 URL 的基础信号,IndexNow 则用于通知内容新增、更新或删除。sitemap 提交或在 robots.txt 中被引用后,Bing 会立即获取,并通常至少每天重新检查一次;这只是抓取和索引发现机制,不是 AI 引用保证。相关说明见 Bing Chat 控制说明 和 Bing sitemap 说明。

百度公开了 Baiduspider、Baiduspider-render 和 Baiduspider-cpro。其中,Baiduspider/2.0 用于识别 PC 爬虫;移动端百度爬虫的 User-Agent 同时包含 android、mobile 和 Baiduspider/2.0。Baiduspider-render/2.0 用于渲染抓取,百度说明它会访问站点的 CSS、Javascript 和图片资源,以便更精准地理解页面。

百度帮助中心说明,Baiduspider 遵守 robots 协议,可用 robots.txt 完全或部分禁止访问;百度也支持通过网页 meta robots 设置控制索引展示。相反,Baiduspider-cpro 是百度联盟抓取代理,其抓取页面不建入索引,且不遵守 robots 协议。已建立的索引即使后来停止抓取,也可能需要数月才清除。参见 Baiduspider 常见问题解答 与 渲染抓取 UA 公告。

Kimi:搜索、训练和用户访问各有令牌

Kimi 的爬虫页面明确区分三种用途。Kimi-SearchBot 支持 Kimi 搜索功能,用于分析页面相关性并建立搜索索引;官方明确说,禁止它会阻止网站出现在 Kimi 搜索结果中。

KimiBot 抓取的内容可能被用于训练 Kimi 的基础模型;禁止它,表示你的内容不应被用于模型训练。Kimi-User 处理用户发起的操作,例如总结特定文章或进行实时网页检索;它不是自动批量爬虫,由于请求由用户触发,robots.txt 规则可能不直接适用。

Kimi 建议以 robots.txt 作为主要控制方式,不建议把封禁 IP 当作替代方案,因为 IP 范围可能变化,阻断 IP 可能导致 Kimi 无法读取最新的 robots.txt。其规则按子域名应用,每个子域名都视为独立来源。具体令牌和用途见 Kimi Crawlers 页面。

你可以怎样自查

你可以先用 GEO 自查 输入一个网址。工具会实际读取该页面、站点的 robots.txt、sitemap 和 llms.txt,并报告本次观察到的访问、AI 爬虫、页面可读性和站点文件情况;其中 llms.txt 只显示为“说明”,因为它目前仍是提案性文件。

然后按上面的令牌逐一核对:搜索爬虫和训练爬虫是否分开控制,用户触发代理是否另行看待,日志中的访问是否符合文档描述。工具也会列出有一手文档的爬虫,以及 robots.txt 是否允许它们抓取该页面。它不向 AI 产品提问,不测量引用频率、流量或排名,也不检查内容质量;每次只检查一个页面。

截至 2026 年 10 月,我们没有找到 OpenAI、Anthropic 或 Perplexity 明确说明其爬虫或产品会读取其他网站的 llms.txt 的公开说明,因此不要把放置该文件当作已被这些平台支持的收录条件。

资料来源