GEO帮GEO 入门与自查
  1. 首页
  2. 文章
  3. 正文

GEO 优化怎么做:小网站先查这四件事

做 GEO优化,小网站先查四件事:目标页能否正常抓取、robots.txt 是否挡住搜索类 AI 爬虫、核心内容是否直接存在于 HTML,以及站点是否提供 sitemap。先把访问、规则、页面表达和文件发现路径理顺;这些动作只能排除基础障碍,不能保证被 AI 引用、推荐或排名。

小网站的 GEO优化,从页面抓取开始

先从最重要的目标 URL 开始。Google 的 AI 功能说明 把允许 robots.txt 以及 CDN 或托管基础设施抓取列为基础,并说明:页面必须已被索引、符合在 Google 搜索中带摘要展示的技术要求,才具备成为 AI Overviews 或 AI Mode 支持链接的资格;即使符合要求,Google 也不保证抓取、索引或展示。

实际检查时,直接打开目标 URL,再查看页面源代码,确认用户无需登录或额外点击就能取得页面,而且 HTML 中已经包含正文。也可以输入网址使用 GEO 自查;它会在当次检查中读取目标页、robots.txt 和 sitemap,并报告 HTTPS、HTML、正文、页面结构及文件状态。

修复时,先检查 HTTPS、跳转、CDN 或 WAF 是否误拦,再确认服务器实际返回 HTML。修复后重新打开目标 URL,并从源代码确认正文,不要把登录后或点击后才出现的区域当作已经交付的主体内容。

再查 robots.txt 是否挡住 AI 搜索爬虫

先把搜索访问与训练用途分开配置,不要看到“AI”就统一放行或拦截。按用途看,OpenAI 的 爬虫说明 把 OAI-SearchBot 用于 ChatGPT 搜索结果,把 GPTBot 用于抓取可能用于训练其生成式 AI 基础模型的内容,并明确两项设置彼此独立。

在 Anthropic 的 网页抓取说明 中,Claude-SearchBot 用于改善搜索结果,Claude-User 用于用户问题触发的网站访问,ClaudeBot 抓取的内容则可能用于模型训练。

Google 的 常见爬虫说明 还说明,针对 Googlebot 的规则会影响 Google Search;Google-Extended 则是 robots.txt 控制 token,没有单独的 HTTP user-agent string。它控制 Google 已抓取内容是否可用于未来 Gemini 模型训练和 grounding,不影响网站进入 Google Search,也不是该搜索系统的排名信号。

如果你希望上述搜索类爬虫读取核心页面,可以分别按 token 放行:

User-agent: Googlebot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

训练用途需要单独表达。下面的配置用于阻止相应训练用途:

User-agent: Google-Extended
Disallow: /

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

打开站点根目录的 robots.txt 后,确认文件位于正确的主机、协议和端口,再逐组检查 token 与路径。Google 的 robots.txt 规则说明 指出,它会选择最具体的匹配组,不把特定组与全局 * 组合;被禁止页面的内容不能被抓取,但 URL 仍可能显示在搜索结果中且没有摘要。

修复时,把文件放到正确根目录,并按具体 token 分组。对 Google,不要以为 Googlebot 组会自动继承全局 *。改完后重新打开 robots.txt,检查目标页面路径是否被意外覆盖。

再看 HTML 里有没有可读的主体页面

Google 在 AI 功能说明 中还列出内部链接与重要内容应以文本形式提供,并说明进入 AI Overviews 或 AI Mode 不需要额外的 AI 文本文件或标记。title、description 和单一 H1 是下面这套自查使用的页面结构项,不是 Google 宣布的 AI 专用门槛。

查看初始 HTML 时,依次确认 title 元素有值、description 元数据存在、H1 恰好一个,正文结论和关键说明能够以文本读取。如果内容只在交互后出现,应先标为需要复查,不要仅凭浏览器已经渲染出的界面认定初始 HTML 存在正文。

修复时,让模板为重要页面输出明确的 title 和 description,正文围绕一个页面主题只设置一个 H1,并把核心定义、适用范围和关键结论直接写成 HTML 文本。随后检查主要段落能否脱离图片独立读懂。

最后确认 sitemap 是否可用

Google 的 sitemap 说明 指出,sitemap 提供页面、视频、其他文件及其关系;页面链接良好时,Google 通常可以发现网站中的大多数页面。该说明把约 500 页或更少称为 small,这类站点可能不需要 sitemap,而 sitemap 也不保证其中的 URL 一定被抓取或索引。

实际检查时,先看 robots.txt 中是否有 Sitemap:,再直接打开所指向的文件,并抽查其中的重要页面地址能否正常取得。建站系统如果已有生成功能,应先检查生成设置或站点根目录,不要凭页面外观判断 sitemap 是否存在。

没有 sitemap 时,先启用生成功能;自行维护时,应列出重要页面,并用 Sitemap: 指向 sitemap 文件。生成后确认文件可访问、地址与站内链接一致。小型站点应先判断是否确实需要,再决定是否投入维护。

复查时按顺序处理:访问不通先修访问,规则误拦再改 robots.txt,HTML 缺少正文就修模板,最后检查 sitemap。GEO 自查每次只检查一个页面,不向 AI 产品提问,也不衡量引用、推荐频率或所谓“AI 可见度”;通过项只代表当次抓取状态,不构成结果保证。

资料来源