GEO帮GEO 入门与自查
  1. 首页
  2. 文章
  3. 正文

生成式引擎优化的原始论文讲了什么

arXiv 摘要页收录的这篇生成式引擎优化原始论文提出 GEO 和 GEO-bench,并用作者构建的模拟生成式引擎及针对 Perplexity.ai 的实验比较网页改写方法。它给出的核心答案是:部分方法在论文口径下提高了来源可见度,但效果随领域变化;这不是现实 AI 产品的引用、推荐或排名保证。

原始论文是谁写的、发表在哪里

论文由 Pranjal Aggarwal、Vishvak Murahari、Tanmay Rajpurohit、Ashwin Kalyan、Karthik Narasimhan 和 Ameet Deshpande 合著;arXiv 论文全文显示,它于 2023 年 11 月 16 日首次提交,2024 年 6 月 28 日修订至第 3 版,并标注已被 KDD 2024 接收。正文所列正式会议为第 30 届 ACM SIGKDD Conference on Knowledge Discovery and Data Mining,会期为 2024 年 8 月 25–29 日,地点是巴塞罗那。

生成式引擎优化论文如何定义问题

作者把 BingChat、Google 的 SGE 和 perplexity.ai 这类结合常规搜索与生成模型的系统称为“生成式引擎”。它们从多个来源寻找信息,再由大语言模型综合、总结并生成回答。

从技术流程看,系统先检索相关文档,再用大型神经模型生成以这些来源为依据的回答,同时给出归因,让用户能够核验信息。

论文提出的现实问题是:生成式引擎具有黑盒且变化迅速的特点,内容创作者几乎无法控制自己的内容何时、以何种方式出现在回答中。因此,作者把 GEO 定义为提高内容在生成式引擎回答中的可见度,并认为传统 SEO 方法不能直接套用。

GEO-bench 到底测什么

GEO-bench 是论文用于实验的查询基准:在这套基准中,10K 条查询来自多个来源并加入合成查询,按 8K/1K/1K 分为训练、验证和测试集;80% 是信息型查询,交易型和导航型查询各占 10%。

在 GEO-bench 的数据构造中,每条查询都附带 Google 搜索前 5 个结果的清洗文本;在作者的主实验中,每个查询也只抓取这前 5 个来源,再由 gpt3.5-turbo 生成模拟回答。优化后的网页版本则由大型语言模型按照特定风格或内容改写指令生成。

这套主实验测量的是作者搭建的模拟生成式引擎,不是任何真实产品当前版本的运行结果。

论文测试了什么,结果怎样

论文共评估 9 种 GEO 方法,并以未修改网页为基线。结果部分明确点名的做法包括引用来源、增加引语、增加统计数据、流畅性优化、易于理解、权威性语气和关键词堆砌。

摘要把总体效果概括为可见度最高提高 40%;正文按具体指标报告,在作者主实验的最佳观测值中,相对未优化基线,位置加权词数提高 41%,主观印象提高 28%。两种表述的统计口径不同,不应互换使用。

在作者实验汇总中,表现最好的引用来源、增加引语和增加统计数据,使位置加权词数相对基线提高 30–40%,主观印象提高 15–30%。流畅性优化与易于理解也取得了 15–30% 的可见度提升;更具说服力和权威性的语气没有显著改善,关键词堆砌则几乎没有带来改善。

针对 Perplexity.ai 的测试以未修改网页为基线:增加引语使位置加权词数比基线提高 22%,关键词堆砌比基线低 10%。当论文实验中的全部来源同时接受优化时,引用来源使 Google 搜索结果页中原本排名第五的网站可见度提高 115.1%,而原本排名第一的网站可见度平均下降 30.3%。

论文给出了哪些限制

论文明确指出,内容创作者对生成式引擎展示内容的时间和方式控制很少;同时,方法效果会随领域变化。作者据此主张,网站应根据自身领域做有针对性的调整,而不是把某一种改写方式套到所有网站。

实验边界也很明确:模拟主实验只取 Google 搜索前 5 个来源,并由 gpt3.5-turbo 生成回答;Perplexity.ai 的数字则只属于论文针对该产品进行的测试。位置加权词数和主观印象衡量的是论文定义下的回答可见度,不能改写成引用率、流量或排名指标。

读完后你能自查什么

你可以先用 GEO 自查 检查自己的页面。它会读取所输入页面当前的 HTML、robots.txt、sitemap 和 llms.txt;每次只检查一个页面,并从访问、AI 爬虫、页面可读性和站点文件四组报告 16 项结果。llms.txt 因为仍是一项提案,只显示为“说明”。

工具还会对照有公开说明的爬虫,展示 robots.txt 是否允许其抓取页面。但它不会向 AI 产品提问,不测量引用或推荐频率,不生成所谓“AI 可见度”分数,也不检查内容质量。它适合先排除基础技术与文件问题,不能代替论文实验,更不能保证获得引用、推荐或排名。