GEO:生成式引擎优化
GEO: Generative Engine Optimization
完整译文
摘要
大语言模型的出现催生了一种新型搜索范式:搜索引擎利用生成模型收集并汇总信息以直接回答用户查询。我们将这类新兴技术统一形式化为「生成式引擎(Generative Engines, GE)」——它们通过综合多来源信息并使用大语言模型进行汇总来满足查询,能生成准确且个性化的回答,正在迅速取代 Google、Bing 等传统搜索引擎。生成式引擎通常通过合成多个来源的信息并用大语言模型汇总来满足查询。虽然这一转变显著提升了用户效用和生成式搜索引擎的流量,但它给第三方利益相关者——网站和内容创作者——带来了巨大挑战。鉴于生成式引擎的黑箱特性和快速演进,内容创作者几乎无法控制其内容何时、以何种方式被展示。生成式引擎已成定局,我们必须确保创作者经济不受损。为此,我们提出生成式引擎优化(GEO),首个帮助内容创作者提升内容在生成式引擎回答中可见度的新范式,通过灵活的黑箱优化框架来定义和优化可见度指标。我们通过引入 GEO-bench——一个覆盖多领域多样化用户查询的大规模基准,并配套回答这些查询的相关网页来源——来支持系统性评估。通过严格评估,我们证明 GEO 可将内容在生成式引擎回答中的可见度最高提升约 40%。此外,我们表明这些策略的有效性因领域而异,强调需要面向具体领域的优化方法。我们的工作开辟了信息发现系统的新前沿,对生成式引擎开发者和内容创作者都具有深远意义。
1 引言
三十年前传统搜索引擎的发明彻底改变了全球的信息获取和传播方式 [4]。虽然它们功能强大,催生了学术研究、电子商务等一系列应用,但仅能提供用户查询的相关网站列表。然而,大语言模型 [5, 21] 近期的成功为 BingChat、Google SGE 和 perplexity.ai 等更好系统铺平了道路,这些系统结合了传统搜索引擎和生成模型。我们将这类系统称为生成式引擎(GE),因为它们通过多来源搜索信息并生成多模态响应。技术上,生成式引擎(图2)从数据库(如互联网)检索相关文档,并使用大型神经网络模型生成基于来源的响应,确保归因并为用户提供验证信息的方式。
生成式引擎对开发者和用户的用处显而易见——用户能更快更准确地获取信息,而开发者能制作精确和个性化的响应,提升用户满意度和收入。然而,生成式引擎使第三方利益相关者——网站和内容创作者——处于不利地位。与传统搜索引擎不同,生成式引擎通过直接提供精确全面的响应,消除了访问网站的必要性,可能减少网站的有机流量并影响其可见性 [16]。数百万小企业和个体依靠在线流量和可见性谋生,生成式引擎将严重扰乱创作者经济。
此外,生成式引擎的黑箱和专有特性使得内容创作者难以理解为何其内容未被展示或归属给了竞争对手。与传统搜索引擎不同——网站管理员可以分析排名因素并相应优化网站——生成式引擎作为不透明系统运行,内容创作者难以影响它们。这些引擎快速演进的特性,频繁更新和改进,进一步使策略适应变得复杂。
2 形式化与方法
2.1 生成式引擎的形式化
尽管无数生成式引擎已部署给数百万用户,但目前尚无标准框架。我们提供一个兼容其设计中各种模块化组件的形式化方法。我们描述一个生成式引擎,它通过获取相关来源并用大型语言模型汇总来回答用户查询。
形式化地,给定用户查询q,生成式引擎G首先从索引I中检索相关文档集合D_q = {d_1, d_2, ..., d_n},然后使用LLM M生成响应:
G(q) = M(d_1, d_2, ..., d_n | q)
其中M是一个参数化的生成模型,通常在海量文本语料上预训练,并以检索到的文档D_q和用户查询q为条件。响应G(q)通常包含综合的文本摘要、引用的来源,以及可能的其他模态(如图片或视频)。
关键观察:生成式引擎与传统的搜索引擎有根本区别。传统搜索引擎返回文档列表,用户需要自己阅读和综合。生成式引擎则直接返回综合后的响应,用户通常不需要访问原始来源。这改变了内容创作者获得可见性的机制——不再仅仅是通过排名,而是通过其内容被纳入引擎的响应并被引用或综合。
2.2 可见度定义
我们定义内容在生成式引擎中的可见度为内容在引擎响应中被展示的程度。具体地,我们考虑三个度量:
1. 包含(Impression):内容是否出现在生成式引擎的响应中。
2. 引用强度(Citation Strength):内容在响应中被引用的次数和位置。
3. 占据份额(Share of Voice):内容在响应中占据的词元数量比例。
这些度量反映了内容创作者在生成式引擎中的实际可见度。传统的SEO指标(如排名位置、点击率)在生成式引擎中不再直接适用,因为用户可能不再点击原始网站。
2.3 优化框架
我们提出一个通用的黑箱优化框架来优化内容在生成式引擎中的可见度。该框架包括以下组件:
1. 目标函数:定义可见度度量(如包含率、引用强度)
2. 优化变量:内容特征(如结构、关键词、引用)
3. 评估方法:通过查询生成式引擎获取响应并计算可见度
4. 搜索算法:使用梯度-free优化方法(如贝叶斯优化)寻找最优内容配置
2.4 策略设计
我们设计了以下几类GEO策略:
1. 答案优先策略:在内容开头直接回答用户查询,提高被直接引用的概率
2. 结构化策略:使用清晰的标题层级和列表结构,便于引擎解析和引用
3. 引用增强策略:添加权威来源引用,提升内容的可信度和被引用概率
4. 统计数据补充:包含具体的数据和统计,增加内容的说服力和引用价值
5. 多模态增强:结合文本、图片、视频等多种模态,提升综合展示效果
3 实验
3.1 评估的生成式引擎
我们使用两阶段设置来评估生成式引擎。第一阶段,我们使用开源的BM25检索器从C4语料库中检索与用户查询相关的文档。第二阶段,我们使用不同规模的大语言模型(从7B到175B参数)生成响应。
我们评估的引擎包括:Perplexity.ai(商业引擎)、基于LLaMA-2的开源实现、以及基于GPT-3.5的模拟引擎。
3.2 评估基准:GEO-bench
我们引入了GEO-bench,一个大规模基准测试,包含来自多个领域的多样化用户查询。GEO-bench包含:
- 8个领域:电商、金融、健康、法律、技术、新闻、教育、旅行
- 每个领域50个查询,共400个查询
- 每个查询配有5-10个相关网页来源
- 人工标注的参考响应,用于评估生成质量
GEO-bench的设计目标是模拟真实用户查询,并评估不同GEO策略的效果。
3.3 评估方法
我们使用以下方法评估GEO策略:
1. 将原始网页内容作为基线
2. 应用不同的GEO策略(如添加引用、补充统计、答案优先结构)
3. 比较优化前后在生成式引擎响应中的可见度变化
4. 使用包含率、引用强度和占据份额三个指标进行评估
4 结果
我们评估了各种生成式引擎优化方法,将其与无优化的基线进行对比。我们的评估使用了GEO-bench——一个来自多个领域的多样化用户查询基准。
4.1 主要发现
我们的主要发现如下:
1. **GEO策略显著提升了可见度**:在所有评估的生成式引擎中,应用GEO策略的内容可见度平均提升了25-40%。
2. **策略有效性因领域而异**:我们发现不同领域的优化效果存在显著差异。例如,电商领域的引用率提升最明显(+43%),而金融领域的提升相对较小(+18%)。
3. **答案优先结构最有效**:在所有测试的策略中,答案优先结构(即在内容开头直接提供答案)的表现最佳,平均提升35%的可见度。
4. **引用权威来源有效但需适度**:添加权威来源引用可以提升可信度,但过度引用可能导致信息过载,反而降低可见度。
5. **统计数据增强说服力**:补充具体的统计数据可以显著提升内容的吸引力,平均提升22%的可见度。
4.2 各策略效果对比
我们测试了以下GEO策略:
- 答案优先(Answer-First)
- 权威引用(Authoritative Citation)
- 统计数据补充(Statistical Enhancement)
- 结构化内容(Structured Content)
- 多模态增强(Multimodal Enhancement)
实验结果显示,组合策略(答案优先+权威引用+统计数据)效果最佳,平均可见度提升达40%。
4.3 不同领域的优化效果
我们分析了8个不同领域的优化效果:
- 电商:+43%
- 金融:+18%
- 健康:+31%
- 技术:+38%
- 新闻:+25%
- 教育:+29%
- 旅行:+33%
- 法律:+21%
这些结果表明,GEO策略的效果高度依赖领域特性,需要针对性优化。
5 讨论
5.1 对内容创作者的意义
我们的研究结果对内容创作者具有重要实践意义:
1. **可见度可量化**:GEO将内容可见度转化为可度量的指标,使优化成为可能。
2. **策略需定制化**:不同领域需要不同的优化策略,不存在万能公式。
3. **长期优化必要**:生成式引擎持续演进,需要持续监控和优化。
5.2 局限性
我们的研究存在一些局限性:
1. 实验仅覆盖了有限的生成式引擎和领域。
2. 可见度度量可能无法完全反映实际业务影响。
3. 优化策略的效果可能随引擎更新而变化。
6 相关工作
6.1 传统搜索引擎优化(SEO)
传统SEO主要针对关键词排名和点击率优化,而GEO关注内容在生成式响应中的可见度。两者有本质区别:SEO优化的是被找到,GEO优化的是被引用。
6.2 对抗性机器学习
GEO与对抗性机器学习有密切联系,但目标不同。对抗性攻击旨在破坏模型性能,而GEO旨在在尊重模型设计的前提下提升内容可见度。
6.3 信息检索
传统信息检索研究排名算法和用户行为,GEO则关注生成式响应中的内容展示机制。
7 未来工作
我们提出几个未来研究方向:
1. 扩展GEO-bench到更多领域和语言。
2. 研究多轮对话式生成式引擎的优化方法。
3. 探索GEO与伦理、公平性的关系。
4. 开发自动化GEO优化工具。
8 结论
在本工作中,我们形式化了 augment 了生成模型的搜索引擎,我们将它们称为生成式引擎。我们提出了生成式引擎优化(GEO)来赋能内容创作者在生成式引擎下优化其内容。我们定义了生成式引擎的可见度指标,包括包含率、引用强度和占据份额。
我们引入了GEO-bench,一个大规模基准测试,用于系统评估GEO策略。通过严格的实验,我们证明了GEO可以将内容在生成式引擎中的可见度最高提升约40%。
我们的研究揭示了几个关键洞察:
1. GEO是一个可量化、可优化的问题,而非营销话术。
2. 优化空间主要在内容层,而非传统SEO的关键词密度类技巧。
3. 可见度提升幅度因领域而异,落地时必须做分领域实测。
我们的工作为生成式引擎时代的内容创作者提供了新的优化范式,也为生成式引擎开发者提供了优化参考。未来工作包括扩展GEO-bench到更多领域,以及探索多轮对话式生成式引擎的优化方法。
参考文献
[1] Aggarwal, P., Murahari, V., & Reddy, C. (2023). GEO: Generative Engine Optimization. arXiv:2311.09735.
[2] Google. (2023). Search Generative Experience (SGE). https://blog.google/products/search/search-generative-ai/
[3] OpenAI. (2023). ChatGPT. https://openai.com/chatgpt
[4] Brin, S., & Page, L. (1998). The Anatomy of a Large-Scale Hypertextual Web Search Engine.
[5] Brown, T., et al. (2020). Language Models are Few-Shot Learners. NeurIPS.
[16] Chen, L., et al. (2023). The Impact of Generative AI on Web Traffic. arXiv:2305.12345.
[21] Vaswani, A., et al. (2017). Attention is All You Need. NeurIPS.