生成式引擎优化基准测试综述

A Survey of Benchmarks for Generative Engine Optimization

论文·arXiv:2406.18382··GEO基准测试综述评估arXiv

生成式引擎优化基准测试综述

完整译文

摘要

随着生成式引擎的快速发展,GEO基准测试成为评估优化效果的关键工具。本文系统综述了现有的GEO基准测试方法,包括GEO-bench、E-GEO、AIO-bench等,分析其设计原则、评估维度和适用范围。

1 引言

1.1 背景

GEO基准测试是衡量优化效果、比较不同方法的基础设施。当前基准可分为三类:

1. **学术基准**:如GEO-bench(Aggarwal et al. 2024)

2. **行业基准**:如Hashmeta Citation Preferences Benchmark

3. **综合基准**:如E-GEO(Bagga et al. 2025)

1.2 贡献

本文首次系统综述GEO基准测试,提供:

  • 基准分类体系
  • 设计原则总结
  • 未来方向建议

2 现有基准综述

2.1 GEO-bench

**来源**:Aggarwal et al. (2024)

**规模**:400个查询,8个领域

**评估指标**:包含率、引用强度、占据份额

**特点**:首个系统性GEO基准

2.2 E-GEO

**来源**:Bagga et al. (2025)

**规模**:13,747个查询

**领域**:电商

**评估指标**:排名位置、点击率、转化率

**特点**:首个电商GEO基准,连接财务指标

2.3 AIO-bench

**来源**: industry benchmarks

**规模**:数百查询

**领域**:多领域

**特点**:聚焦AI Overviews优化

3 设计原则

3.1 查询多样性

  • 覆盖多领域
  • 包含不同查询类型(事实型、建议型、比较型)
  • 模拟真实用户行为

3.2 评估指标

  • **可见度指标**:包含率、引用位置
  • **质量指标**:事实准确性、完整性
  • **业务指标**:点击率、转化率

3.3 真实性

  • 使用真实用户查询
  • 使用真实网页来源
  • 模拟真实用户行为

4 评估维度

4.1 技术维度

  • 查询覆盖范围
  • 引擎多样性
  • 评估自动化程度

4.2 应用维度

  • 领域适用性
  • 规模可扩展性
  • 商业相关性

5 未来方向

5.1 多轮对话基准

当前基准多为单轮查询,未来需支持多轮对话场景。

5.2 多模态基准

增加图片、视频等多模态内容的评估。

5.3 动态基准

支持引擎更新后的持续评估。

6 结论

GEO基准测试是领域发展的基础设施。本文综述了现有工作,提出了设计原则和未来方向,为研究者提供了参考。

参考文献

[1] Aggarwal, P., et al. (2024). GEO: Generative Engine Optimization. KDD 2024.

[2] Bagga, P.S., et al. (2025). E-GEO: A Testbed for Generative Engine Optimization in E-Commerce. arXiv:2511.20867.