生成式引擎优化基准测试综述
A Survey of Benchmarks for Generative Engine Optimization
生成式引擎优化基准测试综述
完整译文
摘要
随着生成式引擎的快速发展,GEO基准测试成为评估优化效果的关键工具。本文系统综述了现有的GEO基准测试方法,包括GEO-bench、E-GEO、AIO-bench等,分析其设计原则、评估维度和适用范围。
1 引言
1.1 背景
GEO基准测试是衡量优化效果、比较不同方法的基础设施。当前基准可分为三类:
1. **学术基准**:如GEO-bench(Aggarwal et al. 2024)
2. **行业基准**:如Hashmeta Citation Preferences Benchmark
3. **综合基准**:如E-GEO(Bagga et al. 2025)
1.2 贡献
本文首次系统综述GEO基准测试,提供:
- 基准分类体系
- 设计原则总结
- 未来方向建议
2 现有基准综述
2.1 GEO-bench
**来源**:Aggarwal et al. (2024)
**规模**:400个查询,8个领域
**评估指标**:包含率、引用强度、占据份额
**特点**:首个系统性GEO基准
2.2 E-GEO
**来源**:Bagga et al. (2025)
**规模**:13,747个查询
**领域**:电商
**评估指标**:排名位置、点击率、转化率
**特点**:首个电商GEO基准,连接财务指标
2.3 AIO-bench
**来源**: industry benchmarks
**规模**:数百查询
**领域**:多领域
**特点**:聚焦AI Overviews优化
3 设计原则
3.1 查询多样性
- 覆盖多领域
- 包含不同查询类型(事实型、建议型、比较型)
- 模拟真实用户行为
3.2 评估指标
- **可见度指标**:包含率、引用位置
- **质量指标**:事实准确性、完整性
- **业务指标**:点击率、转化率
3.3 真实性
- 使用真实用户查询
- 使用真实网页来源
- 模拟真实用户行为
4 评估维度
4.1 技术维度
- 查询覆盖范围
- 引擎多样性
- 评估自动化程度
4.2 应用维度
- 领域适用性
- 规模可扩展性
- 商业相关性
5 未来方向
5.1 多轮对话基准
当前基准多为单轮查询,未来需支持多轮对话场景。
5.2 多模态基准
增加图片、视频等多模态内容的评估。
5.3 动态基准
支持引擎更新后的持续评估。
6 结论
GEO基准测试是领域发展的基础设施。本文综述了现有工作,提出了设计原则和未来方向,为研究者提供了参考。
参考文献
[1] Aggarwal, P., et al. (2024). GEO: Generative Engine Optimization. KDD 2024.
[2] Bagga, P.S., et al. (2025). E-GEO: A Testbed for Generative Engine Optimization in E-Commerce. arXiv:2511.20867.