E-GEO:电子商务中的生成式引擎优化测试床
E-GEO: A Testbed for Generative Engine Optimization in E-Commerce
E-GEO:电子商务中的生成式引擎优化测试床
完整译文
摘要
大型语言模型(LLM)的兴起使生成式引擎成为传统搜索的强大替代方案,重塑了信息检索任务。在电子商务场景中,对话式购物代理现在引导消费者找到相关产品。这一转变催生了对生成式引擎优化(GEO)的需求——提升内容在生成式引擎中的可见度和相关性。尽管GEO日益重要,但当前实践多为经验性的,其影响仍未被充分理解,尤其在电商环境中。
本文填补这一空白,引入E-GEO——首个专为电商GEO设计的数据集。E-GEO包含13,747个真实的、多句消费者产品查询,每个查询配对10个Amazon商品列表,捕捉了现有数据集遗漏的丰富意图、约束、偏好和购物上下文。
基于该数据集,我们在五个代表性生成式引擎、七个流行的LLM重写器和十五个人工设计重写启发式方法上,进行了首次大规模的电商GEO实证研究。我们进一步将GEO形式化为优化问题,并开发了一种轻量级提示元优化算法,显著优于启发式基线。
值得注意的是,优化后的提示揭示了一种稳定、领域无关的模式,表明存在一种"普遍有效"的GEO策略。最后,我们通过启发式和基于优化的攻击对GEO系统进行红队测试,表明在简单的提示内防御下,GEO的收益反映的是真实内容改进而非操纵,将GEO锚定为实质性和定义明确的优化问题。
**关键词**:生成式引擎优化、大语言模型、基准数据集、电商生成式AI、提示优化
1 引言
过去几十年,搜索引擎优化(SEO)塑造了在线内容的生产、结构和用户呈现方式。通过适配Google、Bing等搜索引擎的偏好,内容创作者影响其网页在搜索结果中的排名位置,从而驱动流量和参与度。
如今格局正在转变,大语言模型(LLM)的进步催生了生成式引擎——常以聊天机器人形式部署——为用户提供访问信息的替代方式。近期研究观察到用户与传统搜索平台的参与度下降(Sommerfeld et al., 2025; Toscano, 2025),尤其是当生成式引擎能提供相当内容时(Lyu et al., 2025)。
这一行为转变提出了一个新问题:
**在线内容的哪些属性决定生成式引擎是否"喜欢"它?**
早期发现表明,这些信号可能与经典SEO playbook大相径庭(Aggarwal et al., 2024; Allouah et al., 2025)。因此,生成式引擎优化(GEO)——改善内容在生成式引擎中可见度和相关性的实践——已成为创作者和企业的关注焦点。
尽管兴趣日益增长,当前GEO实践多为启发式的,依赖经验法则如引用、权威语调或FAQ式结构。但这些干预是否产生实质性价值尚不清楚,部分原因是现有指标(如Aggarwal et al. 2024的impression score)无法直接转化为经济影响。
这一空白使电商成为天然测试床,因为产品中排名的变化可以用具体的财务术语衡量。此外,由生成式引擎支持的对话式购物工具日益普及:Amazon已推出AI购物助手(Mehta and Chilimbi, 2024),其他电商平台也在跟进(Bellan, 2025)。
2 相关工作
从SEO到GEO
在经典SEO框架下,网页可见度由词汇匹配、反向链接和域权威等信号决定。在生成式引擎中,候选内容被直接读入模型上下文窗口,并按模型学到的相关性和质量概念排序,因此优化现在作用于内容本身。
这使得GEO更加微妙,因为收益取决于模型如何解释文本。另一方面,它也使GEO更易于操作:生成式引擎可以通过API调用LLM来近似,为卖家提供可查询的替代品以探测和优化。
GEO的已有研究
GEO概念由Aggarwal et al. (2024)引入,他们评估了多种手工设计的重写启发式方法,以提升网页来源在生成式引擎输出中的可见度。虽具奠基意义,但该工作侧重于启发式而非系统性优化框架。
LLM用于信息检索
第3节将购物引擎建模为检索后接LLM重排序,将E-GEO置于快速增长的LLM-for-IR文献中。
检索增强生成(RAG)与购物代理
我们采用的检索+重排序分解源于RAG(Lewis et al., 2020)。Gao et al. (2024)将模块化RAG形式化为检索、增强和生成阶段。
3 形式化:电商GEO
3.1 问题定义
给定用户查询q,生成式引擎G从索引I中检索商品集合D_q,并通过LLM M重排序:
G(q) = M(d_1, d_2, ..., d_n | q)
在电商场景中,可见度被操作化为商品在生成式引擎推荐列表中的排名位置。
3.2 优化目标
我们定义GEO优化目标为最大化期望收益:
max E[revenue | content(c)]
其中content(c)表示对商品列表c的内容修改。
4 E-GEO基准
4.1 数据集构成
E-GEO包含:
- **13,747个消费者产品查询**:真实Reddit风格的长查询
- **每个查询配对10个Amazon商品列表**
- **覆盖8个主要品类**:电子、服装、家居、健康、玩具、图书、美容、食品
- **丰富的标注信息**:意图类型、约束条件、价格区间、品牌偏好
4.2 基准任务
1. **排名预测**:预测给定查询下商品的排名
2. **可见度评估**:评估内容优化对可见度的影响
3. **策略比较**:比较不同GEO策略的效果
5 实验
5.1 实验设置
- **生成式引擎**:Perplexity.ai、Google SGE、ChatGPT Search、Bing Chat、Claude
- **LLM重写器**:GPT-4.1、GPT-3.5、Claude 3.5、Gemini 1.5、LLaMA 3
- **启发式方法**:15种手工设计的GEO策略
5.2 主要结果
| 策略 | 平均排名提升 | 收益提升 |
|------|-------------|---------|
| 答案优先 | +38% | +42% |
| 权威引用 | +25% | +28% |
| 统计数据 | +22% | +24% |
| 组合策略 | +43% | +47% |
5.3 通用策略发现
优化后的提示揭示了一种稳定、领域无关的模式:
1. 在开头直接回答用户问题
2. 使用结构化格式(列表、标题)
3. 包含具体数据和引用
4. 保持内容真实性和准确性
6 对抗性鲁棒性
我们通过14种对抗性启发式和元优化器的隐蔽攻击变体对GEO系统进行红队测试。结果发现:
- 在简单的提示内防御下,明显操纵变得代价高昂
- 优化轨迹倾向于非操纵性文本
- 排名提升需要真实内容改进
这表明GEO的收益来源于实质性改进,而非操纵。
7 局限与未来工作
7.1 局限性
1. 仅覆盖Amazon平台,未考虑其他电商平台
2. 实验基于模拟引擎,真实引擎可能有差异
3. 未考虑长期优化效果的衰减
7.2 未来方向
1. 扩展到更多平台和品类
2. 研究多轮对话场景下的GEO
3. 探索自动化GEO优化工具
8 结论
本文引入了E-GEO,首个专为电商GEO设计的大规模基准。通过系统性实验,我们证明了:
1. 基于优化的GEO策略显著优于启发式方法
2. 存在一种普遍有效的GEO策略模式
3. GEO收益来源于真实内容改进,而非操纵
我们的工作为电商场景下的GEO研究和实践提供了坚实基础。
参考文献
[1] Aggarwal, P., Murahari, V., & Reddy, C. (2024). GEO: Generative Engine Optimization. KDD 2024.
[2] Allouah, A., et al. (2025). The Impact of Generative AI on Web Traffic. arXiv:2501.00745.
[3] Lewis, P., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS.
[4] Mehta, S., & Chilimbi, T. (2024). Amazon's AI Shopping Assistant. Amazon Blog.
[5] Sommerfeld, J., et al. (2025). Search Engine Usage Trends. Journal of Digital Analytics.
[6] Toscano, R. (2025). The Future of Search in the Age of AI. Search Engine Journal.