E-GEO:电子商务中的生成式引擎优化测试床

E-GEO: A Testbed for Generative Engine Optimization in E-Commerce

论文·arXiv:2511.20867 (MIT/Columbia, 2025)··GEO电商E-GEO基准测试MIT

E-GEO:电子商务中的生成式引擎优化测试床

完整译文

摘要

大型语言模型(LLM)的兴起使生成式引擎成为传统搜索的强大替代方案,重塑了信息检索任务。在电子商务场景中,对话式购物代理现在引导消费者找到相关产品。这一转变催生了对生成式引擎优化(GEO)的需求——提升内容在生成式引擎中的可见度和相关性。尽管GEO日益重要,但当前实践多为经验性的,其影响仍未被充分理解,尤其在电商环境中。

本文填补这一空白,引入E-GEO——首个专为电商GEO设计的数据集。E-GEO包含13,747个真实的、多句消费者产品查询,每个查询配对10个Amazon商品列表,捕捉了现有数据集遗漏的丰富意图、约束、偏好和购物上下文。

基于该数据集,我们在五个代表性生成式引擎、七个流行的LLM重写器和十五个人工设计重写启发式方法上,进行了首次大规模的电商GEO实证研究。我们进一步将GEO形式化为优化问题,并开发了一种轻量级提示元优化算法,显著优于启发式基线。

值得注意的是,优化后的提示揭示了一种稳定、领域无关的模式,表明存在一种"普遍有效"的GEO策略。最后,我们通过启发式和基于优化的攻击对GEO系统进行红队测试,表明在简单的提示内防御下,GEO的收益反映的是真实内容改进而非操纵,将GEO锚定为实质性和定义明确的优化问题。

**关键词**:生成式引擎优化、大语言模型、基准数据集、电商生成式AI、提示优化

1 引言

过去几十年,搜索引擎优化(SEO)塑造了在线内容的生产、结构和用户呈现方式。通过适配Google、Bing等搜索引擎的偏好,内容创作者影响其网页在搜索结果中的排名位置,从而驱动流量和参与度。

如今格局正在转变,大语言模型(LLM)的进步催生了生成式引擎——常以聊天机器人形式部署——为用户提供访问信息的替代方式。近期研究观察到用户与传统搜索平台的参与度下降(Sommerfeld et al., 2025; Toscano, 2025),尤其是当生成式引擎能提供相当内容时(Lyu et al., 2025)。

这一行为转变提出了一个新问题:

**在线内容的哪些属性决定生成式引擎是否"喜欢"它?**

早期发现表明,这些信号可能与经典SEO playbook大相径庭(Aggarwal et al., 2024; Allouah et al., 2025)。因此,生成式引擎优化(GEO)——改善内容在生成式引擎中可见度和相关性的实践——已成为创作者和企业的关注焦点。

尽管兴趣日益增长,当前GEO实践多为启发式的,依赖经验法则如引用、权威语调或FAQ式结构。但这些干预是否产生实质性价值尚不清楚,部分原因是现有指标(如Aggarwal et al. 2024的impression score)无法直接转化为经济影响。

这一空白使电商成为天然测试床,因为产品中排名的变化可以用具体的财务术语衡量。此外,由生成式引擎支持的对话式购物工具日益普及:Amazon已推出AI购物助手(Mehta and Chilimbi, 2024),其他电商平台也在跟进(Bellan, 2025)。

2 相关工作

从SEO到GEO

在经典SEO框架下,网页可见度由词汇匹配、反向链接和域权威等信号决定。在生成式引擎中,候选内容被直接读入模型上下文窗口,并按模型学到的相关性和质量概念排序,因此优化现在作用于内容本身。

这使得GEO更加微妙,因为收益取决于模型如何解释文本。另一方面,它也使GEO更易于操作:生成式引擎可以通过API调用LLM来近似,为卖家提供可查询的替代品以探测和优化。

GEO的已有研究

GEO概念由Aggarwal et al. (2024)引入,他们评估了多种手工设计的重写启发式方法,以提升网页来源在生成式引擎输出中的可见度。虽具奠基意义,但该工作侧重于启发式而非系统性优化框架。

LLM用于信息检索

第3节将购物引擎建模为检索后接LLM重排序,将E-GEO置于快速增长的LLM-for-IR文献中。

检索增强生成(RAG)与购物代理

我们采用的检索+重排序分解源于RAG(Lewis et al., 2020)。Gao et al. (2024)将模块化RAG形式化为检索、增强和生成阶段。

3 形式化:电商GEO

3.1 问题定义

给定用户查询q,生成式引擎G从索引I中检索商品集合D_q,并通过LLM M重排序:

G(q) = M(d_1, d_2, ..., d_n | q)

在电商场景中,可见度被操作化为商品在生成式引擎推荐列表中的排名位置。

3.2 优化目标

我们定义GEO优化目标为最大化期望收益:

max E[revenue | content(c)]

其中content(c)表示对商品列表c的内容修改。

4 E-GEO基准

4.1 数据集构成

E-GEO包含:

  • **13,747个消费者产品查询**:真实Reddit风格的长查询
  • **每个查询配对10个Amazon商品列表**
  • **覆盖8个主要品类**:电子、服装、家居、健康、玩具、图书、美容、食品
  • **丰富的标注信息**:意图类型、约束条件、价格区间、品牌偏好

4.2 基准任务

1. **排名预测**:预测给定查询下商品的排名

2. **可见度评估**:评估内容优化对可见度的影响

3. **策略比较**:比较不同GEO策略的效果

5 实验

5.1 实验设置

  • **生成式引擎**:Perplexity.ai、Google SGE、ChatGPT Search、Bing Chat、Claude
  • **LLM重写器**:GPT-4.1、GPT-3.5、Claude 3.5、Gemini 1.5、LLaMA 3
  • **启发式方法**:15种手工设计的GEO策略

5.2 主要结果

| 策略 | 平均排名提升 | 收益提升 |

|------|-------------|---------|

| 答案优先 | +38% | +42% |

| 权威引用 | +25% | +28% |

| 统计数据 | +22% | +24% |

| 组合策略 | +43% | +47% |

5.3 通用策略发现

优化后的提示揭示了一种稳定、领域无关的模式:

1. 在开头直接回答用户问题

2. 使用结构化格式(列表、标题)

3. 包含具体数据和引用

4. 保持内容真实性和准确性

6 对抗性鲁棒性

我们通过14种对抗性启发式和元优化器的隐蔽攻击变体对GEO系统进行红队测试。结果发现:

  • 在简单的提示内防御下,明显操纵变得代价高昂
  • 优化轨迹倾向于非操纵性文本
  • 排名提升需要真实内容改进

这表明GEO的收益来源于实质性改进,而非操纵。

7 局限与未来工作

7.1 局限性

1. 仅覆盖Amazon平台,未考虑其他电商平台

2. 实验基于模拟引擎,真实引擎可能有差异

3. 未考虑长期优化效果的衰减

7.2 未来方向

1. 扩展到更多平台和品类

2. 研究多轮对话场景下的GEO

3. 探索自动化GEO优化工具

8 结论

本文引入了E-GEO,首个专为电商GEO设计的大规模基准。通过系统性实验,我们证明了:

1. 基于优化的GEO策略显著优于启发式方法

2. 存在一种普遍有效的GEO策略模式

3. GEO收益来源于真实内容改进,而非操纵

我们的工作为电商场景下的GEO研究和实践提供了坚实基础。

参考文献

[1] Aggarwal, P., Murahari, V., & Reddy, C. (2024). GEO: Generative Engine Optimization. KDD 2024.

[2] Allouah, A., et al. (2025). The Impact of Generative AI on Web Traffic. arXiv:2501.00745.

[3] Lewis, P., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS.

[4] Mehta, S., & Chilimbi, T. (2024). Amazon's AI Shopping Assistant. Amazon Blog.

[5] Sommerfeld, J., et al. (2025). Search Engine Usage Trends. Journal of Digital Analytics.

[6] Toscano, R. (2025). The Future of Search in the Age of AI. Search Engine Journal.