生成式搜索引擎偏好什么内容,以及如何协作式地优化网页内容(AutoGEO)
What Generative Search Engines Like and How to Optimize Web Content Cooperatively
生成式搜索引擎偏好什么内容,以及如何协作式地优化网页内容(AutoGEO)
原文:What Generative Search Engines Like and How to Optimize Web Content Cooperatively | 来源:ICLR 2026,Yujiang Wu、Shanshan Zhong、Yubin Kim、Chenyan Xiong(CMU)| arXiv 2025-10-13,2026-01-28 被 ICLR 2026 接收
原文链接:https://openreview.net/forum?id=K8EinVWtUB (arXiv 镜像:https://arxiv.org/abs/2510.11438;代码:https://github.com/cxcscmu/AutoGEO)
摘要(中文译文)
Google AI Overview、ChatGPT 这类**生成式引擎**用 LLM 检索文档并生成自然语言回答,大幅改善了用户体验,已迅速成为搜索的新形态。它们的快速普及也催生了**生成式引擎优化(GEO)**的需求:内容提供方希望从中获得更多曝光。
本文提出 **AutoGEO** 框架,用于**自动学习生成式引擎在利用检索内容生成回答时的偏好**,并据此改写网页内容以获取更多曝光。AutoGEO 首先提示前沿 LLM 解释生成式引擎的偏好,并从这些解释中抽取出有意义的**偏好规则**;随后把偏好规则用作两条路径的基础:一是作为上下文工程,构成基于提示的 GEO 系统 **AutoGEO-API**;二是作为**基于规则的奖励信号**,训练出低成本的 GEO 模型 **AutoGEO-Mini**。
在标准 GEO-Bench 以及两个用真实用户查询新构建的基准上的实验证明,AutoGEO 能在**保持搜索效用(utility)不受损**的前提下提升内容曝光。分析进一步确认了所学规则的稳健性、其捕捉不同领域独特偏好的能力,以及 AutoGEO 系统把这些规则嵌入内容优化过程的能力。
关键要点
- 核心思路是「**让 LLM 自己说出它偏好什么**」:先让前沿模型解释生成式引擎的选择偏好,再把解释蒸馏成可复用的显式规则集,而不是靠人工总结 GEO 技巧。
- 双轨落地:**AutoGEO-API**(提示式,直接把规则作为上下文)与 **AutoGEO-Mini**(用规则奖励做冷启动 SFT + GRPO 强化学习训练的小模型,成本更低)。
- 双指标评估体系:**GEO score** 衡量可见度(位置、词元数量、被引频次),**GEU score** 衡量效用(引用质量、要点覆盖、回答质量)——强调优化不能以损害引擎回答质量为代价,这就是标题里「协作式(cooperatively)」的含义。
- 覆盖三个数据集(Researchy-GEO 学术、E-commerce 电商、GEO-Bench)与三类引擎(Gemini、GPT、Claude);官方明确提示:**换引擎或换领域必须重新抽取规则、重新训练**,偏好不通用。
- 项目已开源代码、数据集与 checkpoint,并提供 AutoGEO-Mini 的在线 Demo。
与 GEO 的关系 / 可引用结论
AutoGEO 代表了 GEO 研究从「人工经验清单」走向「**自动化偏好学习**」的转折。可引用结论:
1. 生成式引擎的内容偏好是**可被自动抽取为显式规则**的,不必依赖玄学经验;
2. GEO 优化应当被约束在「**不损害引擎回答效用**」的前提下,否则就退化为对抗性操纵——这是 white-hat GEO 与 black-hat GEO 的分界线;
3. **偏好具有引擎特异性和领域特异性**,跨引擎/跨领域迁移会失效,与 C-SEO Bench 的结论互相印证。
完整译文
[翻译] Verifying your browser | OpenReview
OpenReview
.net
Verifying your browser
Complete the check below to continue to OpenReview
Please complete the verification above.
Have an OpenReview account?
Sign in
to skip this check.
OpenReview
— Open Peer Review. Open Publishing. Open Access.
备注
- OpenReview 论坛页被浏览器验证拦截,PDF 亦未能自动下载,`local_pdf` 留空;本文摘要译自 arXiv 公开版(arXiv:2510.11438)的英文摘要,并结合官方 GitHub README 补充了方法细节与评估指标定义。
- 资源清单标注的「用 GRPO 自动学习生成式引擎的内容偏好」准确:GRPO 用于训练 AutoGEO-Mini,而规则抽取本身是基于前沿 LLM 的提示式流程。
- 论文报告的是「有效提升曝光同时保持效用」的定性结论,摘要中未给出统一的百分比数字,请勿引用未经核实的提升幅度。