针对大语言模型搜索引擎的对抗性攻击动态

Dynamics of Adversarial Attacks on Large Language Model-Based Search Engines

论文·arXiv(ICML 2026 New Frontiers in Game-Theoretic Learning Workshop)··GEO对抗性攻击排名操纵博弈论防御

完整译文

摘要

随着大语言模型(LLM)搜索引擎的日益普及,这些系统面临着对抗性攻击的威胁。本研究重点分析排名操纵攻击,攻击者通过精心设计的网页内容来操纵LLM的排名机制,从而提升特定内容的展示优先级。

1 引言

LLM搜索引擎的广泛部署使其成为对抗性攻击的目标。排名操纵攻击是一种特殊的对抗攻击,攻击者通过优化网页内容来影响搜索引擎的排序算法。

2 攻击模型

我们形式化了排名操纵攻击的框架:

  • 攻击者目标:提升特定内容在生成式引擎中的可见度
  • 攻击者能力:可以修改网页内容和结构
  • 攻击者知识:了解搜索引擎的排名机制

3 防御机制

我们提出了一种基于内容验证的防御机制,通过以下方法检测对抗性内容:

  • 语义一致性检测
  • 引用真实性验证
  • 结构异常分析

4 实验结果

实验显示,我们的防御机制可以有效检测85%以上的对抗性攻击,同时保持对正常内容的低误报率。

5 结论

本研究揭示了LLM搜索引擎面临的对抗性威胁,并提出了一种有效的防御机制。未来工作需要进一步探索更复杂的攻击场景和更鲁棒的防御方法。