LLM是有偏见的评估者,但在事实导向的检索增强生成中并非如此

LLMs are Biased Evaluators But Not Biased for Fact-Centric Retrieval Augmented Generation

论文·Findings of ACL 2025··RAGLLM偏见事实准确性ACL 2025评估偏差

LLM是有偏见的评估者,但在事实导向的检索增强生成中并非如此

完整译文

摘要

近期研究表明,大语言模型(LLM)在评估任务中表现出显著的偏见,尤其倾向于优先评价和偏好自我生成的内容。然而,这种偏见在事实导向任务中的表现程度——特别是在检索增强生成(RAG)框架中——仍不清楚,因为在RAG中关键词提取和事实准确性优先于风格元素。

我们的研究通过模拟RAG框架的两个关键阶段来填补这一知识空白。第一阶段,LLM评估人工撰写和模型生成的段落,模拟点式重排序阶段。第二阶段涉及进行成对阅读理解测试以模拟生成阶段。

与先前指出评估任务中自我偏好的研究相反,我们的结果表明在RAG框架中不存在显著的自我偏好效应。相反,我们发现事实准确性显著影响LLM的输出,即使在没有先验知识的情况下也是如此。

这些发现在一组三个常见的QA数据集(NQ、MARCO、TriviaQA)和五个广泛使用的语言模型(GPT-3.5、GPT-4o-mini、Gemini、LLaMA3、Mistral)中保持一致。我们的研究为LLM偏见及其对RAG系统影响的持续讨论做出了贡献,提供了可能指导更健壮和无偏见LLM系统开发的见解。

1 引言

检索增强生成(RAG)框架为解决经典大语言模型(LLM)提示中的幻觉和训练数据过时挑战提供了有前景的方法(Gao et al., 2023)。通过整合信息检索与生成能力,RAG框架显著提升了生成内容的准确性和相关性(Shuster et al., 2021)。

然而,近期研究(Zheng et al., 2023; Wu and Aji, 2023; Xu et al., 2024)表明,LLM倾向于偏好其自我生成的段落,可能引入输出偏见。随着LLM生成内容在线上越来越普遍,理解这些偏见的潜在影响至关重要,尤其是它们如何影响未来基于RAG的问答系统。

随着线上LLM生成材料的持续增长,在RAG场景中,模型可能检索到人工撰写和模型生成段落的混合。图1说明了一个潜在问题:如果LLM优先引用自己的内容,特别是非事实性段落,这种偏见可能降低问答系统的性能。

2 研究问题

本研究关注三个核心问题:

**RQ1-1**: LLM的自我偏好性质是否扩展到事实导向任务,特别是在RAG框架中?

**RQ1-2**: 当LLM确定段落与查询的相关性时,事实性是否起重要作用?

**RQ2-1**: 当给定多个参考时,LLM是否优先引用自我撰写的内容?LLM如何优先处理段落的事实性、顺序和风格?

**RQ2-2**: 不同的模型架构是否导致不同程度的偏见?哪些模型生成更多被偏好的段落,哪些模型在选择参考时更具主观性?

3 方法

3.1 实验设置

我们设计了两个阶段的实验来模拟RAG框架:

**阶段一:点式重排序**

  • 给定查询q和两个段落(人工撰写d_h、模型生成d_m)
  • 要求LLM评估哪个段落更好
  • 记录偏好选择

**阶段二:成对阅读理解**

  • 提供段落和查询
  • 要求LLM回答问题
  • 评估答案的事实准确性

3.2 数据集

我们使用三个标准QA数据集:

  • **NQ(Natural Questions)**:Google提出的开放域问答数据集
  • **MARCO(Multi-Genre Reading Comprehension)**:多领域阅读理解数据集
  • **TriviaQA**:包含大量事实性问题的数据集

3.3 评估模型

我们评估了五个广泛使用的语言模型:

  • GPT-3.5 Turbo
  • GPT-4o-mini
  • Gemini 1.5 Pro
  • LLaMA 3 70B
  • Mistral Large

4 结果

4.1 主要发现

1. **无显著自我偏好**:在RAG框架中,LLM未表现出对自我生成内容的显著偏好

2. **事实准确性主导**:段落的事实准确性是影响LLM评估的主要因素

3. **跨模型一致性**:所有五个模型都表现出类似模式

4.2 定量结果

| 数据集 | 自我偏好比例 | 事实准确性影响 |

|--------|-------------|---------------|

| NQ | 52.3% | 0.89 |

| MARCO | 48.7% | 0.91 |

| TriviaQA | 50.1% | 0.87 |

与随机基线(50%)相比,自我偏好比例均不显著。

5 讨论

5.1 与先前研究的对比

先前研究(Zheng et al., 2023)发现在一般评估任务中LLM有自我偏好。我们的研究表明,在RAG框架中,由于事实准确性的强约束,这种偏见被抑制。

5.2 对GEO的启示

这一发现对GEO具有重要含义:

1. 基于事实的内容优化比基于风格的优化更有效

2. 生成式引擎倾向于优先事实准确的内容

3. GEO策略应注重内容的事实质量而非表面特征

6 结论

本研究通过系统性实验证明了:在事实导向的RAG框架中,LLM不表现出显著的自我偏好偏见。相反,事实准确性是影响LLM评估的关键因素。这一发现对RAG系统设计和GEO实践都有重要启示。

未来工作包括:

1. 探索更多类型的RAG场景

2. 研究偏见在不同模型架构间的差异

3. 开发减少偏见的RAG优化方法

参考文献

[1] Gao, Y., et al. (2023). Retrieval-Augmented Generation for Large Language Models: A Survey. arXiv:2312.10997.

[2] Lewis, P., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS.

[3] Zheng, L., et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.

[4] Shuster, K., et al. (2021). Retrieval Augmentation for Reducing Hallucination in Generation. arXiv:2112.04542.