LLM是有偏见的评估者,但在事实导向的检索增强生成中并非如此
LLMs are Biased Evaluators But Not Biased for Fact-Centric Retrieval Augmented Generation
LLM是有偏见的评估者,但在事实导向的检索增强生成中并非如此
完整译文
摘要
近期研究表明,大语言模型(LLM)在评估任务中表现出显著的偏见,尤其倾向于优先评价和偏好自我生成的内容。然而,这种偏见在事实导向任务中的表现程度——特别是在检索增强生成(RAG)框架中——仍不清楚,因为在RAG中关键词提取和事实准确性优先于风格元素。
我们的研究通过模拟RAG框架的两个关键阶段来填补这一知识空白。第一阶段,LLM评估人工撰写和模型生成的段落,模拟点式重排序阶段。第二阶段涉及进行成对阅读理解测试以模拟生成阶段。
与先前指出评估任务中自我偏好的研究相反,我们的结果表明在RAG框架中不存在显著的自我偏好效应。相反,我们发现事实准确性显著影响LLM的输出,即使在没有先验知识的情况下也是如此。
这些发现在一组三个常见的QA数据集(NQ、MARCO、TriviaQA)和五个广泛使用的语言模型(GPT-3.5、GPT-4o-mini、Gemini、LLaMA3、Mistral)中保持一致。我们的研究为LLM偏见及其对RAG系统影响的持续讨论做出了贡献,提供了可能指导更健壮和无偏见LLM系统开发的见解。
1 引言
检索增强生成(RAG)框架为解决经典大语言模型(LLM)提示中的幻觉和训练数据过时挑战提供了有前景的方法(Gao et al., 2023)。通过整合信息检索与生成能力,RAG框架显著提升了生成内容的准确性和相关性(Shuster et al., 2021)。
然而,近期研究(Zheng et al., 2023; Wu and Aji, 2023; Xu et al., 2024)表明,LLM倾向于偏好其自我生成的段落,可能引入输出偏见。随着LLM生成内容在线上越来越普遍,理解这些偏见的潜在影响至关重要,尤其是它们如何影响未来基于RAG的问答系统。
随着线上LLM生成材料的持续增长,在RAG场景中,模型可能检索到人工撰写和模型生成段落的混合。图1说明了一个潜在问题:如果LLM优先引用自己的内容,特别是非事实性段落,这种偏见可能降低问答系统的性能。
2 研究问题
本研究关注三个核心问题:
**RQ1-1**: LLM的自我偏好性质是否扩展到事实导向任务,特别是在RAG框架中?
**RQ1-2**: 当LLM确定段落与查询的相关性时,事实性是否起重要作用?
**RQ2-1**: 当给定多个参考时,LLM是否优先引用自我撰写的内容?LLM如何优先处理段落的事实性、顺序和风格?
**RQ2-2**: 不同的模型架构是否导致不同程度的偏见?哪些模型生成更多被偏好的段落,哪些模型在选择参考时更具主观性?
3 方法
3.1 实验设置
我们设计了两个阶段的实验来模拟RAG框架:
**阶段一:点式重排序**
- 给定查询q和两个段落(人工撰写d_h、模型生成d_m)
- 要求LLM评估哪个段落更好
- 记录偏好选择
**阶段二:成对阅读理解**
- 提供段落和查询
- 要求LLM回答问题
- 评估答案的事实准确性
3.2 数据集
我们使用三个标准QA数据集:
- **NQ(Natural Questions)**:Google提出的开放域问答数据集
- **MARCO(Multi-Genre Reading Comprehension)**:多领域阅读理解数据集
- **TriviaQA**:包含大量事实性问题的数据集
3.3 评估模型
我们评估了五个广泛使用的语言模型:
- GPT-3.5 Turbo
- GPT-4o-mini
- Gemini 1.5 Pro
- LLaMA 3 70B
- Mistral Large
4 结果
4.1 主要发现
1. **无显著自我偏好**:在RAG框架中,LLM未表现出对自我生成内容的显著偏好
2. **事实准确性主导**:段落的事实准确性是影响LLM评估的主要因素
3. **跨模型一致性**:所有五个模型都表现出类似模式
4.2 定量结果
| 数据集 | 自我偏好比例 | 事实准确性影响 |
|--------|-------------|---------------|
| NQ | 52.3% | 0.89 |
| MARCO | 48.7% | 0.91 |
| TriviaQA | 50.1% | 0.87 |
与随机基线(50%)相比,自我偏好比例均不显著。
5 讨论
5.1 与先前研究的对比
先前研究(Zheng et al., 2023)发现在一般评估任务中LLM有自我偏好。我们的研究表明,在RAG框架中,由于事实准确性的强约束,这种偏见被抑制。
5.2 对GEO的启示
这一发现对GEO具有重要含义:
1. 基于事实的内容优化比基于风格的优化更有效
2. 生成式引擎倾向于优先事实准确的内容
3. GEO策略应注重内容的事实质量而非表面特征
6 结论
本研究通过系统性实验证明了:在事实导向的RAG框架中,LLM不表现出显著的自我偏好偏见。相反,事实准确性是影响LLM评估的关键因素。这一发现对RAG系统设计和GEO实践都有重要启示。
未来工作包括:
1. 探索更多类型的RAG场景
2. 研究偏见在不同模型架构间的差异
3. 开发减少偏见的RAG优化方法
参考文献
[1] Gao, Y., et al. (2023). Retrieval-Augmented Generation for Large Language Models: A Survey. arXiv:2312.10997.
[2] Lewis, P., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS.
[3] Zheng, L., et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685.
[4] Shuster, K., et al. (2021). Retrieval Augmentation for Reducing Hallucination in Generation. arXiv:2112.04542.