检索增强生成(RAG)通常用于修复幻觉并为大型语言模型(LLMs)提供最新知识。然而,当LLM单独回答问题时如果回答错误,提供正确的检索内容是否总能纠正错误?相反,当检索到的内容不正确时,LLM是否知道忽略错误的信息,还是会重蹈覆辙?
为了回答这些问题,斯坦福大学的研究人员系统地分析了LLM的内部知识(即其先验)与检索到的信息之间的拉锯战,特别是在它们不一致的情况下:
在有和没有参考文档的数据集上测试了GPT-4和其他LLMs的问答能力。如预期的那样,提供正确的检索信息能够修正大多数模型错误(准确度达到94%)。
当参考文档被越来越多的错误值干扰时,如果LLM的内部先验较弱,它更有可能重复错误的修改信息,但如果其先验较强,则更具抵抗力。
修改后的信息与模型先验的偏差越大,模型越不可能偏好它。
上述结果突出了模型的先验知识和参考文档中呈现的信息之间存在的一种潜在的紧张关系。
数据集(Dataset)
一致性(Concordance)
修改检索到的文档
为每个数据集生成修改后的文档的示意图。向LLM提出一个问题,同时提供和不提供一个包含与查询相关信息的参考文档。然后,这个文档被扰乱以包含修改后的信息,并作为上下文提供给LLM。接着,观察LLM是偏好修改后的信息还是它自己的先验答案。
RAG与模型先验的比较分析
分析不同提示策略的效果
LLM在没有上下文的情况下生成的答案与参考答案一致的比例平均只有34.7%。 通过引入RAG,一致性显著提高到了94%,表明RAG在鼓励模型遵循检索到的内容方面非常有效。 然而,在少数情况下,当提供检索内容无法纠正LLM时,模型仍有大约20%的情况会简单地回应其原始的先验答案。
模型的先验答案的令牌概率与其相关的RAG偏好率之间存在一致的负相关关系。 通过将概率分成十个等距的区间,研究者发现不同的斜率(范围从-0.1到-0.45),表明RAG在不同问答领域的有效性相对容易受到模型内部先验知识信心的影响。 斜率为-0.45意味着每当模型的先验响应概率增加10%,LLM偏好上下文信息的可能性就会减少4.5%。
还考虑了模型的先验响应与检索上下文中的值之间的偏离程度。 分析显示了类似的模式:随着RAG值偏离模型的先验,模型更不可能采纳RAG值而非其自己的初始响应。 通过将数据分为上下半百分位数,观察到在所有六个数据集中,低概率先验响应的RAG偏好率单调低于高概率响应令牌。
为了评估特定提示技术对RAG依从性的影响,在GPT-4上测试了两种额外的提示修改:"Strict"(严格)和"Loose"(宽松)。 "Strict"提示旨在强制模型严格遵循检索到的上下文,而"Loose"提示则鼓励模型在回应前对检索到的上下文进行推理。 "Strict"提示的RAG依从性普遍高于标准提示,而"Loose"提示随着先验概率的增加,RAG依从性降低得更多。
使用GPT-3.5和Mistral-7B进行相同分析时,观察到在先验一致性和RAG方面的性能显著低于GPT-4。 尽管如此,这些模型仍然显示出与GPT-4相同的负趋势。
图5:使用GPT-4(蓝色)、GPT-3.5(橙色)和Mistral-7B(绿色)对RAG偏好率与先验概率和偏差进行的分析。请参见图2以获取完整图表描述。值得注意的是,一些模型对于某些数据集没有生成任何有意义的先验响应(由于拒绝、不当响应等原因),因此无法进行分析。
How faithful are RAG models? Quantifying the tug-of-war between RAG and LLMs’ internal priorhttps://arxiv.org/pdf/2404.10198.pdf
