大型语言模型(LLMs)在处理长文本时面临的挑战,尤其是推理成本随着序列长度的增加而呈二次方增长,这导致了在实际应用中的部署成本高昂。此外,LLMs还会出现“分心现象”,即无关的上下文会降低输出质量。
为了解决这些问题,提出了一种新的检索增强生成(RAG)提示方法——超位置提示(superposition prompting),该方法可以直接应用于预训练的基于Transformer的LLMs,无需进行微调。
路径缓存(Path Caching):通过缓存键值(KV)嵌入来加速推理,这样在在线服务阶段可以重用预先计算的KV缓存,而不是原始的输入标记序列。 路径并行化(Path Parallelization):由于超位置提示中的路径是相互独立的,可以并行计算它们的KV缓存和logits,从而减少用户感知的响应时间。
图2超位置提示与传统的(Naive LLM-RAG)提示范式的比较。正方形代表一个标记(token),箭头表示注意力依赖关系。传统的方法是“链表”风格的有向无环图(DAG),而超位置提示则安排标记依赖关系,使得所有文档都能独立处理。由于这种依赖结构,可以轻松地利用LLM的logits来剪枝无关的上下文,从而提高长上下文推理的能力。这种依赖结构还允许更快的提示处理,因为有了新的缓存和KV缓存及logit计算的并行性机会(每个灰色框表示LLM处理的一个逻辑“批次”,重用上游KV缓存)。
图3在“在线服务”期间必须计算的内隐注意力依赖关系((b)-(f)中的颜色对应于图2中的标记段颜色)。注意各种优化如何通过剪枝、预计算和并行化工作来减轻在线服务时所需的计算负担。值得再次强调的是,在实践中,推理不是对一个大型序列的稀疏注意力,而是对许多不同较短标记段的密集注意力。
Superposition Prompting: Improving and Accelerating Retrieval Augmented Generationhttps://arxiv.org/pdf/2404.06910.pdf
