论文题目:LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens论文链接:https://arxiv.org/pdf/2402.13753.pdfGithub:https://github.com/microsoft/LongRoPE
论文介绍了一种名为LongRoPE的方法,它首次将预训练的大型语言模型(LLMs)的上下文窗口扩展到2048k个标记,同时在保持原始短上下文窗口性能的同时,仅需要1k步的微调。这一成就是通过三个关键创新实现的:
通过有效搜索识别和利用位置插值中的两种非均匀性,包括RoPE维度和标记位置的变化,为微调提供了更好的初始化,并在非微调情况下实现了8倍的扩展。 引入了一种渐进式扩展策略,首先对长度为256k的LLM进行微调,然后在微调后的扩展LLM上进行第二次位置插值,以实现2048k的上下文窗口。 在8k长度上重新调整LongRoPE,以恢复短上下文窗口的性能。在扩展到非常长的上下文窗口后,可能会发现模型在原始较短的上下文窗口内的性能有所下降。为了解决这个问题,可以对扩展后的模型进行额外的调整,以恢复在较短上下文窗口内的性能。这可能涉及到对位置嵌入(RoPE)的重缩放因子进行优化,以适应不同的上下文长度。
LongRoPE无需额外的微调,训练时的上下文窗口大小为 128k 和 256k,有效地扩展到了极长的 2048k 上下文大小
在 Hugging Face Open LLM 基准测试中,长上下文LLMs与原始 LLaMA2 和 Mistral 的比较。
