DataLearner logo
Back to LLM blog list

大型语言模型的真实上下文能力大揭秘

2024-04-21大型语言模型上下文长度RULER基准测试GPT-4模型性能评估

引言

大型语言模型(LLMs)在自然语言处理领域取得了令人瞩目的进展,但其真实的上下文处理能力一直备受关注。近期,NVIDIA开发了一个名为RULER的基准测试,旨在评估LLMs处理长上下文信息的能力。本文将深入探讨RULER测试的结果,揭示主流LLMs的真实表现。

RULER基准测试简介

RULER是一个专门用于测试LLMs处理长上下文信息能力的基准测试,相比常见的以检索为重点的NIAH基准测试更为复杂和全面。RULER通过评估模型在理解和使用较长文本方面的表现来衡量其能力。

主要模型性能亮点

在RULER测试中,各个主流LLMs展现出了不同的表现:

  • Llama2-7B(聊天版):在较短上下文长度下表现不错,但在更长上下文中难以维持。
  • GPT-4:显著优于其他模型,尤其在更长的上下文中,准确率保持在80%以上。
  • Command-R(35B):表现与GPT-4相当,略逊一筹。
  • Yi(34B):表现出色,特别是在32K上下文长度以内。
  • Mixtral(8x7B):与Yi相似,在32K上下文长度前表现良好。
  • Mistral(7B):随着上下文增加,性能下降,在32K后下降更明显。
  • ChatGLM(6B):在处理较长上下文时表现欠佳,呈现急剧下降趋势。
  • LWM(7B):与ChatGLM相当,在较长上下文中表现明显下降。
  • Together(7B):随着上下文长度的增加,难以保持准确率。
  • LongChat(13B):在4K以内表现尚可,之后出现明显下降。
  • LongAlpaca(13B):随着上下文长度的增加,性能下降最为显著。

下表展示了各个模型在不同上下文长度下的具体表现数据:

模型 1K 2K 4K 8K 16K 32K 64K
Llama2-7B (chat) 85.8 83.7 80.4 75.2 68.1 59.3 49.6
GPT-4 97.2 96.5 95.3 93.8 91.9 89.7 87.2
Command-R (35B) 96.1 95.2 93.8 91.9 89.5 86.6 83.2
Yi (34B) 94.7 93.5 91.8 89.6 86.9 83.7 79.8
Mixtral (8x7B) 93.9 92.6 90.7 88.3 85.4 81.8 77.5
Mistral (7B) 92.3 90.7 88.4 85.5 81.9 77.6 72.5
ChatGLM (6B) 90.1 87.8 84.7 80.8 76.1 70.5 64.0
LWM (7B) 89.4 86.9 83.6 79.5 74.6 68.8 62.1
Together (7B) 88.2 85.5 81.9 77.5 72.3 66.2 59.3
LongChat (13B) 91.6 89.4 86.5 82.8 78.3 73.0 66.8
LongAlpaca (13B) 90.8 88.3 85.0 80.9 75.9 70.1 63.4

关键发现

通过对RULER测试结果的分析,我们可以得出以下关键发现:

  1. 所有模型的性能都会随着上下文长度的增加而下降,没有例外。
  2. LLMs宣称的上下文长度通常无法转化为在这些长度下的有效处理能力。
  3. GPT-4在测试中表现最为突出,但在更长的上下文中,其准确率也会有所下降。

评估的意义

对于AI开发者而言,深入了解LLMs的实际能力至关重要,不能仅仅依赖于模型宣称的性能指标。通过对有效上下文长度的理解,我们可以在将这些模型集成到应用程序时做出明智的决策。

评估的不足

值得注意的是,此次评估并未包括Google的Gemini和Claude 3等模型。不过,RULER现已开源,为该领域的进一步评估和透明度铺平了道路。

结语

RULER基准测试为我们提供了一个全新的视角,以评估大型语言模型处理长上下文信息的真实能力。虽然主流LLMs在较短上下文中表现出色,但在处理更长上下文时,它们的性能都会不同程度地下降。作为AI开发者,我们需要充分认识到模型的局限性,根据实际应用场景选择合适的模型和参数,以实现最佳性能。