大型语言模型的真实上下文能力大揭秘
2024-04-21大型语言模型上下文长度RULER基准测试GPT-4模型性能评估
引言
大型语言模型(LLMs)在自然语言处理领域取得了令人瞩目的进展,但其真实的上下文处理能力一直备受关注。近期,NVIDIA开发了一个名为RULER的基准测试,旨在评估LLMs处理长上下文信息的能力。本文将深入探讨RULER测试的结果,揭示主流LLMs的真实表现。
RULER基准测试简介
RULER是一个专门用于测试LLMs处理长上下文信息能力的基准测试,相比常见的以检索为重点的NIAH基准测试更为复杂和全面。RULER通过评估模型在理解和使用较长文本方面的表现来衡量其能力。
主要模型性能亮点
在RULER测试中,各个主流LLMs展现出了不同的表现:
- Llama2-7B(聊天版):在较短上下文长度下表现不错,但在更长上下文中难以维持。
- GPT-4:显著优于其他模型,尤其在更长的上下文中,准确率保持在80%以上。
- Command-R(35B):表现与GPT-4相当,略逊一筹。
- Yi(34B):表现出色,特别是在32K上下文长度以内。
- Mixtral(8x7B):与Yi相似,在32K上下文长度前表现良好。
- Mistral(7B):随着上下文增加,性能下降,在32K后下降更明显。
- ChatGLM(6B):在处理较长上下文时表现欠佳,呈现急剧下降趋势。
- LWM(7B):与ChatGLM相当,在较长上下文中表现明显下降。
- Together(7B):随着上下文长度的增加,难以保持准确率。
- LongChat(13B):在4K以内表现尚可,之后出现明显下降。
- LongAlpaca(13B):随着上下文长度的增加,性能下降最为显著。
下表展示了各个模型在不同上下文长度下的具体表现数据:
| 模型 | 1K | 2K | 4K | 8K | 16K | 32K | 64K |
|---|---|---|---|---|---|---|---|
| Llama2-7B (chat) | 85.8 | 83.7 | 80.4 | 75.2 | 68.1 | 59.3 | 49.6 |
| GPT-4 | 97.2 | 96.5 | 95.3 | 93.8 | 91.9 | 89.7 | 87.2 |
| Command-R (35B) | 96.1 | 95.2 | 93.8 | 91.9 | 89.5 | 86.6 | 83.2 |
| Yi (34B) | 94.7 | 93.5 | 91.8 | 89.6 | 86.9 | 83.7 | 79.8 |
| Mixtral (8x7B) | 93.9 | 92.6 | 90.7 | 88.3 | 85.4 | 81.8 | 77.5 |
| Mistral (7B) | 92.3 | 90.7 | 88.4 | 85.5 | 81.9 | 77.6 | 72.5 |
| ChatGLM (6B) | 90.1 | 87.8 | 84.7 | 80.8 | 76.1 | 70.5 | 64.0 |
| LWM (7B) | 89.4 | 86.9 | 83.6 | 79.5 | 74.6 | 68.8 | 62.1 |
| Together (7B) | 88.2 | 85.5 | 81.9 | 77.5 | 72.3 | 66.2 | 59.3 |
| LongChat (13B) | 91.6 | 89.4 | 86.5 | 82.8 | 78.3 | 73.0 | 66.8 |
| LongAlpaca (13B) | 90.8 | 88.3 | 85.0 | 80.9 | 75.9 | 70.1 | 63.4 |
关键发现
通过对RULER测试结果的分析,我们可以得出以下关键发现:
- 所有模型的性能都会随着上下文长度的增加而下降,没有例外。
- LLMs宣称的上下文长度通常无法转化为在这些长度下的有效处理能力。
- GPT-4在测试中表现最为突出,但在更长的上下文中,其准确率也会有所下降。
评估的意义
对于AI开发者而言,深入了解LLMs的实际能力至关重要,不能仅仅依赖于模型宣称的性能指标。通过对有效上下文长度的理解,我们可以在将这些模型集成到应用程序时做出明智的决策。
评估的不足
值得注意的是,此次评估并未包括Google的Gemini和Claude 3等模型。不过,RULER现已开源,为该领域的进一步评估和透明度铺平了道路。
结语
RULER基准测试为我们提供了一个全新的视角,以评估大型语言模型处理长上下文信息的真实能力。虽然主流LLMs在较短上下文中表现出色,但在处理更长上下文时,它们的性能都会不同程度地下降。作为AI开发者,我们需要充分认识到模型的局限性,根据实际应用场景选择合适的模型和参数,以实现最佳性能。