DataLearner logo
Back to LLM blog list

Orca 2:小型语言模型的巨大飞跃

2023-11-21人工智能语言模型Orca 2计算机科学

在人工智能领域,大型语言模型(Large Language Models,LLMs)如GPT-4、PaLM等因其出色的推理能力而备受瞩目。然而,这些模型的庞大体积使得它们在某些场景下的应用受到限制。最近,一个名为Orca 2的小型语言模型(Small Language Models,SLMs)的研究成果引起了广泛关注。本文将详细介绍Orca 2模型的特点、价值以及它在推理任务上的表现。

模型概述

Orca 2是对小型语言模型能力探索的最新成果,它具有7亿至13亿的参数量。通过改进的训练信号和方法,Orca 2在小型模型中实现了通常只有在大型模型中才能找到的增强推理能力。

模型参数

模型名称 参数量
Orca 2 7亿参数
Orca 2 13亿参数

Orca 2在相似大小的模型(包括原始的Orca模型)中表现出色,并在零样本设置下对复杂任务进行了评估,其性能水平与大型模型相似或更好。

训练和数据

Orca 2通过在高质量的合成数据上微调相应的LLAMA 2基模型而创建。这些训练数据是为了教会Orca 2各种推理技巧,如逐步处理、回忆后生成、回忆-推理-生成、提取-生成和直接回答方法,同时教会它为不同任务选择不同的解决策略。

性能评估

为了评估Orca 2,我们使用了一套涵盖约100个任务和超过36,000个独特测试用例的15个多样化基准测试。这些基准测试包括语言理解、常识推理、多步骤推理、数学问题解决、阅读理解、概括、基于事实的推理、真实性和有害内容的生成与识别等方面。

性能对比

模型 参数量 语言理解 常识推理 多步骤推理 数学问题解决
Orca 2 (7B) 7亿参数
Orca 2 (13B) 13亿参数
LLaMA-2-Chat 13亿参数
WizardLM 13亿参数

Orca 2的初步结果表明,其性能显著超过了相似大小的模型,并且达到了至少比其大10倍的模型的性能水平。

结论

Orca 2模型的研究为提高小型语言模型的推理能力提供了重要的见解。通过使用定制的合成数据策略性地训练这些模型,我们实现了与大型模型相当或超越的性能水平,特别是在零样本推理任务中。Orca 2在多样化的推理技术应用和为各种任务识别最佳解决方案方面取得了成功。尽管它有一些限制,包括继承自其基模型的限制,但Orca 2在未来进步的潜力是显而易见的,特别是在改进推理、专业化、控制和小型模型的安全性方面。精心筛选的合成数据用于后期训练,这成为这些改进的关键策略。

我们的研究强调了在需要平衡效率和能力的场景中小型模型的价值。随着大型模型继续表现出色,我们与Orca 2的工作标志着语言模型应用和部署选项多样化的重要一步。

阅读Orca 2论文