Orca 2:小型语言模型的推理能力提升之路
在人工智能领域,大型语言模型(如GPT-4、PaLm等)以其出色的推理能力而闻名,它们能够解答复杂问题、生成解释甚至解决需要多步推理的问题。然而,这些能力在小型语言模型中往往无法观察到。Orca 2模型的出现,打破了这一局限,证明了即使是10亿参数级别以下的小型模型也能通过改进的训练信号和方法达到增强的推理能力。
Orca 2模型概览
Orca 2在同类大小的模型中表现出色,甚至达到或超越了大5到10倍的模型水平。它有两种规模(7亿和13亿参数),都是通过对应的LLAMA 2基础模型进行微调,使用定制的高质量合成数据创建的。为了鼓励对小型语言模型的研究、评估和对齐,Orca 2模型已经开源。
模型参数
| 模型名称 | 参数数量 | 训练数据 | 基础模型 |
|---|---|---|---|
| Orca 2 (7B) | 7亿 | 定制合成数据 | LLAMA 2 (7B) |
| Orca 2 (13B) | 13亿 | 定制合成数据 | LLAMA 2 (13B) |
Orca 2的创新点
Orca 2的关键洞见在于,不同的任务可能会从不同的解决策略中受益,例如逐步处理、回忆后生成、回忆-推理-生成、提取-生成和直接回答。Orca 2通过一个扩展的、高度定制的合成数据集进行训练,这些数据教会了Orca 2各种推理技术,并教会它为不同任务选择不同的解决策略。
Orca 2的表现
为了评估Orca 2,我们使用了15个不同的基准测试,这些测试对应于大约100个任务和超过36,000个独特的测试用例。这些基准测试涵盖了语言理解、常识推理、多步推理、数学问题解决、阅读理解、总结、真实性和有害内容的生成与识别等多个方面。
性能比较
| 模型 | 任务类型 | 性能 |
|---|---|---|
| Orca 2 (7B) | 多项基准测试 | 与大型模型相当 |
| Orca 2 (13B) | 多项基准测试 | 超越同类模型 |
结论
Orca 2模型的研究为增强小型语言模型的推理能力提供了重要见解。通过使用定制的合成数据策略性地训练这些模型,我们实现了与大型模型相媲美甚至超越的性能水平,特别是在零样本推理任务中。Orca 2的成功在于它对多样化推理技术的应用,以及对各种任务最佳解决方案的识别。
尽管Orca 2有一些局限性,但它在小型模型的推理、专业化、控制和安全性方面的潜力是显而易见的。我们的研究强调了在需要平衡效率和能力的场景中,小型模型的价值。随着大型模型的持续发展,我们与Orca 2的工作标志着语言模型应用和部署选项多样化的重要一步。
参考网站: