利用步骤回退问题提示技巧,将大语言模型的推理错误率降低10%
引言
大语言模型在回答一些简单问题时表现出色,比如”阳光明媚时天空是什么颜色?”。但面对”一天中不同时段天空的颜色如何变化?”这样需要多步推理的复杂问题时,它们的表现还有待提高。人类在回答此类问题时,会将推理过程分解成多个步骤,运用物理原理分别解释各种影响因素,最后再总结出一个满意的答案。这种多步推理是目前大语言模型面临的最大挑战之一。
什么是步骤回退问题?
在最近的一篇论文中,谷歌DeepMind的研究者提出询问”步骤回退问题”(step-back question)来改善模型的推理能力。所谓步骤回退问题,就是从原问题出发,提出一个更高抽象层次的问题。
还是以上面天空颜色的问题为例。它的一个步骤回退问题可以是:”天空可能呈现哪些颜色?”。作者认为,步骤回退问题之所以有效,是因为先回答它们通常能获得有用的抽象,而基于这些抽象推理出最终答案,有助于避免中间步骤出现错误。
如何使用步骤回退提示
论文建议分两个不同的步骤实施:
抽象:提示模型提出一个关于原问题所涉及概念的通用步骤回退问题,比如”解决这个问题涉及哪些物理原理?”。
推理:第二步中,模型被要求回答原问题。同时,给它提供第一步的步骤回退提示输出。作者将这一步称为”基于抽象的推理”(Abstraction-grounded Reasoning),因为模型可以利用高层概念或原理的信息来推理解决方案。
步骤回退结果中的错误分类
将使用步骤回退提示的结果与使用PaLM-2L模型的基线进行比较,发现该方法修正了20.5%的错误,同时引入了11.9%的新错误,净减少了10%的错误。
为了进一步了解模型犯的错误类型,研究者对错误输出进行了标注,分为五类:
| 错误类型 | 占比 |
|---|---|
| 推理错误 | 46.0% |
| 事实错误 | 25.4% |
| 数学错误 | 11.1% |
| 不完整 | 7.9% |
| 原理错误 | 9.5% |
其中四类错误(占比超过90%)发生在推理步骤中,只有不到10%的错误是由于模型在步骤回退提示时生成了错误的抽象(原理错误)导致的。可见推理仍然是瓶颈所在。
遗憾的是,论文没有比较使用和不使用步骤回退提示时的错误分布。不过,对于这样一个简单的方法来说,能够净减少10%的错误已经很了不起了。
结语
通过在复杂问题的推理过程中引入步骤回退问题,让语言模型先回答一个更高抽象层次的问题,可以一定程度上改善其推理表现,减少错误的发生。这种提示方式简单易用,值得在实际应用中加以尝试。
未来还需要更多研究来进一步提高语言模型的推理能力,尤其是在推理步骤这个关键环节上下功夫。只有不断突破瓶颈,语言模型才能真正胜任需要复杂推理的任务,发挥其应有的智能水平。让我们拭目以待。