DataLearner logo
Back to LLM blog list

利用步骤回退问题提示技巧,将大语言模型的推理错误率降低10%

2024-04-21大语言模型推理能力步骤回退问题提示工程错误分析

引言

大语言模型在回答一些简单问题时表现出色,比如”阳光明媚时天空是什么颜色?”。但面对”一天中不同时段天空的颜色如何变化?”这样需要多步推理的复杂问题时,它们的表现还有待提高。人类在回答此类问题时,会将推理过程分解成多个步骤,运用物理原理分别解释各种影响因素,最后再总结出一个满意的答案。这种多步推理是目前大语言模型面临的最大挑战之一。

什么是步骤回退问题?

在最近的一篇论文中,谷歌DeepMind的研究者提出询问”步骤回退问题”(step-back question)来改善模型的推理能力。所谓步骤回退问题,就是从原问题出发,提出一个更高抽象层次的问题。

还是以上面天空颜色的问题为例。它的一个步骤回退问题可以是:”天空可能呈现哪些颜色?”。作者认为,步骤回退问题之所以有效,是因为先回答它们通常能获得有用的抽象,而基于这些抽象推理出最终答案,有助于避免中间步骤出现错误。

如何使用步骤回退提示

论文建议分两个不同的步骤实施:

  1. 抽象:提示模型提出一个关于原问题所涉及概念的通用步骤回退问题,比如”解决这个问题涉及哪些物理原理?”。

  2. 推理:第二步中,模型被要求回答原问题。同时,给它提供第一步的步骤回退提示输出。作者将这一步称为”基于抽象的推理”(Abstraction-grounded Reasoning),因为模型可以利用高层概念或原理的信息来推理解决方案。

步骤回退结果中的错误分类

将使用步骤回退提示的结果与使用PaLM-2L模型的基线进行比较,发现该方法修正了20.5%的错误,同时引入了11.9%的新错误,净减少了10%的错误。

为了进一步了解模型犯的错误类型,研究者对错误输出进行了标注,分为五类:

错误类型 占比
推理错误 46.0%
事实错误 25.4%
数学错误 11.1%
不完整 7.9%
原理错误 9.5%

其中四类错误(占比超过90%)发生在推理步骤中,只有不到10%的错误是由于模型在步骤回退提示时生成了错误的抽象(原理错误)导致的。可见推理仍然是瓶颈所在。

遗憾的是,论文没有比较使用和不使用步骤回退提示时的错误分布。不过,对于这样一个简单的方法来说,能够净减少10%的错误已经很了不起了。

结语

通过在复杂问题的推理过程中引入步骤回退问题,让语言模型先回答一个更高抽象层次的问题,可以一定程度上改善其推理表现,减少错误的发生。这种提示方式简单易用,值得在实际应用中加以尝试。

未来还需要更多研究来进一步提高语言模型的推理能力,尤其是在推理步骤这个关键环节上下功夫。只有不断突破瓶颈,语言模型才能真正胜任需要复杂推理的任务,发挥其应有的智能水平。让我们拭目以待。