DataLearner 标志

大型语言模型(LLM)的独特能力探索——谷歌最新论文

378 阅读

这是谷歌研究院最新的一篇论文,它主要探讨的是当前流行的大型语言模型的能力。它的出发点来自于诺贝尔奖获得者Philip Anderson经典的名言:量变引起质变。即在物理学、生物学或者是计算机科学中,当某些东西的规模超过一定限制的时候,会出现一些新的现象。就语言模型来说,当语言模型的规模超过一定临界值的时候,语言模型可能会出现新的能力。这种能力在小模型上根本无法被预测出来,它是大型模型独有的能力。

这篇论文就是尝试探索大型模型独有的,无法从小模型中被观察到或者被预测到的能力。他们将这个能力称为Emergent abilities。

首先,Emergent abilities经常出现在few-short prompted任务中(prompted任务就是指让下游任务适应预训练模型的NLP模型范式,参考Pre-train, Prompt, and Predict: A Systematic Survey of Prompting Methods in Natural Language Processing)。他们观察了很多大模型的性能曲线,发现当模型训练的FLOPs超过一定临界值的时候,效果突然变好,而在此之前,它的结果和随机猜差不多。


除了小样本的prompted任务,增强prompt策略也是大模型的Emergent abilities,从chain of thought prompting, instructions-based finetuning, scratchpad等任务看,模型的规模也会在超过临界值之后有了很好的提升。


研究者总结了他们发现的Emergent abilities


这篇论文的角度很有意思,推荐大家看看。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码