强化学习模型的效果与模型大小的关系——强化学习模型的缩放规律
近几年,研究人员发现模型的规模与效果之间有着明显的关系,类似transformers模型,被认为是在某种条件下规模越大,模型效果越好。这些缩放法则大多涉及测试损失对数据集大小、神经网络参数数量或训练计算量的依赖性。观察到的缩放规律在许多数量级上的稳健性导致了大型模型的产生,其参数数量达到数百亿和数千亿。
到目前为止,幂律扩展的证据大部分来自监督学习方法。在强化学习算法的扩展方面所做的努力要少得多。这篇论文的作者主要研究了强化学习领域模型的缩放规律。

作者设计了一系列实验来证明模型的规模与效果之间的关系。
最终,研究确定了使用AlphaZero算法的代理性能存在幂律扩展。对于所研究的两个棋盘游戏,即 “四连棋 “和 “五连棋”,我们观察到了与神经语言模型中发现的相似的缩放规律。我们指出,Elo分数的对数比例意味着游戏实力的幂律,这种关系被公式(5)所捕捉,可以用来预测游戏结果。我们表明,AlphaZero代理被训练到收敛,在没有可用计算量限制的情况下,取得的Elo分数与各自的神经网络参数数量的对数成正比。
表明,神经网络参数的最佳数量是以计算量的幂数来扩展的,其指数可以从其他两个扩展规律中推导出来。这个缩放模型特别重要,因为它允许人们通过使用一个最佳规模的神经网络,在给定的训练预算的限制下实现最大的性能。我们显示出最佳的训练在收敛之前就已经停止了,这与迄今为止最先进的模型所做的不同。因此,就过去的应用而言,我们的结果意味着性能可以从网络规模的显著增加中受益。最后,我们观察到,具有较大神经网络的代理总是比较小的模型有更高的数据效率,这对于具有昂贵数据生成的强化学习研究来说可能很重要。我们发现值得注意的是,在语言和其他监督学习模型中常见的缩放规律也存在于最重要的MARL模型中。这种缩放行为可能是其他强化学习算法所共有的,这将提供一个优化其资源分配的机会。
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
