探索深度学习的新边界:Google DeepMind团队打造最长上下文窗口模型
在最近的技术博客中,Google DeepMind团队宣布了其下一代模型Gemini 1.5的发布。这款模型不仅在速度和效率上有显著提升,更引入了一个革命性的特性——长上下文窗口。本文将深入探讨长上下文窗口的概念、重要性以及这一突破性特性如何帮助开发者。
什么是长上下文窗口?
长上下文窗口是指AI模型在一次处理中能够回忆和处理的信息量——即令牌(tokens)的数量。令牌是构成信息的最小单元,可以是单词的一部分、图像、视频等。长上下文窗口对AI模型来说至关重要,因为它们帮助模型在会话中回忆信息,就像人类在交谈中记住对方的名字或者刚刚听到的电话号码一样。
Gemini 1.5的创新之处
Gemini 1.5的前身最多能处理32,000个令牌,而1.5 Pro——我们发布的首个1.5模型,用于早期测试——其上下文窗口高达100万个令牌,是迄今为止所有大规模基础模型中最长的上下文窗口。事实上,研究团队甚至在研究中成功测试了高达1000万个令牌。上下文窗口越长,模型能够接收和处理的文本、图像、音频、代码或视频就越多。
研究和开发的进展
Google DeepMind的研究科学家Nikolay Savinov表示,最初的目标是实现128,000个令牌的上下文,他提议将目标设为100万个令牌,而现在研究已经超过了这个目标的10倍。为了实现这一飞跃,团队进行了一系列深度学习的创新。工程师Denis Teplyashin解释说,一项突破带来了另一项突破,每一项都开辟了新的可能性,当它们叠加在一起时,团队惊讶地发现了模型的新能力。
应用实例
1.5 Pro能够处理的原始数据为模型与用户的交互开辟了全新的方式。例如,它可以一次性总结数千页长的文档,分析数万行代码。研究科学家Machel Reid分享了一些测试案例,包括模型为整个代码库编写文档,以及在观看完整部45分钟的电影《夏洛克·福尔摩斯》后,能够准确回答有关电影的问题。
长上下文窗口的扩展应用
1.5 Pro还能够跨数据进行推理。Machel提到了一个有关Kalamang语言的例子——这是一种世界上不到200人使用的稀有语言,模型在提供了一整套语法手册和一些例句后,能够学会将英语翻译成Kalamang语,水平相当于人类从同样内容学习。
向未来迈进
目前,1.5 Pro标配128K令牌的上下文窗口,但限定的开发者群体和企业客户可以通过AI Studio和Vertex AI以私有预览的形式尝试高达100万令牌的上下文窗口。完整的100万令牌上下文窗口在计算上非常密集,团队正在积极优化以提高响应速度,并计划在未来进行扩展。
团队还在不断努力使模型更快更高效,并以安全为核心。他们还在寻求进一步扩展长上下文窗口,改进底层架构,并整合新的硬件改进。Nikolay表示,目前模型已经接近Tensor Processing Units的热限,未来随着硬件的持续改进,模型可能会有更大的潜力。
结语
团队对于开发者和更广泛社区能够实现的体验感到兴奋。Machel表示,当他第一次看到模型拥有100万个令牌的上下文时,他的第一个问题是:“这能用来做什么?”但现在,人们的想象力正在扩展,他们将找到越来越多创新的方式来使用这些新能力。