GPT4-V:大模型技术中图像与文本结合的探索
在最近的一次关于大模型技术的讨论中,研究者们在尝试分析GPT-4 Vision (GPT4-V) 模型的功能以及图像处理方面的策略。通过分析GPT4-V关于图像处理的计费规则,我们可以大致推测该模型的内部架构与运作方式。
GPT4-V 图像处理与计费策略
通过查看GPT4-V模型的计费规则,我们可以发现以下几点有趣的地方:
- 用户根据处理图像的像素数来支付费用,即每张图片需要处理的token数。这意味着GPT4-V在处理输入时,并未将OCR的结果附加到GPT4的输入端。
- 无论图像大小如何,该模型都包含85个基础token。这可能意味着整个图像会通过一个视觉编码器进行处理并得到85个token。然而,85这个数字比较奇怪,并不是2的幂次方,也没有方便的平方数。为什么会有85个基础token呢?我们不妨大胆猜测,也许是为了迷惑我们?
- 图像会被切割成512x512的图块,每个图块转换为170个token。这里的170是否=13*13+1呢?可能他们采用了某种OCR技术,预计会产生的平均token数是170。但这意味着GPT4-V并不能很好地处理图像中的细节(它只有85个全局token)。考虑到OpenAI的实力,他们不太可能采用这种两阶段处理流程。
- GPT4-V能够准确从图像中识别出文本。
基于以上观察,我们猜测该模型使用了一个强大的视觉编码器来处理85个基本token,并对512x512的图块使用了一个轻量级的编码器,主要的计算过程发生在GPT4内部。
从GPT4-V反推模型架构
从GPT4-V模型中,我们可以看出它具有将图像处理与文本处理相结合的能力。这说明其内部必然有一个视觉编码器,将图像映射为GPT4可处理的token。结合前述讨论,我们猜测可能采用了类似于fuyu-8b的架构。在该架构中,图像被切割成多个patch映射为token,然后自然而然地与文本token一起进行处理。
根据讨论者们的推理,在GPT4-V中,512x512的图块以类似于fuyu-8b的方式编码,从而解释了170 = 13*13+1这一结论。这里的“1”可能就是分隔符token。
虽然我们已经根据讨论内容探讨了GPT4-V的内部图像处理机制,但我们仍需注意,这些只是讨论的探索性猜测,并非官方公布的架构信息。具体的模型实施可能还包括其他的非token相关费用,但这并不妨碍我们从这些讨论找寻一些思路与灵感。我们有时候可以通过分析模型的表现以及计费策略来反推其内部的运作过程,进而加深对模型的理解。
总的来说,本文通过探讨GPT4-V模型的图像处理计费策略以及结合图像与文本处理技术的结论,尝试从这个角度分析模型的架构设计。虽然这些结论并非官方公布,但这些讨论可以为我们提供一些关于大模型技术的新思路。我们应该关注这些模型的内部机制,加深对它们的理解,从而为未来的研究打下基础。