大模型领域新讨论:自我托管小型LLM与运行GPT-4的成本比较
2023-10-20大模型GPT-4LLM自我托管成本比较
随着大型模型如GPT-4的日益普及,不少人对其成本表示关注。另一方面,自主托管的小型LLM(如Falcon-7B和Mistral-7B)在某些场景中也展现出较高的性价比。本文旨在对比这两种模型的成本,并为用户提供决策时的参考信息。
1. GPT-4的成本
GPT-4的成本计算相对直观,以一个完整的上下文窗口为例,其成本大约为0.30/1k tokens。其中,8192的上下文窗口的提示tokens需要0.03/1k,完成tokens需要$0.06/1k。
2. 自主托管小型LLM的成本
基本计算
首先,自主托管的主要成本在于GPU服务器。假设我们使用的是@LambdaAPI的H100服务器,小时费用为$2。之前的测试中,使用Falcon-7B模型,在4090上的性能大约是44.1 tokens/sec。虽然H100的性能会更好,但为了简化计算,我们使用此数字。
基于上述数据,小时tokens数为158,760,所以成本为(2/小时) / (158,760 tokens/小时) = ~0.013/1k tokens。
优势
- 成本效益:即使在效率只有10%的情况下,其成本也只是GPT-4的30%左右。
- 特定任务的适应性:如果有一个狭窄的任务,可以对类似Mistral-7B这样的模型进行微调,那么强烈建议选择自主托管。
劣势
- 扩展性:按需付费在扩展时可能更有效。
- 模型限制:上述的模型只有2k的上下文窗口,并不是最有效的模型。例如,Mistral可能在成本/令牌方面的性能更好。
- 维护成本:部分节省的成本可能会用于维护。
3. 总结
从上述对比中可以看出,对于特定的需求和场景,自主托管的小型LLM可能具有更高的性价比。但同时也要考虑到模型的限制和维护成本。建议用户根据自己的具体需求进行选择。
注意:以上计算是基于特定的数据和假设,可能存在一定的误差。