Zephyr 7B Beta:Mistral微调新模型的技术解读
2023-10-29计算机科学人工智能自然语言处理深度学习模型微调
最近,Hugging Face公司发布了Zephyr 7B Beta,这是一款Mistral微调新模型,与之前的Chat Llama 70B模型在多个基准测试中表现相似,并在MT bench上表现优异。本文将深入解析这款新模型,对其训练过程、技术特点以及模型优化策略进行详细解读。
模型性能
在MT-Bench上,Zephyr Beta的得分为7.34,而Llama 2 Chat 70B的得分为6.86;在AlpacaEval上,Zephyr的胜率为90.6%,而Llama 2 Chat 70B的胜率为92.7%。这些结果表明,Zephyr Beta是一款非常优秀的模型。
模型训练
Zephyr Beta的训练过程非常有趣,其不仅包含了优秀的指标,还包含了一些独特的训练组件:
- 使用了最好的小型开源预训练模型:Mistral 7B
- 使用了大规模偏好数据集:UltraFeedback
- 放弃RL,使用直接偏好优化(DPO)
- 在偏好数据集上过拟合,却出奇地得到了更好的聊天结果
模型优化
Zephyr Beta的训练过程包含了三个阶段:
- 蒸馏监督微调(dSFT):构建一个大规模的、自我指导式的数据集(UltraChat),然后进行蒸馏SFT。
- AI反馈(AIF)收集:4个不同的LLMs生成补全,然后使用GPT-4对响应进行排名(UltraFeedback)。
- 蒸馏直接偏好优化(dDPO):我们对dSFT模型(来自步骤1)使用反馈数据(来自步骤2)进行DPO。DPO是一种替代PPO的方法,它去除了对奖励模型的需要。Zephyr beta训练了更多的DPO周期(比Zephyr alpha),从而得到了更好的聊天结果。
其他有趣的发现
- 使用DPO进行过拟合可以根据所有基准测试得到更好的聊天模型
- 我们进行了消融实验,以查看是否真的需要SFT和DPO。结论是:没有SFT的DPO会导致模型无法学习聊天模板。SFT + DPO产生最好的结果。
- 对Zephyr Alpha的反馈是,存在错误的大小写(例如”Hi. how are you?”)和一些奇怪的回应前缀(例如”I don’t have personal X”),因此我们对此进行了一些额外的过滤。
以上就是对Zephyr 7B Beta模型的详细解读,希望能对您有所帮助。如果您对这方面的内容感兴趣,欢迎继续关注我们的后续文章。