DataLearner logo
Back to LLM blog list

Zephyr 7B Beta:Mistral微调新模型的技术解读

2023-10-29计算机科学人工智能自然语言处理深度学习模型微调

最近,Hugging Face公司发布了Zephyr 7B Beta,这是一款Mistral微调新模型,与之前的Chat Llama 70B模型在多个基准测试中表现相似,并在MT bench上表现优异。本文将深入解析这款新模型,对其训练过程、技术特点以及模型优化策略进行详细解读。

模型性能

在MT-Bench上,Zephyr Beta的得分为7.34,而Llama 2 Chat 70B的得分为6.86;在AlpacaEval上,Zephyr的胜率为90.6%,而Llama 2 Chat 70B的胜率为92.7%。这些结果表明,Zephyr Beta是一款非常优秀的模型。

模型训练

Zephyr Beta的训练过程非常有趣,其不仅包含了优秀的指标,还包含了一些独特的训练组件:

  • 使用了最好的小型开源预训练模型:Mistral 7B
  • 使用了大规模偏好数据集:UltraFeedback
  • 放弃RL,使用直接偏好优化(DPO)
  • 在偏好数据集上过拟合,却出奇地得到了更好的聊天结果

模型优化

Zephyr Beta的训练过程包含了三个阶段:

  1. 蒸馏监督微调(dSFT):构建一个大规模的、自我指导式的数据集(UltraChat),然后进行蒸馏SFT。
  2. AI反馈(AIF)收集:4个不同的LLMs生成补全,然后使用GPT-4对响应进行排名(UltraFeedback)。
  3. 蒸馏直接偏好优化(dDPO):我们对dSFT模型(来自步骤1)使用反馈数据(来自步骤2)进行DPO。DPO是一种替代PPO的方法,它去除了对奖励模型的需要。Zephyr beta训练了更多的DPO周期(比Zephyr alpha),从而得到了更好的聊天结果。

其他有趣的发现

  • 使用DPO进行过拟合可以根据所有基准测试得到更好的聊天模型
  • 我们进行了消融实验,以查看是否真的需要SFT和DPO。结论是:没有SFT的DPO会导致模型无法学习聊天模板。SFT + DPO产生最好的结果。
  • 对Zephyr Alpha的反馈是,存在错误的大小写(例如”Hi. how are you?”)和一些奇怪的回应前缀(例如”I don’t have personal X”),因此我们对此进行了一些额外的过滤。

以上就是对Zephyr 7B Beta模型的详细解读,希望能对您有所帮助。如果您对这方面的内容感兴趣,欢迎继续关注我们的后续文章。