DataLearner 标志
ST

Stanford Alpaca

基础大模型

Stanford Alpaca

发布时间: 2023-03-13更新于: 2023-12-28浏览量: 268
在线体验GitHubHugging Face对比
模型参数
70亿
上下文长度
2K
多语言支持
暂无数据
推理能力
暂无数据

Stanford Alpaca 是由 Stanford CRFM 发布的 AI 模型,发布时间为 2023-03-13,定位为 基础大模型,参数规模约为 70亿,上下文长度为 2K,模型文件大小约 14GB,采用 开源不可商用 许可。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Stanford Alpaca

模型基本信息

推理过程
暂无数据
思考模式
不支持思考模式
上下文长度
2K tokens
最大输出长度
暂无数据
模型类型
基础大模型
输入/输出模态
暂无数据
发布时间
2023-03-13
模型文件大小
14GB
MoE架构
总参数 / 激活参数
70亿 / 不适用
知识截止
暂无数据
Stanford Alpaca

开源和体验地址

代码开源状态
预训练权重开源
开源不可商用- 不可商用
Hugging Face
暂无
在线体验
暂无
Stanford Alpaca

官方介绍与博客

Stanford Alpaca

API接口信息

接口速度
暂无数据
暂无公开的 API 定价信息。
Stanford Alpaca

发布机构

Stanford Alpaca

模型解读

斯坦福大学发布的Stanford-Alpaca则是基于70亿参数版本的LLaMA做微调的模型,使用了5.2万的instruction-following数据。基于初步的人工判断,该模型的效果与OpenAI的text-davinci-003水平差不多。微调70亿参数的LLaMA花了大约3个小时,使用了8个80GB的A100显卡。而这些在云上的费用不足100美金,因此相当低廉!

Stanford Alpaca提供了一种非常低成本提高模型对话能力的方法。同时,基于MetaAI开源的LLaMA做的开源版本也显示了强大的水平。这证明了,采用高精度的指令数据集也是可以将模型提高到一个很好的水平。而Stanford Alpaca也启示了很多后续模型的开发。

Alpaca使用如下参数对LLaMA-7B和LLaMA-13B的模型进行微调

超参数LLaMA-7BLLaMA-13B
批次大小128128
学习速率2e-51e-5
Epochs35
Max length512512
Weight decay00

目前,Stanford-Alpaca还在开发中,但是已经引起了很多人的关注。但是,本次项目的开源需要被MetaAI允许,所以目前仅提供在线测试版本:https://alpaca-ai-custom6.ngrok.iol/

该项目目前发布仅仅12个小时,已经在GitHub上获得了1.6K的star了,速度惊人!

项目GitHub地址:https://github.com/tatsu-lab/stanford_alpaca
官方博客地址:https://crfm.stanford.edu/2023/03/13/alpaca.html

---------------2023/4/4更新---------------

目前,Stanford Alpaca已经开源了相关的数据集和代码,主要包括

52K用于微调模型的数据集: https://github.com/tatsu-lab/stanford_alpaca#data-release 

用于生成数据的代码: https://github.com/tatsu-lab/stanford_alpaca#data-generation-process 

模型微调代码: https://github.com/tatsu-lab/stanford_alpaca#fine-tuning 

在线演示地址: https://crfm.stanford.edu/alpaca/ 

不过Alpaca模型的预训练结果目前还没有发布,根据官方博客的消息,该预训练结果将在近日发布。

基础模型

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码