DataLearner 标志
DE

DeepSeek-R1

推理大模型DeepSeek R1DeepSeek R1

DeepSeek-R1

发布时间: 2025-01-20更新于: 2025-03-21浏览量: 1,897
在线体验GitHubHugging Face对比
模型参数
6710亿
上下文长度
128K
多语言支持
支持
推理能力
暂无数据

DeepSeek-R1 是由 DeepSeek-AI 发布的 AI 模型,发布时间为 2025-01-20,定位为 推理大模型,参数规模约为 6710亿,上下文长度为 128K,模型文件大小约 134GB,采用 MIT License 许可,在 Creative Writing 上取得 1500.00 分。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

DeepSeek-R1

模型基本信息

推理过程
支持
思考模式
不支持思考模式
上下文长度
128K tokens
最大输出长度
暂无数据
模型类型
推理大模型
输入/输出模态
文本 → 文本
发布时间
2025-01-20
模型文件大小
134GB
MoE架构
否
总参数 / 激活参数
6710亿 / 不适用
知识截止
暂无数据
DeepSeek-R1

开源和体验地址

代码开源状态
预训练权重开源
MIT License- 免费商用授权
GitHub 源码
暂无
在线体验
暂无
DeepSeek-R1

官方介绍与博客

DeepSeek-R1

API接口信息

接口速度
暂无数据
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.550/ 1M tokens$2.19/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-$0.550/ 1M tokens$0.140/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

DeepSeek-R1

评测结果

DeepSeek-R1 当前已收录的代表性评测结果包括 MMLU(8 / 124,得分 90.80)、MMLU-Pro(40 / 175,得分 84)、MATH-500(14 / 46,得分 97.30)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
90.80
8 / 124
MMLU-Pro
常规模式
84
40 / 175

抽象归纳与泛化

共 1 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
常规模式
15.80
163 / 176

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
71.50
170 / 253
CritPt
思考模式
0.60
172 / 204

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
30.10
24 / 46

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式
49.20
98 / 116

数学

共 4 项评测
评测名称 / 模式
得分
排名/总数
MATH-500
常规模式
97.30
14 / 46
AIME 2024
常规模式
79.80
28 / 61
AIME2025
常规模式
70
81 / 110
3.80
22 / 24

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
65.90
64 / 125

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1500
57 / 113

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
30.90
78 / 96

自主开发与终端任务

共 2 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
思考模式
56.90
25 / 59
Terminal Bench Hard
思考模式工具
6.10
204 / 244

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
思考模式
38.30
114 / 134

客服与业务流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
τ³-Banking
思考模式工具
6.40
147 / 167

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
常规模式工具
36.49
49 / 52

跨长文理解与整合

共 1 项评测
评测名称 / 模式
得分
排名/总数
Fiction.liveBench
常规模式
69.40
11 / 16

逻辑与规划

共 1 项评测
评测名称 / 模式
得分
排名/总数
BALROG
常规模式工具
34.90
8 / 12

能力边界度量

共 1 项评测
评测名称 / 模式
得分
排名/总数
METR Time Horizons v1.1
常规模式工具
26.93
21 / 22

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
思考模式
2.40
109 / 122

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
138.98
100 / 167
DeepSeek-R1

发布机构

DeepSeek-R1

模型解读

DeepSeekAI发布的推理大模型,是接近OpenAI o1推理大模型的开源版本,完全免费开源,性能强悍,是基于DeepSeek R1 Zero基础上微调后得到的。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码