DataLearner 标志
DE

DeepSeek-R1-0528

推理大模型DeepSeek R1DeepSeek R1

DeepSeek-R1-0528

发布时间: 2025-05-28更新于: 2025-08-08浏览量: 2,789
模型参数
6710亿
上下文长度
64K
多语言支持
支持
推理能力
4/5

DeepSeek-R1-0528 是由 DeepSeek-AI 发布的 AI 模型,发布时间为 2025-05-28,定位为 推理大模型,参数规模约为 6710亿,上下文长度为 64K,模型文件大小约 685GB,采用 MIT License 许可,在 Creative Writing 上取得 1418.80 分。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

DeepSeek-R1-0528

模型基本信息

推理过程
支持
思考模式
思考模式 (默认)
上下文长度
64K tokens
最大输出长度
64K tokens
模型类型
推理大模型
输入/输出模态
文本 → 文本
发布时间
2025-05-28
模型文件大小
685GB
MoE架构
是
总参数 / 激活参数
6710亿 / 370亿
知识截止
暂无数据
DeepSeek-R1-0528

开源和体验地址

代码开源状态
预训练权重开源
MIT License- 免费商用授权
在线体验
DeepSeek-R1-0528

官方介绍与博客

DataLearnerAI博客
暂无
DeepSeek-R1-0528

API接口信息

接口速度
2/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$1.35/ 1M tokens$5.40/ 1M tokens
批量模式
类型适用条件输入输出
文本-$0.675/ 1M tokens$2.70/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-$1.35/ 1M tokens$0.680/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

DeepSeek-R1-0528

评测结果

DeepSeek-R1-0528 当前已收录的代表性评测结果包括 MMLU-Pro(28 / 175,得分 85)、MATH-500(8 / 46,得分 98)、AIME 2024(13 / 61,得分 91.40)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMLU-Pro
思考模式
85
28 / 175
HLE
思考模式
17.70
169 / 235

抽象归纳与泛化

共 2 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
思考模式
21.20
157 / 176
ARC-AGI-2
思考模式
1.30
151 / 164

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
思考模式
81
122 / 253
CritPt
思考模式
1.40
139 / 204

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
思考模式
27.80
27 / 46

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
思考模式
57.60
86 / 116

数学

共 5 项评测
评测名称 / 模式
得分
排名/总数
MATH-500
思考模式
98
8 / 46
AIME 2024
思考模式
91.40
13 / 61
AIME2025
思考模式
87.50
49 / 110
IMO-ProofBench
思考模式
29
7 / 16
3.80
22 / 24

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
思考模式
73.30
49 / 125

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1418.80
59 / 106

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
思考模式
71.40
15 / 59
Terminal Bench Hard
思考模式工具
15.90
165 / 244
Terminal-Bench
思考模式
5.70
35 / 35

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
思考模式
40.80
68 / 96

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
141.30
91 / 167
DeepSeek-R1-0528

发布机构

DeepSeek-R1-0528

模型解读

DeepSeek R1-0528 于 2025 年 5 月 28 日发布,是深度求索 R1 系列推理模型的最新更新,定位为开源 AI 领域的竞争者。本文基于 Hugging Face、OSCHINA、IT之家、cnBeta 和其他权威来源,详细分析其规格、性能、能力和上下文因素。

发布细节与可用性

模型于 2025 年 5 月 28 日在 Hugging Face 上发布,采用 MIT 许可证,确保完全开源,可用于研究和商业应用。发布时无官方公告,描述为“小版本试升级”,由深度求索代表在 WeChat 群中报告。开放用户测试,下载量为零,Hugging Face 页面显示创建于 UTC 09:46:42,最后修改于 UTC 18:01:18,获 967 个点赞,标记为文本生成、对话使用和自定义代码等,支持通过 novita、nebius 等提供商推理。

模型规格

深度求索 R1-0528 拥有 6850 亿参数,使用 BF16、F8_E4M3 和 F32 张量类型,safetensors 参数如下:

张量类型参数

BF163,918,786,560

F8_E4M3680,571,043,840

F3241,555,600

总大小为 684,531,386,000,分片分布,未量化,推理设置为“暖”,支持 2 个 finetunes 和 6 个 quantizations,Hugging Face 讨论有 59 个线程。

性能与基准

在 LiveCodeBench 上,接近 OpenAI o3 和 o4 mini,领先于 xAI 的 Grok 3 mini 和阿里巴巴的 Qwen 3。Extended NYT Connections 得分从 38.6 升至 49.8,接近 Claude Opus 4 Thinking 16k,但低于 OpenAI o 系列。用户反馈(如 X post by @chetaslua)称其推理深度和写作自然,适合复杂任务,推理时间优于 o3 和 o4 mini。

能力与改进

模型基于 DeepSeek-V3-Base,初始化自 LLaMA 和 Qwen,微调于合成数据,增强多功能性。在编程和设计方面表现优异,生成高质量代码,特别在前端页面和动态动画上,处理复杂提示能力强。用户观察显示推理深度和自然写作风格,适合 30-60 分钟的单任务处理。

成本与效率

训练成本 600 万美元,远低于 GPT-4 的 1 亿美元,使用计算资源仅为 Llama 3.1 的十分之一,性价比高,适合资源有限的组织和研究人员。

上下文因素与用户反馈

深度求索总部位于浙江杭州,由 High-Flyer 资助,专注于研究,规避中国面向消费者的 AI 法规。招聘强调技能,招募背景多样人员,包括诗歌和数学专家。X post by @chetaslua 称其性能与 OpenAI o1 相当,胜过 Claude 3.5 Sonnet 和 o1-mini,2025 年 5 月 28 日的反馈显示改进明显。

限制与未来期望

缺乏模型卡限制训练数据和偏见理解,预计将发布完整模型卡。当前下载量零,但通过多个推理提供商可用,表明兴趣增长。

结论

DeepSeek R1-0528 是 6850 亿参数模型,推理和编程能力强,成本效益高,采用 MIT 许可证,定位为开源 AI 领导者。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码