DataLearner 标志

DeepSeek-R1-0528 评测详情

DeepSeek-R1-0528 当前已收录的代表性评测结果包括 MMLU-Pro(28 / 175,得分 85)、MATH-500(8 / 46,得分 98)、AIME 2024(13 / 61,得分 91.40)。

评测结果

DeepSeek-R1-0528

评测结果

思考模式
工具使用

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMLU-Pro
思考模式
85
28 / 175
HLE
思考模式
17.70
169 / 235

抽象归纳与泛化

共 2 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
思考模式
21.20
157 / 176
ARC-AGI-2
思考模式
1.30
151 / 164

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
思考模式
81
122 / 253
CritPt
思考模式
1.40
139 / 204

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
思考模式
27.80
27 / 46

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
思考模式
57.60
86 / 116

数学

共 5 项评测
评测名称 / 模式
得分
排名/总数
MATH-500
思考模式
98
8 / 46
AIME 2024
思考模式
91.40
13 / 61
AIME2025
思考模式
87.50
49 / 110
IMO-ProofBench
思考模式
29
7 / 16
3.80
22 / 24

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
思考模式
73.30
49 / 125

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1421.10
66 / 113

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
思考模式
71.40
15 / 59
Terminal Bench Hard
思考模式工具
15.90
165 / 244
Terminal-Bench
思考模式
5.70
35 / 35

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
思考模式
40.80
68 / 96

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
141.30
91 / 167