DataLearner 标志

DeepSeek-R1 评测详情

DeepSeek-R1 当前已收录的代表性评测结果包括 MMLU(8 / 124,得分 90.80)、MMLU Pro(39 / 133,得分 84)、MATH-500(13 / 44,得分 97.30)。

评测结果

DeepSeek-R1

评测结果

思考模式
工具使用

综合评估

共 3 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
90.80
8 / 124
MMLU Pro
常规模式
84
39 / 133
ARC-AGI
常规模式
15.80
58 / 68

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
71.50
146 / 224

常识问答

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
30.10
24 / 47

编程与软件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
65.90
62 / 126
SWE-bench Verified
常规模式
49.20
98 / 114
WeirdML v2
常规模式工具
36.49
49 / 52

数学推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
MATH-500
常规模式
97.30
13 / 44
AIME 2024
常规模式
79.80
28 / 62
AIME2025
常规模式
70
73 / 106

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1500
47 / 99

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
30.90
52 / 67

Agent能力评测

共 3 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
开启思考
56.90
25 / 59
BALROG
常规模式工具
34.90
8 / 12
METR Time Horizons v1.1
常规模式工具
26.93
21 / 22

长上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
Fiction.liveBench
常规模式
69.40
11 / 16