DataLearner 标志

DeepSeek-V3-0324 评测详情

DeepSeek-V3-0324 当前已收录的代表性评测结果包括 GSM8K(3 / 70,得分 96.30)、MMLU(29 / 124,得分 86.50)、GPQA(4 / 17,得分 68.40)。

评测结果

DeepSeek-V3-0324

评测结果

思考模式
工具使用

综合评估

共 5 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
86.50
29 / 124
MMLU Pro
常规模式
81.20
56 / 134
GPQA
常规模式
68.40
4 / 17
ARC-AGI-1
常规模式
9
86 / 92
HLE
常规模式
5.20
190 / 197

数学推理

共 7 项评测
评测名称 / 模式
得分
排名/总数
GSM8K
常规模式
96.30
3 / 70
MATH-500
常规模式
94
29 / 45
AIME 2024
常规模式
59.40
43 / 62
AIME2025
常规模式
47.70
89 / 107
IMO-ProofBench
常规模式
4.30
15 / 16
IMO 2024
常规模式
1.70
9 / 10
IMO 2025
常规模式
1.70
9 / 9

阅读理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
DROP
常规模式
89.70
3 / 9

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
68.40
205 / 274

常识问答

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
27.20
28 / 47

编程与软件工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
49.20
100 / 128
SWE-bench Verified
常规模式
38.80
107 / 116

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1470.20
55 / 106

AI Agent - 工具使用

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench
常规模式
13.30
34 / 35

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
27.20
79 / 94

Agent能力评测

共 2 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
55.10
27 / 59
τ²-Bench
常规模式工具
38.80
39 / 44