DataLearner 标志

DeepSeek-V3 评测详情

DeepSeek-V3 当前已收录的代表性评测结果包括 HumanEval(18 / 140,得分 89)、BBH(3 / 21,得分 92.30)、MMLU(18 / 124,得分 88.50)。

评测结果

DeepSeek-V3

评测结果

思考模式
工具使用

综合评估

共 5 项评测
评测名称 / 模式
得分
排名/总数
BBH
常规模式
92.30
3 / 21
MMLU
常规模式
88.50
18 / 124
MMLU-Pro
常规模式
75.90
86 / 176
GPQA
常规模式
59.10
8 / 17
HLE
常规模式
2.90
558 / 565

编程与软件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
HumanEval
常规模式
89
18 / 140
SciCode
常规模式
35.80
118 / 131
LiveCodeBench
常规模式
34.60
202 / 251

数学推理

共 6 项评测
评测名称 / 模式
得分
排名/总数
MATH
常规模式
87.80
7 / 42
MATH-500
常规模式
87.80
41 / 46
AIME 2024
常规模式
39
52 / 62
AIME2025
常规模式
26
192 / 216
4.30
21 / 24
FrontierMath
常规模式
1.70
49 / 60

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
59.10
384 / 463

常识问答

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
24.90
31 / 47

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
18.90
89 / 93

Agent能力评测

共 4 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
48.40
34 / 59
τ²-Bench - Telecom
常规模式工具
22.80
236 / 264
Terminal Bench Hard
常规模式工具
6.80
194 / 244
τ³-Banking
常规模式工具
4.70
159 / 167

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
34.80
247 / 282

AI Agent - 工具使用

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
常规模式工具
16.90
167 / 194

多模态理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
常规模式
0.80
116 / 119