DataLearner 标志

GPT-4o mini 评测详情

GPT-4o mini 当前已收录的代表性评测结果包括 MBPP(6 / 96,得分 87.20)、GSM8K(15 / 71,得分 91.30)、HumanEval(33 / 140,得分 87.20)。

评测结果

GPT-4o mini

评测结果

思考模式
工具使用

综合评估

共 5 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
82
48 / 124
MMLU-Pro
常规模式
61.70
120 / 176
MMLU-Pro
unknown
63.09
117 / 176
GPQA
常规模式
40.20
14 / 17
HLE
常规模式
4.20
515 / 565

数学推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
GSM8K
常规模式
91.30
15 / 71
MATH
常规模式
70.20
19 / 42
AIME2025
常规模式
14.70
204 / 216

编程与软件工程

共 4 项评测
评测名称 / 模式
得分
排名/总数
HumanEval
常规模式
87.20
33 / 140
MBPP
常规模式
87.20
6 / 96
LiveCodeBench
常规模式
23.40
234 / 251
WeirdML v2
常规模式工具
11.76
51 / 52

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
41.10
430 / 463

常识问答

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
9.50
43 / 47

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
871
92 / 106

多模态理解

共 5 项评测
评测名称 / 模式
得分
排名/总数
GeoBench ACW
常规模式
64
15 / 20
MMMU
unknown
59.40
61 / 74
MMMU-Pro
常规模式
41.50
221 / 229
MMMU-Pro
unknown
37.60
225 / 229
VPCT
常规模式
34
23 / 24

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
10.70
93 / 93

Agent能力评测

共 3 项评测
评测名称 / 模式
得分
排名/总数
BALROG
常规模式工具
17.40
12 / 12
Aider-Polyglot
常规模式
3.60
59 / 59
τ³-Banking
常规模式工具
2.90
166 / 167

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
31
264 / 282

OpenClaw智能体能力综合测评

共 1 项评测
评测名称 / 模式
得分
排名/总数
Pinch Bench
开启思考工具
75
28 / 38

AI Agent - 工具使用

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
常规模式工具
5.60
181 / 194