DataLearner 标志

OpenAI o3-mini 评测详情

OpenAI o3-mini 当前已收录的代表性评测结果包括 MMLU(43 / 124,得分 84.90)、Aider-Polyglot(21 / 59,得分 60.40)、AIME2025(54 / 111,得分 86.50)。

评测结果

OpenAI o3-mini

评测结果

思考模式
工具使用

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMLU
开启思考
84.90
43 / 124
HLE
开启思考
13.40
189 / 240

抽象归纳与泛化

共 6 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
思考水平·低
14.50
204 / 221
ARC-AGI-1
思考水平·中
22.33
195 / 221
ARC-AGI-1
思考水平·高
34.50
182 / 221
ARC-AGI-2
思考水平·低
0
203 / 209
ARC-AGI-2
思考水平·中
2.08
178 / 209
ARC-AGI-2
思考水平·高
3
174 / 209

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
开启思考
70.60
181 / 255
CritPt
思考水平·高
0.30
186 / 204

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
开启思考
40.80
109 / 119

数学

共 8 项评测
评测名称 / 模式
得分
排名/总数
MATH-500
开启思考
95.80
25 / 46
AIME2025
开启思考
86.50
54 / 111
AIME 2024
开启思考
60
42 / 61
FrontierMath v2
思考水平·低工具
3.86
113 / 114
FrontierMath v2
思考水平·中工具
10.53
105 / 114
FrontierMath v2
思考水平·高工具
18.60
94 / 114
FrontierMath - Tier 4
思考水平·高
4.20
40 / 80
FrontierMath Tier 4 v2
思考水平·高工具
0
69 / 71

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
CodeForces
开启思考
2073
15 / 21

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
思考水平·高
22.80
87 / 96

自主开发与终端任务

共 4 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
思考水平·中
53.80
29 / 59
Aider-Polyglot
思考水平·高
60.40
21 / 59
Terminal Bench Hard
开启思考工具
6.80
194 / 244
Terminal Bench Hard
思考水平·高工具
6.10
204 / 244

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
思考水平·高
42.80
100 / 134

客服与业务流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
τ³-Banking
思考水平·高工具
5.20
157 / 167

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
思考水平·高
2
110 / 122

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
140.35
93 / 167