DataLearner 标志

OpenAI o3 评测详情

OpenAI o3 当前已收录的代表性评测结果包括 Aider-Polyglot(5 / 59,得分 81.30)、MATH-500(5 / 45,得分 98.10)、MMMU(9 / 74,得分 82.90)。

评测结果

OpenAI o3

评测结果

思考模式
工具使用

综合评估

共 8 项评测
评测名称 / 模式
得分
排名/总数
MMLU Pro
常规模式
85.60
25 / 176
ARC-AGI-1
开启思考
60.80
94 / 147
HLE
思考水平·中
19.20
298 / 563
HLE
开启思考
20.32
282 / 563
HLE
开启思考
20.10
285 / 563
HLE
思考水平·高
20.32
282 / 563
ARC-AGI-2
开启思考
6.50
99 / 136
CritPt
开启思考
1.10
147 / 200

科学与综合推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
思考水平·低
79.80
239 / 462
GPQA Diamond
思考水平·中
80.81
228 / 462
GPQA Diamond
开启思考
83.30
190 / 462

常识问答

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
49.40
14 / 47

编程与软件工程

共 6 项评测
评测名称 / 模式
得分
排名/总数
CodeClash
常规模式工具
1343
3 / 8
LiveCodeBench
常规模式
75.80
68 / 250
LiveCodeBench
开启思考
80.80
47 / 250
SWE-bench Verified
开启思考
69.10
67 / 116
WeirdML v2
思考水平·高工具
52.42
36 / 52
GSO
思考水平·高工具
8.80
15 / 21

数学推理

共 12 项评测
评测名称 / 模式
得分
排名/总数
MATH-500
常规模式
98.10
5 / 45
AIME 2024
常规模式
91.60
12 / 62
AIME2025
开启思考
88.90
62 / 215
FrontierMath v2
思考水平·低
19.30
51 / 58
FrontierMath v2
思考水平·中
29.82
44 / 58
FrontierMath v2
思考水平·高
33.33
42 / 58
IMO-ProofBench
开启思考
20.50
11 / 16
20.50
10 / 24
FrontierMath
思考水平·低
10.30
25 / 60
FrontierMath
思考水平·中
10
28 / 60
FrontierMath
思考水平·高
10.30
25 / 60
FrontierMath - Tier 4
思考水平·高
2.10
56 / 80

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1672.50
31 / 106

AI Agent - 工具使用

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench
开启思考
30.20
21 / 35

多模态理解

共 8 项评测
评测名称 / 模式
得分
排名/总数
MMMU
常规模式
82.90
9 / 74
MMMU
开启思考
82.90
9 / 74
MMMU
unknown
82.90
9 / 74
MMMU-Pro
开启思考
70.10
128 / 227
MMMU-Pro
unknown
76.40
73 / 227
GeoBench ACW
思考水平·中
74
11 / 20
GeoBench ACW
思考水平·高
60
19 / 20
VPCT
思考水平·中
52
10 / 24

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
思考水平·高
53.10
47 / 93

Agent能力评测

共 5 项评测
评测名称 / 模式
得分
排名/总数
METR Time Horizons v1.1
思考水平·中工具
91.27
14 / 22
Aider-Polyglot
常规模式
76.90
9 / 59
Aider-Polyglot
思考水平·高
81.30
5 / 59
τ²-Bench - Telecom
开启思考工具
80.70
111 / 264
Terminal Bench Hard
开启思考工具
37.10
65 / 244

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
开启思考
71.40
58 / 282

长上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
Fiction.liveBench
思考水平·中
88.90
6 / 16