DataLearner 标志

GPT-5-Nano 评测详情

GPT-5-Nano 当前已收录的代表性评测结果包括 LiveCodeBench(58 / 251,得分 78.90)、IF Bench(88 / 282,得分 67.60)、AIME2025(77 / 215,得分 85)。

评测结果

GPT-5-Nano

评测结果

思考模式
工具使用

抽象归纳与泛化

共 6 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
思考水平·低工具
4.04
175 / 176
ARC-AGI-1
思考水平·中工具
20.71
158 / 176
ARC-AGI-1
思考水平·高工具
16.67
161 / 176
ARC-AGI-2
思考水平·低工具
0
160 / 164
ARC-AGI-2
思考水平·中工具
0.88
156 / 164
ARC-AGI-2
思考水平·高工具
2.61
140 / 164

综合知识考试

共 3 项评测
评测名称 / 模式
得分
排名/总数
HLE
常规模式
4
532 / 568
HLE
思考水平·中
8.70
413 / 568
HLE
思考水平·高
9.50
404 / 568

科学知识与推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
42.80
425 / 461
GPQA Diamond
思考水平·低
57.58
389 / 461
GPQA Diamond
思考水平·中
67
346 / 461
GPQA Diamond
思考水平·高
67.60
341 / 461

算法与竞赛编程

共 3 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
47
175 / 251
LiveCodeBench
思考水平·中
76.30
65 / 251
LiveCodeBench
思考水平·高
78.90
58 / 251

数学

共 12 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
常规模式
27.30
187 / 215
AIME2025
思考水平·低工具
47.22
159 / 215
AIME2025
思考水平·中
78.30
101 / 215
AIME2025
思考水平·高
83.70
84 / 215
AIME2025
思考水平·高工具
85
77 / 215
FrontierMath v2
思考水平·低
5.96
57 / 58
FrontierMath v2
思考水平·高
20
50 / 58
FrontierMath
思考水平·中
7.20
33 / 60
FrontierMath
思考水平·高
8.30
31 / 60
FrontierMath Tier 4 v2
思考水平·高
2.44
37 / 42
FrontierMath - Tier 4
思考水平·中
2.10
56 / 80
FrontierMath - Tier 4
思考水平·高
0
72 / 80

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
702.90
103 / 106

图像感知与视觉推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
31.80
226 / 229
MMMU-Pro
思考水平·中
58.20
183 / 229
MMMU-Pro
思考水平·高
61
173 / 229
MMMU
常规模式
57.60
63 / 74

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
DocVQA
常规模式
78.30
5 / 5

客服与业务流程

共 4 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
常规模式工具
25.70
228 / 264
τ²-Bench - Telecom
思考水平·中工具
30.40
213 / 264
τ²-Bench - Telecom
思考水平·高工具
36.50
193 / 264
SAGE
思考水平·高工具
30.38
59 / 64

指令与格式遵循

共 3 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
32.50
255 / 282
IF Bench
思考水平·中
65.90
98 / 282
IF Bench
思考水平·高
67.60
88 / 282

跨能力综合测试

共 3 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
48.56
100 / 117
LiveBench
思考水平·低
34.34
115 / 117
LiveBench
思考水平·高
48.62
99 / 117

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
Terminal Bench Hard
常规模式工具
6.80
194 / 244
Terminal Bench Hard
思考水平·中工具
17.40
158 / 244
Terminal Bench Hard
思考水平·高工具
12.10
178 / 244

跨长文理解与整合

共 2 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
思考水平·中
43.70
155 / 174
AA-LCR
思考水平·高
45
151 / 174

跨应用与工具编排

共 1 项评测
评测名称 / 模式
得分
排名/总数
Pinch Bench
思考模式工具
68.80
34 / 38

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
思考水平·高工具
72.86
56 / 66
MedCode
思考水平·高工具
30.44
59 / 64

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
139.39
98 / 167