DataLearner 标志

GPT-5.4 nano 评测详情

GPT-5.4 nano 当前已收录的代表性评测结果包括 IF Bench(28 / 282,得分 75.90)、Terminal Bench Hard(45 / 244,得分 42.40)、HLE(151 / 568,得分 37.70)。

评测结果

GPT-5.4 nano

评测结果

思考模式
工具使用

抽象归纳与泛化

共 8 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
低工具
18.33
159 / 176
ARC-AGI-1
中工具
33
150 / 176
ARC-AGI-1
高工具
38.17
142 / 176
ARC-AGI-1
极高工具
51.50
132 / 176
ARC-AGI-2
低工具
1.53
149 / 164
ARC-AGI-2
中工具
1.94
144 / 164
ARC-AGI-2
高工具
3.61
138 / 164
ARC-AGI-2
极高工具
5.69
124 / 164

综合知识考试

共 5 项评测
评测名称 / 模式
得分
排名/总数
HLE
常规模式
4.10
525 / 568
HLE
中
15.90
332 / 568
HLE
极高
28.30
227 / 568
HLE
极高
24.30
262 / 568
HLE
极高工具
37.70
151 / 568

科学知识与推理

共 6 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
55.56
398 / 461
72.22
305 / 461
76.10
272 / 461
81.70
211 / 461
5.10
98 / 204
CritPt
极高
9.30
79 / 204

图像感知与视觉推理

共 5 项评测
评测名称 / 模式
得分
排名/总数
MMMU
极高
66.10
53 / 74
MMMU
极高工具
69.50
47 / 74
MMMU-Pro
常规模式
43.80
217 / 229
59.50
179 / 229
MMMU-Pro
极高
65.40
152 / 229

数学

共 5 项评测
评测名称 / 模式
得分
排名/总数
FrontierMath v2
常规模式
4.56
58 / 58
20.35
49 / 58
44.91
32 / 58
12.20
31 / 42
6.30
35 / 80

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
52.40
41 / 62

客服与业务流程

共 5 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
常规模式工具
34.80
197 / 264
52.60
168 / 264
76
120 / 264
SAGE
高工具
38.08
45 / 64
τ³-Banking
极高工具
27.40
69 / 167

指令与格式遵循

共 3 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
32.70
254 / 282
64.40
104 / 282
IF Bench
极高
75.90
28 / 282

跨能力综合测试

共 5 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
32.39
117 / 117
48.67
98 / 117
58.46
77 / 117
62.75
58 / 117
LiveBench
深度思考模式
69.58
39 / 117

自主开发与终端任务

共 6 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
极高工具
60.70
117 / 199
Terminal Bench 2.0
极高工具
46.30
42 / 48
Terminal Bench Hard
常规模式工具
24.20
134 / 244
33.30
86 / 244
42.40
45 / 244
Terminal-Bench 4.0
极高工具
0.50
90 / 95

跨应用与工具编排

共 3 项评测
评测名称 / 模式
得分
排名/总数
Claw Bench
开启思考工具
89.70
10 / 29
68.99
27 / 45
Tool Decathlon
极高工具
35.50
9 / 10

多轮记忆与持续上下文

共 5 项评测
评测名称 / 模式
得分
排名/总数
Context Arena
常规模式
13.04
126 / 126
23.31
120 / 126
32.74
113 / 126
39.03
100 / 126
52.79
85 / 126

跨长文理解与整合

共 3 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
常规模式
29.70
167 / 174
67.30
117 / 174
AA-LCR
极高
76.70
81 / 174

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld-Verified
极高工具
39
27 / 28

跨能力聚合指数

共 2 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
145.78
73 / 167
Vals Index
高工具
33
37 / 42

跨行业工作评估

共 2 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
常规模式工具
681
108 / 110
GDPval-AA v2
极高工具
1035
93 / 110

办公与文档流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-Briefcase
极高工具
670
84 / 88

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
极高
47.20
83 / 134

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
极高工具
52.24
39 / 44
6.25
41 / 42

金融

共 2 项评测
评测名称 / 模式
得分
排名/总数
44.75
36 / 42
38.22
37 / 42

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
极高
7.80
92 / 122

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
14.47
35 / 43

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
26.10
43 / 60

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
高工具
77.09
48 / 66
MedCode
高工具
41.03
43 / 64