DataLearner 标志

GLM-5.3 评测详情

GLM-5.3 当前已收录的代表性评测结果包括 HLE(3 / 176,得分 62.50)、Terminal-Bench 2.1(3 / 38,得分 88.20)、Automation Bench(1 / 4,得分 48.20)。

评测结果

GLM-5.3

评测结果

思考模式

综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
最高工具
62.50
3 / 176

AI Agent - 工具使用

共 8 项评测
评测名称 / 模式
得分
排名/总数
ExploitGym (6h)
最高工具
130
1 / 1
ExploitGym (2h)
最高工具
105
1 / 1
Terminal-Bench 2.1
最高工具
88.20
3 / 38
CyberGym
最高工具
84.50
1 / 2
73
2 / 3
ExploitBench
最高工具
54.40
1 / 1
Automation Bench
最高工具
48.20
1 / 4
Terminal-Bench 3.0
最高工具
28.30
1 / 2

编程与软件工程

共 6 项评测
评测名称 / 模式
得分
排名/总数
FrontierSWE
最高工具
78.10
2 / 2
DeepSWE
最高工具
66.90
8 / 22
NL2Repo-Bench
最高工具
58
1 / 2
SWE-Marathon
最高工具
42.50
1 / 3
PostTrain Bench
最高工具
39.80
1 / 2
Program Bench
最高工具
19
2 / 2

Agent能力评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
Agents' Last Exam
最高工具
28.50
4 / 6

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
最高工具
1769
2 / 8