DataLearner 标志

GLM-4.7 评测详情

GLM-4.7 当前已收录的代表性评测结果包括 τ²-Bench(6 / 43,得分 87.40)、LiveCodeBench(20 / 127,得分 84.90)、AIME2025(23 / 106,得分 95.70)。

评测结果

GLM-4.7

评测结果

思考模式
工具使用

综合评估

共 4 项评测
评测名称 / 模式
得分
排名/总数
MMLU Pro
思考模式
84.30
38 / 133
LiveBench
常规模式
58.09
78 / 115
HLE
思考模式
24.80
113 / 183
HLE
思考模式工具
42.80
56 / 183

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
思考模式
85.70
81 / 225

编程与软件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
思考模式
84.90
20 / 127
SWE-bench Verified
思考模式工具
73.80
44 / 114
SWE-Bench Pro - Public
思考模式工具
40.60
54 / 58

数学推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
思考模式
95.70
23 / 106
AIME 2026
思考模式
92.90
9 / 19
2.10
56 / 80

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1410.50
57 / 99

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
思考模式
47.70
33 / 67

Agent能力评测

共 2 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench
思考模式工具
87.40
6 / 43
Terminal Bench Hard
思考模式工具
33.30
7 / 13

AI Agent - 信息收集

共 1 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
思考模式工具
52
41 / 54

AI Agent - 工具使用

共 2 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
常规模式工具
58.10
34 / 39
Terminal Bench 2.0
思考模式工具
41
45 / 48