DataLearner 标志

GLM-4.7 评测详情

GLM-4.7 当前已收录的代表性评测结果包括 τ²-Bench(6 / 43,得分 87.40)、LiveCodeBench(19 / 126,得分 84.90)、AIME2025(23 / 107,得分 95.70)。

评测结果

GLM-4.7

评测结果

思考模式
工具使用

综合评估

共 4 项评测
评测名称 / 模式
得分
排名/总数
84.30
38 / 133
LiveBench
常规模式
58.09
78 / 115
42.80
55 / 181
24.80
111 / 181

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
85.70
81 / 226

编程与软件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
84.90
19 / 126
73.80
44 / 114

数学推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
95.70
23 / 107
92.90
9 / 19
2.10
56 / 80

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
开启思考
47.70
33 / 67

Agent能力评测

共 2 项评测
评测名称 / 模式
得分
排名/总数
87.40
6 / 43

AI Agent - 信息收集

共 1 项评测
评测名称 / 模式
得分
排名/总数
52
41 / 54

AI Agent - 工具使用

共 2 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
常规模式工具
58.10
33 / 38