DataLearner 标志

GLM-5.3 评测详情

GLM-5.3 当前已收录的代表性评测结果包括 HLE(4 / 190,得分 62.50)、Creative Writing(3 / 99,得分 2062.40)、Terminal-Bench 2.1(5 / 49,得分 88.20)。本页还提供与 4 个竞品模型及 4 个前代或同系列模型的对比,在有数据时会展示性能和价格视图。

评测结果

GLM-5.3

评测结果

思考模式
工具使用

综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
最高工具
62.50
4 / 190

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
90.91
38 / 271

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
2062.40
3 / 99

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
66.20
18 / 92

文本向量检索

共 3 项评测
评测名称 / 模式
得分
排名/总数
78.61
43 / 126
88.53
18 / 126
85.61
23 / 126

AI Agent - 工具使用

共 10 项评测
评测名称 / 模式
得分
排名/总数
ExploitGym (6h)
最高工具
130
1 / 1
ExploitGym (2h)
最高工具
105
1 / 1
Terminal-Bench 2.1
最高工具
88.20
5 / 49
CyberGym
最高工具
84.50
1 / 5
73
8 / 10
ExploitBench
最高工具
54.40
2 / 2
AutomationBench
最高工具
48.20
4 / 14
Terminal-Bench 4.0
最高工具
41.82
5 / 13
Terminal-Bench 3.0
最高工具
28.30
4 / 7
8.10
8 / 11

编程与软件工程

共 6 项评测
评测名称 / 模式
得分
排名/总数
FrontierSWE
最高工具
78.10
2 / 4
DeepSWE
最高工具
66.90
12 / 35
NL2Repo-Bench
最高工具
58
4 / 12
SWE-Marathon
最高工具
42.50
2 / 6
PostTrain Bench
最高工具
39.80
1 / 5
Program Bench
最高工具
19
6 / 7

Agent能力评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
Agents' Last Exam
最高工具
28.50
5 / 15

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
最高工具
1769
4 / 25

数学推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
68.77
16 / 58
29.27
19 / 41

竞品对比

GLM-5.3 与同类主流模型的评测得分对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。

评测项GLM-5.3当前Kimi K3Claude Opus 5GPT-5.6 SolDeepSeek-V4-Pro
HLE
综合评估
62.50思考水平·高 | 工具
56.00思考水平·高 | 工具
64.70思考水平·高 | 工具
49.50思考水平·高
48.20思考水平·极高 | 工具
GPQA Diamond
科学与综合推理
90.91思考水平·高
93.50思考水平·高
93.88思考水平·高
93.50思考水平·高
90.10思考水平·高
Creative Writing
写作和创作
2062.40常规模式
2070.80常规模式
2116.10常规模式
1964.10常规模式
1552.10常规模式
SimpleBench
常识推理
66.20思考水平·高
60.70思考水平·高
80.60思考水平·高
64.80思考水平·极高
50.90常规模式
Context Arena
文本向量检索
88.53思考水平·高
71.75思考水平·高
97.72思考水平·高
97.63思考水平·高
76.09开启思考
AutomationBench
AI Agent - 工具使用
48.20思考水平·高 | 工具
30.80思考水平·高 | 工具
26.00思考水平·高 | 工具
--
31.80思考水平·极高 | 工具
CyberGym
AI Agent - 工具使用
84.50思考水平·高 | 工具
--
--
--
83.30思考水平·极高 | 工具
Terminal-Bench 2.1
AI Agent - 工具使用
88.20思考水平·高 | 工具
88.30思考水平·高 | 工具
--
88.80思考水平·高
87.90思考水平·极高 | 工具
Terminal-Bench 3.0
AI Agent - 工具使用
28.30思考水平·高 | 工具
--
--
34.60思考水平·高 | 工具
--
Terminal-Bench 4.0
AI Agent - 工具使用
41.82思考水平·高 | 工具
--
51.82思考水平·高 | 工具
37.27思考水平·高 | 工具
--
Terminal-Bench-Science 0.1
AI Agent - 工具使用
8.10思考水平·高 | 工具
7.10思考水平·高 | 工具
30.00思考水平·高 | 工具
22.40思考水平·高 | 工具
--
Toolathlon-Verified
AI Agent - 工具使用
73.00思考水平·高 | 工具
76.50思考水平·高 | 工具
--
--
74.10思考水平·极高 | 工具
其余 10 个 benchmark 仍可在上方图表中查看。

GLM-5.3 与同类模型的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。

这些模型的价格币种或计费单位不一致,暂不直接绘制统一柱状图,以下展示原始价格。

GLM-5.3
供应商: 智谱AI
标准输入: $1.4 / 1M tokens
标准输出: $4.4 / 1M tokens
Kimi K3
供应商: Moonshot AI
标准输入: ¥20 / 1M tokens
标准输出: ¥100 / 1M tokens
Claude Opus 5
供应商: Anthropic
标准输入: $5 / 1M tokens
标准输出: $25 / 1M tokens
GPT-5.6 Sol
供应商: OpenAI
标准输入: $4 / 1M tokens
标准输出: $20 / 1M tokens
DeepSeek-V4-Pro
供应商: DeepSeek-AI
标准输入: $0.435 / 1M tokens
标准输出: $0.87 / 1M tokens
模型供应商标准输入标准输出标准价适用于
GLM-5.3
智谱AI$1.4 / 1M tokens$4.4 / 1M tokens
Kimi K3
Moonshot AI¥20 / 1M tokens¥100 / 1M tokens
Claude Opus 5
Anthropic$5 / 1M tokens$25 / 1M tokens
GPT-5.6 Sol
OpenAI$4 / 1M tokens$20 / 1M tokens
DeepSeek-V4-Pro
DeepSeek-AI$0.435 / 1M tokens$0.87 / 1M tokens

历代版本对比

GLM-5.3 系列各版本的评测成绩纵向对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。· 点击任意行可切换下方趋势图。

评测项GLM-5.3当前GLM-5.2GLM 5.1GLM-5GLM-4.7
HLE
综合评估
62.50思考水平·高 | 工具
54.70开启思考 | 工具
52.30开启思考 | 工具
50.40开启思考 | 工具
42.80开启思考 | 工具
GPQA Diamond
科学与综合推理
90.91思考水平·高
91.86思考水平·高
86.20开启思考
86.00开启思考
85.70开启思考
Creative Writing
写作和创作
2062.40常规模式
1750.90常规模式
1589.20常规模式
1597.60常规模式
1410.50常规模式
SimpleBench
常识推理
66.20思考水平·高
58.80常规模式
55.10常规模式
53.20常规模式
47.70开启思考
Context Arena
文本向量检索
88.53思考水平·高
72.34思考水平·高
62.05开启思考
--
--
Terminal-Bench 2.1
AI Agent - 工具使用
88.20思考水平·高 | 工具
81.00思考水平·高 | 工具
58.70思考水平·高 | 工具
--
--
DeepSWE
编程与软件工程
66.90思考水平·高 | 工具
44.00深度思考模式 | 工具
--
--
--
FrontierSWE
编程与软件工程
78.10思考水平·高 | 工具
74.40思考水平·高 | 工具
--
--
--
NL2Repo-Bench
编程与软件工程
58.00思考水平·高 | 工具
48.90开启思考 | 工具
--
--
--
PostTrain Bench
编程与软件工程
39.80思考水平·高 | 工具
34.30思考水平·高 | 工具
--
--
--
Program Bench
编程与软件工程
19.00思考水平·高 | 工具
63.70开启思考 | 工具
--
--
--
SWE-Marathon
编程与软件工程
42.50思考水平·高 | 工具
13.00思考水平·高 | 工具
--
--
--
其余 2 个 benchmark 仍可在上方图表中查看。

单评测历史趋势图

当前查看:HLE · 综合评估

选择评测
常规常规 + 工具推理推理 + 工具深度推理深度推理 + 工具

横轴为模型与发布时间,纵轴为分数;同一模式会用实线串起版本变化,同代不同模式继续用虚线辅助对齐。

GLM-5.3 所在系列的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。

这些模型的价格币种或计费单位不一致,暂不直接绘制统一柱状图,以下展示原始价格。

GLM-5.3
供应商: 智谱AI
标准输入: $1.4 / 1M tokens
标准输出: $4.4 / 1M tokens
GLM-5.2
供应商: 智谱AI
标准输入: $1.4 / 1M tokens
标准输出: $4.4 / 1M tokens
GLM 5.1
供应商: 智谱AI
标准输入: $1.4 / 1M tokens
标准输出: $4.4 / 1M tokens
GLM-5
供应商: 智谱AI
标准输入: $1 / 1M tokens
标准输出: $3.2 / 1M tokens
GLM-4.7
供应商: 智谱AI
标准输入: ¥4 / 1M tokens
标准输出: ¥16 / 1M tokens
模型供应商标准输入标准输出标准价适用于
GLM-5.3
智谱AI$1.4 / 1M tokens$4.4 / 1M tokens
GLM-5.2
智谱AI$1.4 / 1M tokens$4.4 / 1M tokens
GLM 5.1
智谱AI$1.4 / 1M tokens$4.4 / 1M tokens
GLM-5
智谱AI$1 / 1M tokens$3.2 / 1M tokens
GLM-4.7
智谱AI¥4 / 1M tokens¥16 / 1M tokens