DataLearner 标志

GLM-5.3 评测详情

GLM-5.3 当前已收录的代表性评测结果包括 HLE(6 / 233,得分 62.50)、τ³-Banking(5 / 167,得分 50.30)、Creative Writing(5 / 106,得分 2064.10)。本页还提供与 4 个竞品模型及 4 个前代或同系列模型的对比,在有数据时会展示性能和价格视图。

评测结果

GLM-5.3

评测结果

思考模式
工具使用

综合知识考试

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
最高工具
62.50
6 / 233

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
2064.10
5 / 106

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
66.20
23 / 96

多轮记忆与持续上下文

共 3 项评测
评测名称 / 模式
得分
排名/总数
78.61
43 / 126
88.53
18 / 126
85.61
23 / 126

仓库修复与多文件工程

共 6 项评测
评测名称 / 模式
得分
排名/总数
SWE-Bench Pro V2
最高工具
95.60
5 / 10
84.30
7 / 11
FrontierSWE
最高工具
78.10
2 / 4
DeepSWE
最高工具
68.96
23 / 91
NL2Repo-Bench
最高工具
58
6 / 16
SWE-Marathon
最高工具
42.50
3 / 7

跨能力聚合指数

共 2 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
155.56
22 / 167
Vals Index
最高工具
56.97
23 / 42

跨应用与工具编排

共 2 项评测
评测名称 / 模式
得分
排名/总数
73
12 / 14
Agents' Last Exam
最高工具
28.50
12 / 24

程序生成与编辑

共 2 项评测
评测名称 / 模式
得分
排名/总数
78.12
19 / 60
Program Bench
最高工具
19
10 / 15

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
PostTrain Bench
最高工具
39.80
1 / 5

办公与文档流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
AutomationBench
最高工具
48.80
7 / 23

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
MysteryMechanism
最高工具
22.97
10 / 13
CritPt
最高
19.10
43 / 204

科学计算与科研编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
SciCode
最高
59
9 / 134
8.10
9 / 12

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
68.54
5 / 26
τ³-Banking
最高工具
50.30
5 / 167

金融

共 3 项评测
评测名称 / 模式
得分
排名/总数
Tax Agent Bench
最高工具
73.09
3 / 20
56.34
30 / 42
Finance Agent v2
最高工具
55.84
14 / 42

法律

共 2 项评测
评测名称 / 模式
得分
排名/总数
49.04
6 / 42
8.33
14 / 43

漏洞发现与分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
CyberGym
最高工具
84.50
5 / 11

数学

共 3 项评测
评测名称 / 模式
得分
排名/总数
68.77
16 / 58
49
19 / 28
29.27
20 / 42

自主开发与终端任务

共 2 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 4.0
最高工具
41.82
19 / 96
Terminal-Bench 3.0
最高工具
28.30
6 / 11

漏洞利用

共 4 项评测
评测名称 / 模式
得分
排名/总数
ExploitGym (6h)
最高工具
130
1 / 1
ExploitGym (2h)
最高工具
105
1 / 1
ExploitBench
最高工具
54.40
3 / 3

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
最高
11.20
77 / 122

编码综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
53.60
6 / 11

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Code Migration
最高工具
44.22
17 / 43

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
IOI (Vals v2)
最高工具
68.44
8 / 26

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
最高工具
88.81
8 / 66
MedCode
最高工具
42.86
37 / 64

跨能力综合测试

共 1 项评测
评测名称 / 模式
得分
排名/总数
SuperCLUE
unknown
71.29
4 / 13

竞品对比

GLM-5.3 与同类主流模型的评测得分对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。

评测项GLM-5.3当前Kimi K3Claude Opus 5GPT-5.6 SolDeepSeek-V4-Pro
HLE
Accuracy
综合知识考试
62.50思考水平·高 | 工具
59.80思考水平·高 | 工具
63.60思考水平·高 | 工具
44.50思考水平·高
48.20思考水平·极高 | 工具
Creative Writing
Elo、大模型评判两两对战
写作与创意表达
2064.10常规模式
2070.60常规模式
2120.60常规模式
1963.40常规模式
1552.10常规模式
SimpleBench
Score (AVG@5)
常识推理
66.20思考水平·高
60.70思考水平·高
80.60思考水平·高
64.80思考水平·极高
50.90常规模式
Context Arena
Accuracy (8 needles, 4K-128K context)
多轮记忆与持续上下文
88.53思考水平·高
71.75思考水平·高
97.72思考水平·高
97.63思考水平·高
76.09开启思考
DeepSWE
Pass@1 (DeepSWE v1.1)
仓库修复与多文件工程
68.96思考水平·高 | 工具
68.51思考水平·高 | 工具
73.65思考水平·高 | 工具
72.70思考水平·极高 | 工具
62.83思考水平·高 | 工具
FrontierSWE
Dominance score
仓库修复与多文件工程
78.10思考水平·高 | 工具
81.20思考水平·高 | 工具
--
--
--
NL2Repo-Bench
Average test pass rate
仓库修复与多文件工程
58.00思考水平·高 | 工具
58.00思考水平·高 | 工具
75.30思考水平·高 | 工具
56.80思考水平·高 | 工具
61.50思考水平·极高 | 工具
SWE-Bench Pro V2
Resolve Rate (%, pass@1)
仓库修复与多文件工程
95.60思考水平·高 | 工具
97.70思考水平·高 | 工具
99.40思考水平·极高 | 工具
95.50思考水平·极高 | 工具
--
SWE-Bench Pro V2 Hard
Resolve Rate (%, pass@1)
仓库修复与多文件工程
84.30思考水平·高 | 工具
88.20思考水平·高 | 工具
98.00思考水平·极高 | 工具
82.40思考水平·极高 | 工具
--
SWE-Marathon
Resolution rate (Pass@1)
仓库修复与多文件工程
42.50思考水平·高 | 工具
42.00思考水平·高 | 工具
--
--
--
ECI
ECI score (capability index, higher is better)
跨能力聚合指数
155.56思考水平·高
157.68思考水平·高
162.67思考水平·高
161.99思考水平·高
155.39思考水平·高
Vals Index
跨行业任务准确率综合指数
跨能力聚合指数
56.97思考水平·高 | 工具
57.81思考水平·高 | 工具
67.21思考水平·高 | 工具
72.63思考水平·极高
52.37思考水平·高 | 工具
其余 32 个 benchmark 仍可在上方图表中查看。

GLM-5.3 与同类模型的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。

这些模型的价格币种或计费单位不一致,暂不直接绘制统一柱状图,以下展示原始价格。

GLM-5.3
供应商: 智谱AI
标准输入: $1.4 / 1M tokens
标准输出: $4.4 / 1M tokens
Kimi K3
供应商: Moonshot AI
标准输入: ¥20 / 1M tokens
标准输出: ¥100 / 1M tokens
Claude Opus 5
供应商: Anthropic
标准输入: $5 / 1M tokens
标准输出: $25 / 1M tokens
GPT-5.6 Sol
供应商: OpenAI
标准输入: $4 / 1M tokens
标准输出: $20 / 1M tokens
DeepSeek-V4-Pro
供应商: DeepSeek-AI
标准输入: $0.435 / 1M tokens
标准输出: $0.87 / 1M tokens
模型供应商标准输入标准输出标准价适用于
GLM-5.3
智谱AI$1.4 / 1M tokens$4.4 / 1M tokens—
Kimi K3
Moonshot AI¥20 / 1M tokens¥100 / 1M tokens—
Claude Opus 5
Anthropic$5 / 1M tokens$25 / 1M tokens—
GPT-5.6 Sol
OpenAI$4 / 1M tokens$20 / 1M tokens—
DeepSeek-V4-Pro
DeepSeek-AI$0.435 / 1M tokens$0.87 / 1M tokens—

历代版本对比

GLM-5.3 系列各版本的评测成绩纵向对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。· 点击任意行可切换下方趋势图。

评测项GLM-5.3当前GLM-5.2GLM 5.1GLM-5GLM-4.7
HLE
Accuracy
综合知识考试
62.50思考水平·高 | 工具
54.70开启思考 | 工具
52.30开启思考 | 工具
50.40开启思考 | 工具
42.80开启思考 | 工具
Creative Writing
Elo、大模型评判两两对战
写作与创意表达
2064.10常规模式
1752.80常规模式
1589.20常规模式
1597.50常规模式
1410.80常规模式
SimpleBench
Score (AVG@5)
常识推理
66.20思考水平·高
58.80常规模式
55.10常规模式
53.20常规模式
47.70开启思考
Context Arena
Accuracy (8 needles, 4K-128K context)
多轮记忆与持续上下文
88.53思考水平·高
72.34思考水平·高
62.05开启思考
--
--
DeepSWE
Pass@1 (DeepSWE v1.1)
仓库修复与多文件工程
68.96思考水平·高 | 工具
44.00深度思考模式 | 工具
--
--
--
FrontierSWE
Dominance score
仓库修复与多文件工程
78.10思考水平·高 | 工具
74.40思考水平·高 | 工具
--
--
--
NL2Repo-Bench
Average test pass rate
仓库修复与多文件工程
58.00思考水平·高 | 工具
48.90开启思考 | 工具
--
--
--
SWE-Marathon
Resolution rate (Pass@1)
仓库修复与多文件工程
42.50思考水平·高 | 工具
13.00思考水平·高 | 工具
--
--
--
ECI
ECI score (capability index, higher is better)
跨能力聚合指数
155.56思考水平·高
151.76思考水平·高
149.86思考水平·高
145.84思考水平·高
143.53思考水平·高
Vals Index
跨行业任务准确率综合指数
跨能力聚合指数
56.97思考水平·高 | 工具
53.12思考水平·高 | 工具
--
--
--
Program Bench
Score
程序生成与编辑
19.00思考水平·高 | 工具
63.70开启思考 | 工具
--
--
--
Vibe Code Bench v1.1
Pass rate (%)
程序生成与编辑
78.12思考水平·高 | 工具
63.96思考水平·高 | 工具
--
23.36开启思考 | 工具
--
其余 16 个 benchmark 仍可在上方图表中查看。

单评测历史趋势图

当前查看:HLE · 综合知识考试

选择评测
常规常规 + 工具推理推理 + 工具深度推理深度推理 + 工具

横轴为模型与发布时间,纵轴为分数;同一模式会用实线串起版本变化,同代不同模式继续用虚线辅助对齐。

GLM-5.3 所在系列的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。

这些模型的价格币种或计费单位不一致,暂不直接绘制统一柱状图,以下展示原始价格。

GLM-5.3
供应商: 智谱AI
标准输入: $1.4 / 1M tokens
标准输出: $4.4 / 1M tokens
GLM-5.2
供应商: 智谱AI
标准输入: $1.4 / 1M tokens
标准输出: $4.4 / 1M tokens
GLM 5.1
供应商: 智谱AI
标准输入: $1.4 / 1M tokens
标准输出: $4.4 / 1M tokens
GLM-5
供应商: 智谱AI
标准输入: $1 / 1M tokens
标准输出: $3.2 / 1M tokens
GLM-4.7
供应商: 智谱AI
标准输入: ¥4 / 1M tokens
标准输出: ¥16 / 1M tokens
模型供应商标准输入标准输出标准价适用于
GLM-5.3
智谱AI$1.4 / 1M tokens$4.4 / 1M tokens—
GLM-5.2
智谱AI$1.4 / 1M tokens$4.4 / 1M tokens—
GLM 5.1
智谱AI$1.4 / 1M tokens$4.4 / 1M tokens—
GLM-5
智谱AI$1 / 1M tokens$3.2 / 1M tokens—
GLM-4.7
智谱AI¥4 / 1M tokens¥16 / 1M tokens—