DataLearner 标志

GLM-5.3vsDeepSeek-V4-Pro

在 22 个共同 benchmark 中,GLM-5.3 整体领先:GLM-5.3 领先 19 项,DeepSeek-V4-Pro 领先 3 项,持平 0 项,平均分差 +31.95。

智谱AI
GLM-5.3

智谱AI · 2026-08-14 · 推理大模型

DeepSeek-AI
DeepSeek-V4-Pro

DeepSeek-AI · 2026-08-13 · 推理大模型

GLM-5.319 项(86%)(14%)3 项DeepSeek-V4-Pro

评测分数

按能力类目分组,每组内按分差大小排列;共 22 项。

数学

GLM-5.3 领先 2/3
评测项GLM-5.3DeepSeek-V4-Pro分差
FrontierMath Tier 4 v229.2720 / 42Max (No Tools)2.4437 / 42Max (No Tools)+26.83
FrontierMath v268.7716 / 58Max (No Tools)45.2631 / 58Max (No Tools)+23.51
ProofBench v1.1 (Lean 4)4919 / 28Max (With Tools)5018 / 28Max (With Tools)-1

金融

GLM-5.3 领先 3/3
评测项GLM-5.3DeepSeek-V4-Pro分差
Tax Agent Bench73.093 / 20Max (With Tools)58.6618 / 20Max (With Tools)+14.43
Finance Agent v255.8414 / 42Max (With Tools)50.3928 / 42Max (With Tools)+5.45
EMB (Excel Modeling)56.3430 / 42Max (With Tools)52.8033 / 42Max (With Tools)+3.54

临床工作与医疗决策

GLM-5.3 领先 2/2
评测项GLM-5.3DeepSeek-V4-Pro分差
MedScribe88.818 / 66Max (With Tools)80.1740 / 66Max (With Tools)+8.64
MedCode42.8637 / 64Max (With Tools)42.4738 / 64Max (With Tools)+0.39

法律

GLM-5.3 领先 2/2
评测项GLM-5.3DeepSeek-V4-Pro分差
Legal Research Bench49.046 / 42Max (With Tools)40.8717 / 42Max (With Tools)+8.17
Harvey's Legal Agent Benchmark8.3314 / 43Max (With Tools)7.5015 / 43Max (With Tools)+0.83

仓库修复与多文件工程

GLM-5.3 领先 1/1
评测项GLM-5.3DeepSeek-V4-Pro分差
DeepSWE68.9623 / 91Max (With Tools)62.8345 / 91Max (With Tools)+6.13

写作与创意表达

GLM-5.3 领先 1/1
评测项GLM-5.3DeepSeek-V4-Pro分差
Creative Writing2,0756 / 110Normal (No Tools)1,55350 / 110Normal (No Tools)+521.80

客服与业务流程

GLM-5.3 领先 1/1
评测项GLM-5.3DeepSeek-V4-Pro分差
τ³-Banking50.305 / 167Max (With Tools)30.1060 / 167Max (With Tools)+20.20

文档与图表理解

DeepSeek-V4-Pro 领先 1/1
评测项GLM-5.3DeepSeek-V4-Pro分差
GDP.pdf11.2077 / 122Max (No Tools)13.4066 / 122Max (No Tools)-2.20

漏洞利用

GLM-5.3 领先 1/1
评测项GLM-5.3DeepSeek-V4-Pro分差
ExploitGym (budget unspecified)154 / 6Max (With Tools)5.405 / 6Max (With Tools)+9.60

科学计算与科研编程

GLM-5.3 领先 1/1
评测项GLM-5.3DeepSeek-V4-Pro分差
SciCode599 / 134Max (No Tools)50.8068 / 134Max (No Tools)+8.20

程序生成与编辑

DeepSeek-V4-Pro 领先 1/1
评测项GLM-5.3DeepSeek-V4-Pro分差
Vibe Code Bench v1.178.1219 / 60Max (With Tools)82.3013 / 60Max (With Tools)-4.18

算法与竞赛编程

GLM-5.3 领先 1/1
评测项GLM-5.3DeepSeek-V4-Pro分差
IOI (Vals v2)68.448 / 26Max (With Tools)51.6117 / 26Max (With Tools)+16.83

维护、优化与工程管理

GLM-5.3 领先 1/1
评测项GLM-5.3DeepSeek-V4-Pro分差
Code Migration44.2217 / 43Max (With Tools)41.5420 / 43Max (With Tools)+2.68

自主开发与终端任务

GLM-5.3 领先 1/1
评测项GLM-5.3DeepSeek-V4-Pro分差
Terminal-Bench 4.041.8220 / 97Max (With Tools)14.6045 / 97Max (With Tools)+27.22

跨能力综合测试

GLM-5.3 领先 1/1
评测项GLM-5.3DeepSeek-V4-Pro分差
SuperCLUE71.294 / 13Reported best (effort unspecified)70.106 / 13Reported best (effort unspecified)+1.19

跨能力聚合指数

GLM-5.3 领先 1/1
评测项GLM-5.3DeepSeek-V4-Pro分差
Vals Index56.9723 / 42Max (With Tools)52.3729 / 42Max (With Tools)+4.60

规格对比

字段GLM-5.3DeepSeek-V4-Pro
发布机构智谱AIDeepSeek-AI
发布时间2026-08-142026-08-13
模型类型推理大模型推理大模型
架构MoE 架构MoE 架构
参数规模7440亿1.6万亿
上下文长度1M1M
最大输出128K384K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项GLM-5.3DeepSeek-V4-Pro
文本输入$1.4 / 1M tokens$0.435 / 1M tokens
文本输出$4.4 / 1M tokens$0.87 / 1M tokens
缓存读取$0.26 / 1M tokens$0.003625 / 1M tokens

小结

  • GLM-5.3在以下类目领先:数学 (2/3)、金融 (3/3)、临床工作与医疗决策 (2/2)、法律 (2/2)、仓库修复与多文件工程 (1/1)、写作与创意表达 (1/1)、客服与业务流程 (1/1)、漏洞利用 (1/1)、科学计算与科研编程 (1/1)、算法与竞赛编程 (1/1)、维护、优化与工程管理 (1/1)、自主开发与终端任务 (1/1)、跨能力综合测试 (1/1)、跨能力聚合指数 (1/1)
  • DeepSeek-V4-Pro在以下类目领先:文档与图表理解 (1/1)、程序生成与编辑 (1/1)

22 个共同 benchmark 上,GLM-5.3 平均高出 31.95 分。

单项差距最大的 benchmark:Creative Writing — GLM-5.3 2,075,DeepSeek-V4-Pro 1,553(分差 +521.80)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。