GLM-5.3vsGLM 5.1
在 2 个同模式 benchmark 中,GLM-5.3 整体领先:GLM-5.3 领先 2 项,GLM 5.1 领先 0 项,持平 0 项,平均分差 +267.59。另有 11 项测试模式不同,仅供参考。
GLM-5.32 项(100%)(0%)0 项GLM 5.1
评测分数
按能力类目分组,每组内按分差大小排列;共 2 项。
仓库修复与多文件工程
GLM-5.3 领先 1/1| 评测项 | GLM-5.3 | GLM 5.1 | 分差 |
|---|---|---|---|
| FrontierSWE v1 | 78.132 / 17Historical report (mode unspecified) | 25.7413 / 17Historical report (mode unspecified) | +52.39 |
写作与创意表达
GLM-5.3 领先 1/1| 评测项 | GLM-5.3 | GLM 5.1 | 分差 |
|---|---|---|---|
| Creative Writing | 2,0756 / 110Normal (No Tools) | 1,59243 / 110Normal (No Tools) | +482.80 |
测试模式不同的成绩
共 11 项。两款模型的公开成绩来自不同测试模式,分数不直接可比,不计入胜负和平均分差。
| 评测项 | GLM-5.3 | GLM 5.1 |
|---|---|---|
| Terminal-Bench 4.0 | 41.82Max (With Tools) | 2Thinking (With Tools) |
| SimpleBench | 66.20Max (No Tools) | 55.10Normal (No Tools) |
| LiveBench | 76.14Reported best (effort unspecified) | 70.18Normal (No Tools) |
| GDP.pdf | 11.20Max (No Tools) | 8.40Thinking (No Tools) |
| HLE | 62.50Max (With Tools) | 52.30Thinking (With Tools) |
| FrontierMath v2 | 68.77Max (With Tools) | 24.91Normal (With Tools) |
| Context Arena | 88.53Thinking High (No Tools) | 30.29Normal (No Tools) |
| APEX-SWE | 47.50Max (With Tools) | 34.50Reported best (effort unspecified) |
| SciCode | 59Max (No Tools) | 44.80Thinking (No Tools) |
| CritPt | 19.10Max (No Tools) | 4.60Thinking (No Tools) |
| τ³-Banking | 50.30Max (With Tools) | 13.60Thinking (With Tools) |
规格对比
| 字段 | GLM-5.3 | GLM 5.1 |
|---|---|---|
| 发布机构 | 智谱AI | 智谱AI |
| 发布时间 | 2026-08-14 | 2026-03-27 |
| 模型类型 | 推理大模型 | 推理大模型 |
| 架构 | MoE 架构 | MoE 架构 |
| 参数规模 | 7440亿 | 7540亿 |
| 上下文长度 | 1M | 200K |
| 最大输出 | 128K | 125K |
API 调用价格
价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。
| 价格项 | GLM-5.3 | GLM 5.1 |
|---|---|---|
| 文本输入 | $1.4 / 1M tokens | $1.4 / 1M tokens |
| 文本输出 | $4.4 / 1M tokens | $4.4 / 1M tokens |
| 缓存读取 | $0.26 / 1M tokens | $0.26 / 1M tokens |
小结
- GLM-5.3在以下类目领先:仓库修复与多文件工程 (1/1)、写作与创意表达 (1/1)
2 个同模式 benchmark 上,GLM-5.3 平均高出 267.59 分。
单项差距最大的 benchmark:Creative Writing — GLM-5.3 2,075,GLM 5.1 1,592(分差 +482.80)。
本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。