DataLearner 标志

GLM-5.3vsKimi K3

在 36 个共同 benchmark 中,GLM-5.3 整体领先:GLM-5.3 领先 19 项,Kimi K3 领先 16 项,持平 1 项,平均分差 -0.55。

智谱AI
GLM-5.3

智谱AI · 2026-08-14 · 推理大模型

Moonshot AI
Kimi K3

Moonshot AI · 2026-07-16 · 推理大模型

GLM-5.319 项(53%)持平1(44%)16 项Kimi K3

评测分数

按能力类目分组,每组内按分差大小排列;共 36 项。

仓库修复与多文件工程

Kimi K3 领先 3/6
评测项GLM-5.3Kimi K3分差
SWE-Bench Pro V2 Hard84.307 / 11Max (With Tools)88.204 / 11Max (With Tools)-3.90
FrontierSWE78.102 / 4Max (With Tools)81.201 / 4Max (With Tools)-3.10
SWE-Bench Pro V295.605 / 10Max (With Tools)97.703 / 10Max (With Tools)-2.10
SWE-Marathon42.503 / 7Max (With Tools)424 / 7Max (With Tools)+0.50
DeepSWE68.9623 / 91Max (With Tools)68.5127 / 91Max (With Tools)+0.45
NL2Repo-Bench586 / 16Max (With Tools)586 / 16Max (With Tools)持平

数学

Kimi K3 领先 3/3
评测项GLM-5.3Kimi K3分差
ProofBench v1.1 (Lean 4)4919 / 28Max (With Tools)876 / 28Max (With Tools)-38
FrontierMath Tier 4 v229.2720 / 42Max (No Tools)39.0215 / 42Max (No Tools)-9.76
FrontierMath v268.7716 / 58Max (No Tools)72.1813 / 58Max (No Tools)-3.41

金融

GLM-5.3 领先 2/3
评测项GLM-5.3Kimi K3分差
EMB (Excel Modeling)56.3430 / 42Max (With Tools)66.4015 / 42Max (With Tools)-10.06
Tax Agent Bench73.093 / 20Max (With Tools)68.677 / 20Max (With Tools)+4.42
Finance Agent v255.8414 / 42Max (With Tools)54.4017 / 42Max (With Tools)+1.44

临床工作与医疗决策

胶着 2/2
评测项GLM-5.3Kimi K3分差
MedCode42.8637 / 64Max (With Tools)48.8819 / 64Max (With Tools)-6.02
MedScribe88.818 / 66Max (With Tools)87.9610 / 66Max (With Tools)+0.85

法律

胶着 2/2
评测项GLM-5.3Kimi K3分差
Legal Research Bench49.046 / 42Max (With Tools)44.2011 / 42Max (With Tools)+4.84
Harvey's Legal Agent Benchmark8.3314 / 43Max (With Tools)10.8310 / 43Max (With Tools)-2.50

科学计算与科研编程

胶着 2/2
评测项GLM-5.3Kimi K3分差
Terminal-Bench-Science 0.18.1010 / 13Max (With Tools)7.1011 / 13Max (With Tools)+1
SciCode599 / 134Max (No Tools)59.508 / 134Max (No Tools)-0.50

程序生成与编辑

胶着 2/2
评测项GLM-5.3Kimi K3分差
Vibe Code Bench v1.178.1219 / 60Max (With Tools)84.969 / 60Max (With Tools)-6.84
Program Bench1910 / 15Max (With Tools)17.5012 / 15Max (With Tools)+1.50

跨应用与工具编排

胶着 2/2
评测项GLM-5.3Kimi K3分差
Toolathlon-Verified7312 / 14Max (With Tools)76.504 / 14Max (With Tools)-3.50
Agents' Last Exam28.5012 / 24Max (With Tools)27.6013 / 24Max (With Tools)+0.90

写作与创意表达

Kimi K3 领先 1/1
评测项GLM-5.3Kimi K3分差
Creative Writing2,0756 / 110Normal (No Tools)2,0825 / 110Normal (No Tools)-7.30

办公与文档流程

GLM-5.3 领先 1/1
评测项GLM-5.3Kimi K3分差
AutomationBench48.807 / 24Max (With Tools)46.709 / 24Max (With Tools)+2.10

客服与业务流程

GLM-5.3 领先 1/1
评测项GLM-5.3Kimi K3分差
Public Benefits Bench v1.168.545 / 26Max (With Tools)68.277 / 26Max (With Tools)+0.27

常识推理

GLM-5.3 领先 1/1
评测项GLM-5.3Kimi K3分差
SimpleBench66.2023 / 96Max (No Tools)60.7034 / 96Max (No Tools)+5.50

文档与图表理解

Kimi K3 领先 1/1
评测项GLM-5.3Kimi K3分差
GDP.pdf11.2077 / 122Max (No Tools)2230 / 122Max (No Tools)-10.80

机器学习工程

GLM-5.3 领先 1/1
评测项GLM-5.3Kimi K3分差
PostTrain Bench39.801 / 5Max (With Tools)36.603 / 5Max (With Tools)+3.20

漏洞发现与分析

GLM-5.3 领先 1/1
评测项GLM-5.3Kimi K3分差
CyberGym84.505 / 11Max (With Tools)808 / 11Max (With Tools)+4.50

科学知识与推理

Kimi K3 领先 1/1
评测项GLM-5.3Kimi K3分差
CritPt19.1043 / 204Max (No Tools)23.4030 / 204Max (No Tools)-4.30

算法与竞赛编程

GLM-5.3 领先 1/1
评测项GLM-5.3Kimi K3分差
IOI (Vals v2)68.448 / 26Max (With Tools)48.9418 / 26Max (With Tools)+19.50

维护、优化与工程管理

GLM-5.3 领先 1/1
评测项GLM-5.3Kimi K3分差
Code Migration44.2217 / 43Max (With Tools)16.1034 / 43Max (With Tools)+28.12

综合知识考试

GLM-5.3 领先 1/1
评测项GLM-5.3Kimi K3分差
HLE62.507 / 235Max (With Tools)59.8010 / 235Max (With Tools)+2.70

自主开发与终端任务

GLM-5.3 领先 1/1
评测项GLM-5.3Kimi K3分差
Terminal-Bench 3.028.306 / 11Max (With Tools)17.708 / 11Max (With Tools)+10.60

跨能力综合测试

GLM-5.3 领先 1/1
评测项GLM-5.3Kimi K3分差
SuperCLUE71.294 / 13Reported best (effort unspecified)70.685 / 13Reported best (effort unspecified)+0.61

跨能力聚合指数

Kimi K3 领先 1/1
评测项GLM-5.3Kimi K3分差
Vals Index56.9723 / 42Max (With Tools)57.8120 / 42Max (With Tools)-0.84

规格对比

字段GLM-5.3Kimi K3
发布机构智谱AIMoonshot AI
发布时间2026-08-142026-07-16
模型类型推理大模型推理大模型
架构MoE 架构MoE 架构
参数规模7440亿2.8万亿
上下文长度1M1M
最大输出128K1M

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项GLM-5.3Kimi K3
文本输入$1.4 / 1M tokens¥20 / 1M tokens
文本输出$4.4 / 1M tokens¥100 / 1M tokens
缓存读取$0.26 / 1M tokens¥2 / 1M tokens

小结

  • GLM-5.3在以下类目领先:金融 (2/3)、办公与文档流程 (1/1)、客服与业务流程 (1/1)、常识推理 (1/1)、机器学习工程 (1/1)、漏洞发现与分析 (1/1)、算法与竞赛编程 (1/1)、维护、优化与工程管理 (1/1)、综合知识考试 (1/1)、自主开发与终端任务 (1/1)、跨能力综合测试 (1/1)
  • Kimi K3在以下类目领先:仓库修复与多文件工程 (3/6)、数学 (3/3)、写作与创意表达 (1/1)、文档与图表理解 (1/1)、科学知识与推理 (1/1)、跨能力聚合指数 (1/1)
  • 胶着类目:临床工作与医疗决策、法律、科学计算与科研编程、程序生成与编辑、跨应用与工具编排

36 个共同 benchmark 上,Kimi K3 平均高出 0.55 分。

单项差距最大的 benchmark:ProofBench v1.1 (Lean 4) — GLM-5.3 49,Kimi K3 87(分差 -38)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。