GLM-5.3vsKimi K3
在 36 个共同 benchmark 中,GLM-5.3 整体领先:GLM-5.3 领先 19 项,Kimi K3 领先 16 项,持平 1 项,平均分差 -0.55。
GLM-5.319 项(53%)持平1(44%)16 项Kimi K3
评测分数
按能力类目分组,每组内按分差大小排列;共 36 项。
仓库修复与多文件工程
Kimi K3 领先 3/6| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| SWE-Bench Pro V2 Hard | 84.307 / 11Max (With Tools) | 88.204 / 11Max (With Tools) | -3.90 |
| FrontierSWE | 78.102 / 4Max (With Tools) | 81.201 / 4Max (With Tools) | -3.10 |
| SWE-Bench Pro V2 | 95.605 / 10Max (With Tools) | 97.703 / 10Max (With Tools) | -2.10 |
| SWE-Marathon | 42.503 / 7Max (With Tools) | 424 / 7Max (With Tools) | +0.50 |
| DeepSWE | 68.9623 / 91Max (With Tools) | 68.5127 / 91Max (With Tools) | +0.45 |
| NL2Repo-Bench | 586 / 16Max (With Tools) | 586 / 16Max (With Tools) | 持平 |
数学
Kimi K3 领先 3/3| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| ProofBench v1.1 (Lean 4) | 4919 / 28Max (With Tools) | 876 / 28Max (With Tools) | -38 |
| FrontierMath Tier 4 v2 | 29.2720 / 42Max (No Tools) | 39.0215 / 42Max (No Tools) | -9.76 |
| FrontierMath v2 | 68.7716 / 58Max (No Tools) | 72.1813 / 58Max (No Tools) | -3.41 |
金融
GLM-5.3 领先 2/3| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| EMB (Excel Modeling) | 56.3430 / 42Max (With Tools) | 66.4015 / 42Max (With Tools) | -10.06 |
| Tax Agent Bench | 73.093 / 20Max (With Tools) | 68.677 / 20Max (With Tools) | +4.42 |
| Finance Agent v2 | 55.8414 / 42Max (With Tools) | 54.4017 / 42Max (With Tools) | +1.44 |
临床工作与医疗决策
胶着 2/2| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| MedCode | 42.8637 / 64Max (With Tools) | 48.8819 / 64Max (With Tools) | -6.02 |
| MedScribe | 88.818 / 66Max (With Tools) | 87.9610 / 66Max (With Tools) | +0.85 |
法律
胶着 2/2| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| Legal Research Bench | 49.046 / 42Max (With Tools) | 44.2011 / 42Max (With Tools) | +4.84 |
| Harvey's Legal Agent Benchmark | 8.3314 / 43Max (With Tools) | 10.8310 / 43Max (With Tools) | -2.50 |
科学计算与科研编程
胶着 2/2| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| Terminal-Bench-Science 0.1 | 8.1010 / 13Max (With Tools) | 7.1011 / 13Max (With Tools) | +1 |
| SciCode | 599 / 134Max (No Tools) | 59.508 / 134Max (No Tools) | -0.50 |
程序生成与编辑
胶着 2/2| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| Vibe Code Bench v1.1 | 78.1219 / 60Max (With Tools) | 84.969 / 60Max (With Tools) | -6.84 |
| Program Bench | 1910 / 15Max (With Tools) | 17.5012 / 15Max (With Tools) | +1.50 |
跨应用与工具编排
胶着 2/2| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| Toolathlon-Verified | 7312 / 14Max (With Tools) | 76.504 / 14Max (With Tools) | -3.50 |
| Agents' Last Exam | 28.5012 / 24Max (With Tools) | 27.6013 / 24Max (With Tools) | +0.90 |
写作与创意表达
Kimi K3 领先 1/1| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| Creative Writing | 2,0756 / 110Normal (No Tools) | 2,0825 / 110Normal (No Tools) | -7.30 |
办公与文档流程
GLM-5.3 领先 1/1| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| AutomationBench | 48.807 / 24Max (With Tools) | 46.709 / 24Max (With Tools) | +2.10 |
客服与业务流程
GLM-5.3 领先 1/1| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| Public Benefits Bench v1.1 | 68.545 / 26Max (With Tools) | 68.277 / 26Max (With Tools) | +0.27 |
常识推理
GLM-5.3 领先 1/1| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| SimpleBench | 66.2023 / 96Max (No Tools) | 60.7034 / 96Max (No Tools) | +5.50 |
文档与图表理解
Kimi K3 领先 1/1| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| GDP.pdf | 11.2077 / 122Max (No Tools) | 2230 / 122Max (No Tools) | -10.80 |
机器学习工程
GLM-5.3 领先 1/1| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| PostTrain Bench | 39.801 / 5Max (With Tools) | 36.603 / 5Max (With Tools) | +3.20 |
漏洞发现与分析
GLM-5.3 领先 1/1| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| CyberGym | 84.505 / 11Max (With Tools) | 808 / 11Max (With Tools) | +4.50 |
科学知识与推理
Kimi K3 领先 1/1| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| CritPt | 19.1043 / 204Max (No Tools) | 23.4030 / 204Max (No Tools) | -4.30 |
算法与竞赛编程
GLM-5.3 领先 1/1| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| IOI (Vals v2) | 68.448 / 26Max (With Tools) | 48.9418 / 26Max (With Tools) | +19.50 |
维护、优化与工程管理
GLM-5.3 领先 1/1| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| Code Migration | 44.2217 / 43Max (With Tools) | 16.1034 / 43Max (With Tools) | +28.12 |
综合知识考试
GLM-5.3 领先 1/1| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| HLE | 62.507 / 235Max (With Tools) | 59.8010 / 235Max (With Tools) | +2.70 |
自主开发与终端任务
GLM-5.3 领先 1/1| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| Terminal-Bench 3.0 | 28.306 / 11Max (With Tools) | 17.708 / 11Max (With Tools) | +10.60 |
跨能力综合测试
GLM-5.3 领先 1/1| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| SuperCLUE | 71.294 / 13Reported best (effort unspecified) | 70.685 / 13Reported best (effort unspecified) | +0.61 |
跨能力聚合指数
Kimi K3 领先 1/1| 评测项 | GLM-5.3 | Kimi K3 | 分差 |
|---|---|---|---|
| Vals Index | 56.9723 / 42Max (With Tools) | 57.8120 / 42Max (With Tools) | -0.84 |
规格对比
| 字段 | GLM-5.3 | Kimi K3 |
|---|---|---|
| 发布机构 | 智谱AI | Moonshot AI |
| 发布时间 | 2026-08-14 | 2026-07-16 |
| 模型类型 | 推理大模型 | 推理大模型 |
| 架构 | MoE 架构 | MoE 架构 |
| 参数规模 | 7440亿 | 2.8万亿 |
| 上下文长度 | 1M | 1M |
| 最大输出 | 128K | 1M |
API 调用价格
价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。
| 价格项 | GLM-5.3 | Kimi K3 |
|---|---|---|
| 文本输入 | $1.4 / 1M tokens | ¥20 / 1M tokens |
| 文本输出 | $4.4 / 1M tokens | ¥100 / 1M tokens |
| 缓存读取 | $0.26 / 1M tokens | ¥2 / 1M tokens |
小结
- GLM-5.3在以下类目领先:金融 (2/3)、办公与文档流程 (1/1)、客服与业务流程 (1/1)、常识推理 (1/1)、机器学习工程 (1/1)、漏洞发现与分析 (1/1)、算法与竞赛编程 (1/1)、维护、优化与工程管理 (1/1)、综合知识考试 (1/1)、自主开发与终端任务 (1/1)、跨能力综合测试 (1/1)
- Kimi K3在以下类目领先:仓库修复与多文件工程 (3/6)、数学 (3/3)、写作与创意表达 (1/1)、文档与图表理解 (1/1)、科学知识与推理 (1/1)、跨能力聚合指数 (1/1)
- 胶着类目:临床工作与医疗决策、法律、科学计算与科研编程、程序生成与编辑、跨应用与工具编排
36 个共同 benchmark 上,Kimi K3 平均高出 0.55 分。
单项差距最大的 benchmark:ProofBench v1.1 (Lean 4) — GLM-5.3 49,Kimi K3 87(分差 -38)。
本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。