Kimi K3vsGLM-5.2
在 15 个共同 benchmark 中,Kimi K3 整体领先:Kimi K3 领先 14 项,GLM-5.2 领先 1 项,持平 0 项,平均分差 +37.55。
Kimi K314 项(93%)(7%)1 项GLM-5.2
评测分数
按能力类目分组,每组内按分差大小排列;共 15 项。
Coding and Software Engineer
Kimi K3 领先 6/6| 评测项 | Kimi K3 | GLM-5.2 | 分差 |
|---|---|---|---|
| Text Arena (Coding) | 1,6822 / 35Max (No Tools) | 1,5935 / 35Max (No Tools) | +88.50 |
| SWE-Marathon | 423 / 6Max (With Tools) | 136 / 6Max (With Tools) | +29 |
| DeepSWE | 67.509 / 35Max (With Tools) | 4429 / 35Deep Thinking (With Tools) | +23.50 |
| Program Bench | 77.801 / 7Max (With Tools) | 63.702 / 7Thinking (With Tools) | +14.10 |
| FrontierSWE | 81.201 / 4Max (With Tools) | 74.403 / 4Max (With Tools) | +6.80 |
| PostTrain Bench | 36.603 / 5Max (With Tools) | 34.305 / 5Max (With Tools) | +2.30 |
AI Agent - Tool Usage
Kimi K3 领先 2/2| 评测项 | Kimi K3 | GLM-5.2 | 分差 |
|---|---|---|---|
| MCP-Atlas | 84.204 / 41Max (With Tools) | 76.8015 / 41Thinking (With Tools) | +7.40 |
| Terminal-Bench 2.1 | 88.304 / 49Max (With Tools) | 8122 / 49Thinking High (With Tools) | +7.30 |
Math and Reasoning
Kimi K3 领先 2/2| 评测项 | Kimi K3 | GLM-5.2 | 分差 |
|---|---|---|---|
| FrontierMath v2 | 72.1813 / 58Max (No Tools) | 42.4634 / 58Normal (No Tools) | +29.73 |
| FrontierMath Tier 4 v2 | 39.0214 / 41Max (No Tools) | 29.2719 / 41Max (No Tools) | +9.76 |
General Knowledge
Kimi K3 领先 1/1| 评测项 | Kimi K3 | GLM-5.2 | 分差 |
|---|---|---|---|
| HLE | 5617 / 190Max (With Tools) | 54.7020 / 190Thinking (With Tools) | +1.30 |
Text Embedding
GLM-5.2 领先 1/1| 评测项 | Kimi K3 | GLM-5.2 | 分差 |
|---|---|---|---|
| Context Arena | 71.7559 / 126Max (No Tools) | 72.3458 / 126Max (No Tools) | -0.59 |
Writing and Creative Capabilities
Kimi K3 领先 1/1| 评测项 | Kimi K3 | GLM-5.2 | 分差 |
|---|---|---|---|
| Creative Writing | 2,0712 / 99Normal (No Tools) | 1,75119 / 99Normal (No Tools) | +319.90 |
常识推理
Kimi K3 领先 1/1| 评测项 | Kimi K3 | GLM-5.2 | 分差 |
|---|---|---|---|
| SimpleBench | 60.7029 / 92Max (No Tools) | 58.8034 / 92Normal (No Tools) | +1.90 |
科学与综合推理
Kimi K3 领先 1/1| 评测项 | Kimi K3 | GLM-5.2 | 分差 |
|---|---|---|---|
| GPQA Diamond | 93.5016 / 271Max (No Tools) | 71.21188 / 271Normal (No Tools) | +22.29 |
规格对比
| 字段 | Kimi K3 | GLM-5.2 |
|---|---|---|
| 发布机构 | Moonshot AI | 智谱AI |
| 发布时间 | 2026-07-16 | 2026-06-13 |
| 模型类型 | 推理大模型 | 推理大模型 |
| 架构 | MoE 架构 | MoE 架构 |
| 参数规模 | 2.8万亿 | 7533.3亿 |
| 上下文长度 | 1M | 1M |
| 最大输出 | 1M | 128K |
API 调用价格
价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。
| 价格项 | Kimi K3 | GLM-5.2 |
|---|---|---|
| 文本输入 | ¥20 / 1M tokens | $1.4 / 1M tokens |
| 文本输出 | ¥100 / 1M tokens | $4.4 / 1M tokens |
| 缓存读取 | ¥2 / 1M tokens | $0.26 / 1M tokens |
小结
- Kimi K3在以下类目领先:Coding and Software Engineer (6/6)、AI Agent - Tool Usage (2/2)、Math and Reasoning (2/2)、General Knowledge (1/1)、Writing and Creative Capabilities (1/1)、常识推理 (1/1)、科学与综合推理 (1/1)
- GLM-5.2在以下类目领先:Text Embedding (1/1)
15 个共同 benchmark 上,Kimi K3 平均高出 37.55 分。
单项差距最大的 benchmark:Creative Writing — Kimi K3 2,071,GLM-5.2 1,751(分差 +319.90)。
本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。