DeepSeek-V4-ProvsGLM-5.2
在 11 个共同 benchmark 中,GLM-5.2 整体领先:DeepSeek-V4-Pro 领先 4 项,GLM-5.2 领先 7 项,持平 0 项,平均分差 -12.23。
DeepSeek-V4-Pro
DeepSeek-AI · 2026-08-13 · 推理大模型
GLM-5.2
智谱AI · 2026-06-13 · 推理大模型
DeepSeek-V4-Pro4 项(36%)(64%)7 项GLM-5.2
评测分数
按能力类目分组,每组内按分差大小排列;共 11 项。
Coding and Software Engineer
DeepSeek-V4-Pro 领先 2/3| 评测项 | DeepSeek-V4-Pro | GLM-5.2 | 分差 |
|---|---|---|---|
| DeepSWE | 62.7011 / 27极高强度思考(工具) | 4421 / 27Deep Thinking (With Tools) | +18.70 |
| NL2Repo-Bench | 61.501 / 8极高强度思考(工具) | 48.906 / 8Thinking (With Tools) | +12.60 |
| SWE-Bench Pro - Public | 52.1040 / 57Normal (With Tools) | 62.109 / 57Thinking (With Tools) | -10 |
Math and Reasoning
GLM-5.2 领先 3/3| 评测项 | DeepSeek-V4-Pro | GLM-5.2 | 分差 |
|---|---|---|---|
| IMO-AnswerBench | 35.3023 / 23Normal (No Tools) | 912 / 23Thinking (No Tools) | -55.70 |
| FrontierMath Tier 4 v2 | 2.4430 / 34最高(无工具) | 29.2716 / 34最高(无工具) | -26.83 |
| FrontierMath v2 | 45.2626 / 34最高(无工具) | 59.2119 / 34最高(无工具) | -13.94 |
General Knowledge
GLM-5.2 领先 2/2| 评测项 | DeepSeek-V4-Pro | GLM-5.2 | 分差 |
|---|---|---|---|
| HLE | 7.70165 / 181Normal (No Tools) | 54.7015 / 181Thinking (With Tools) | -47 |
| LiveBench | 73.5823 / 115Normal (No Tools) | 76.249 / 115Normal (No Tools) | -2.66 |
AI Agent - Tool Usage
DeepSeek-V4-Pro 领先 1/1| 评测项 | DeepSeek-V4-Pro | GLM-5.2 | 分差 |
|---|---|---|---|
| Terminal-Bench 2.1 | 87.906 / 44极高强度思考(工具) | 8117 / 44Thinking High (With Tools) | +6.90 |
常识推理
DeepSeek-V4-Pro 领先 1/1| 评测项 | DeepSeek-V4-Pro | GLM-5.2 | 分差 |
|---|---|---|---|
| SimpleBench | 61.2016 / 67Normal (No Tools) | 58.8020 / 67Normal (No Tools) | +2.40 |
科学与综合推理
GLM-5.2 领先 1/1| 评测项 | DeepSeek-V4-Pro | GLM-5.2 | 分差 |
|---|---|---|---|
| GPQA Diamond | 72.90147 / 226Normal (No Tools) | 91.8626 / 226最高(无工具) | -18.96 |
规格对比
| 字段 | DeepSeek-V4-Pro | GLM-5.2 |
|---|---|---|
| 发布机构 | DeepSeek-AI | 智谱AI |
| 发布时间 | 2026-08-13 | 2026-06-13 |
| 模型类型 | 推理大模型 | 推理大模型 |
| 架构 | MoE 架构 | MoE 架构 |
| 参数规模 | 1.6万亿 | 7533.3亿 |
| 上下文长度 | 1M | 1M |
| 最大输出 | 384K | 128K |
API 调用价格
价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。
| 价格项 | DeepSeek-V4-Pro | GLM-5.2 |
|---|---|---|
| 文本输入 | $0.435 / 1M tokens | $1.4 / 1M tokens |
| 文本输出 | $0.87 / 1M tokens | $4.4 / 1M tokens |
| 缓存读取 | $0.003625 / 1M tokens | $0.26 / 1M tokens |
小结
- DeepSeek-V4-Pro在以下类目领先:Coding and Software Engineer (2/3)、AI Agent - Tool Usage (1/1)、常识推理 (1/1)
- GLM-5.2在以下类目领先:Math and Reasoning (3/3)、General Knowledge (2/2)、科学与综合推理 (1/1)
11 个共同 benchmark 上,GLM-5.2 平均高出 12.23 分。
单项差距最大的 benchmark:IMO-AnswerBench — DeepSeek-V4-Pro 35.30,GLM-5.2 91(分差 -55.70)。
本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。