DataLearner 标志

DeepSeek-V4-ProvsGLM 5.1

在 8 个共同 benchmark 中,GLM 5.1 整体领先:DeepSeek-V4-Pro 领先 3 项,GLM 5.1 领先 5 项,持平 0 项,平均分差 -8.58。

DeepSeek-AI
DeepSeek-V4-Pro

DeepSeek-AI · 2026-08-13 · 推理大模型

智谱AI
GLM 5.1

智谱AI · 2026-03-27 · 推理大模型

DeepSeek-V4-Pro3 (38%)(63%)5 GLM 5.1

评测分数

按能力类目分组,每组内按分差大小排列;共 8 项。

General Knowledge

胶着 2/2
评测项DeepSeek-V4-ProGLM 5.1分差
HLE8.20416 / 563Normal (No Tools) · Text only27.90226 / 563Normal (No Tools) · Text only-19.70
LiveBench71.5732 / 117Normal (No Tools)70.1837 / 117Normal (No Tools)+1.39

Claw-style Agent Evaluation

DeepSeek-V4-Pro 领先 1/1
评测项DeepSeek-V4-ProGLM 5.1分差
PinchBench v261.0732 / 45Reported best (effort unspecified)59.9533 / 45Reported best (effort unspecified)+1.12

Long Context

GLM 5.1 领先 1/1
评测项DeepSeek-V4-ProGLM 5.1分差
AA-LCR53135 / 170Normal (No Tools)53.30134 / 170Normal (No Tools)-0.30

Text Embedding

DeepSeek-V4-Pro 领先 1/1
评测项DeepSeek-V4-ProGLM 5.1分差
Context Arena31.43115 / 126Normal (No Tools)30.29116 / 126Normal (No Tools)+1.14

Writing and Creative Capabilities

GLM 5.1 领先 1/1
评测项DeepSeek-V4-ProGLM 5.1分差
Creative Writing1,55247 / 106Normal (No Tools)1,58940 / 106Normal (No Tools)-37.10

常识推理

GLM 5.1 领先 1/1
评测项DeepSeek-V4-ProGLM 5.1分差
SimpleBench50.9050 / 93Normal (No Tools)55.1042 / 93Normal (No Tools)-4.20

科学与综合推理

GLM 5.1 领先 1/1
评测项DeepSeek-V4-ProGLM 5.1分差
GPQA Diamond72.90301 / 462Normal (No Tools)83.90180 / 462Normal (No Tools)-11

规格对比

字段DeepSeek-V4-ProGLM 5.1
发布机构DeepSeek-AI智谱AI
发布时间2026-08-132026-03-27
模型类型推理大模型推理大模型
架构MoE 架构MoE 架构
参数规模1.6万亿7540亿
上下文长度1M200K
最大输出384K125K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项DeepSeek-V4-ProGLM 5.1
文本输入$0.435 / 1M tokens$1.4 / 1M tokens
文本输出$0.87 / 1M tokens$4.4 / 1M tokens
缓存读取$0.003625 / 1M tokens$4.4 / 1M tokens
缓存写入暂无公开价格$0.26 / 1M tokens

小结

  • DeepSeek-V4-Pro在以下类目领先:Claw-style Agent Evaluation (1/1)、Text Embedding (1/1)
  • GLM 5.1在以下类目领先:Long Context (1/1)、Writing and Creative Capabilities (1/1)、常识推理 (1/1)、科学与综合推理 (1/1)
  • 胶着类目:General Knowledge

8 个共同 benchmark 上,GLM 5.1 平均高出 8.58 分。

单项差距最大的 benchmark:Creative Writing — DeepSeek-V4-Pro 1,552,GLM 5.1 1,589(分差 -37.10)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。