DataLearner 标志

DeepSeek V3.2vsDeepSeek-V3.1

在 9 个共同 benchmark 中,DeepSeek V3.2 整体领先:DeepSeek V3.2 领先 8 项,DeepSeek-V3.1 领先 1 项,持平 0 项,平均分差 +17.48。

DeepSeek-AI
DeepSeek V3.2

DeepSeek-AI · 2025-12-01 · 推理大模型

DeepSeek-AI
DeepSeek-V3.1

DeepSeek-AI · 2025-08-20 · 聊天大模型

DeepSeek V3.28 (89%)(11%)1 DeepSeek-V3.1

评测分数

按能力类目分组,每组内按分差大小排列;共 9 项。

Agent Level Benchmark

DeepSeek V3.2 领先 2/2
评测项DeepSeek V3.2DeepSeek-V3.1分差
τ²-Bench - Telecom78.90117 / 264Normal (With Tools)34.80197 / 264Normal (With Tools)+44.10
Terminal Bench Hard32.6093 / 244Normal (With Tools)24.20134 / 244Normal (With Tools)+8.40

Coding and Software Engineer

DeepSeek V3.2 领先 1/1
评测项DeepSeek V3.2DeepSeek-V3.1分差
LiveCodeBench59.30133 / 250Normal (No Tools)56.40145 / 250Normal (No Tools)+2.90

General Knowledge

DeepSeek V3.2 领先 1/1
评测项DeepSeek V3.2DeepSeek-V3.1分差
HLE11.20375 / 563Normal (No Tools) · Text only6.70449 / 563Normal (No Tools) · Text only+4.50

Instruction Following

DeepSeek V3.2 领先 1/1
评测项DeepSeek V3.2DeepSeek-V3.1分差
IF Bench49161 / 282Normal (No Tools)37.80232 / 282Normal (No Tools)+11.20

Long Context

DeepSeek-V3.1 领先 1/1
评测项DeepSeek V3.2DeepSeek-V3.1分差
AA-LCR45.70144 / 170Normal (No Tools)47140 / 170Normal (No Tools)-1.30

Math and Reasoning

DeepSeek V3.2 领先 1/1
评测项DeepSeek V3.2DeepSeek-V3.1分差
AIME202559139 / 215Normal (No Tools)49.70154 / 215Normal (No Tools)+9.30

Writing and Creative Capabilities

DeepSeek V3.2 领先 1/1
评测项DeepSeek V3.2DeepSeek-V3.1分差
Creative Writing1,51149 / 106Normal (No Tools)1,43357 / 106Normal (No Tools)+78

科学与综合推理

DeepSeek V3.2 领先 1/1
评测项DeepSeek V3.2DeepSeek-V3.1分差
GPQA Diamond75.10279 / 462Normal (No Tools)74.90283 / 462Normal (No Tools)+0.20

规格对比

字段DeepSeek V3.2DeepSeek-V3.1
发布机构DeepSeek-AIDeepSeek-AI
发布时间2025-12-012025-08-20
模型类型推理大模型聊天大模型
架构MoE 架构MoE 架构
参数规模6710亿6710亿
上下文长度128K128K
最大输出8K8K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项DeepSeek V3.2DeepSeek-V3.1
文本输入$0.28 / 1M tokens$0.56 / 1M tokens
文本输出$0.42 / 1M tokens$1.68 / 1M tokens
缓存读取$0.028 / 1M tokens$0.28 / 1M tokens
缓存写入$0.28 / 1M tokens$0.56 / 1M tokens

小结

  • DeepSeek V3.2在以下类目领先:Agent Level Benchmark (2/2)、Coding and Software Engineer (1/1)、General Knowledge (1/1)、Instruction Following (1/1)、Math and Reasoning (1/1)、Writing and Creative Capabilities (1/1)、科学与综合推理 (1/1)
  • DeepSeek-V3.1在以下类目领先:Long Context (1/1)

9 个共同 benchmark 上,DeepSeek V3.2 平均高出 17.48 分。

单项差距最大的 benchmark:Creative Writing — DeepSeek V3.2 1,511,DeepSeek-V3.1 1,433(分差 +78)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。