DataLearner 标志
DE

DeepSeek V3.2

推理大模型DeepSeek VDeepSeek V3.2

DeepSeek V3.2 (正式版)

发布时间: 2025-12-01更新于: 2026-07-17浏览量: 6,309
模型参数
6710亿
上下文长度
128K
多语言支持
支持
推理能力
4/5

DeepSeek V3.2 是 DeepSeek 于2026年1月发布的通用旗舰模型,671B 参数,采用 DSA 稀疏注意力机制,结合大规模强化学习与 agent 任务合成训练,性能对标 GPT-5,支持工具调用与思考模式,MIT 协议开源。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

DeepSeek V3.2

模型基本信息

推理过程
支持
思考模式
思考模式 (默认)常规模式
上下文长度
128K tokens
最大输出长度
8K tokens
模型类型
推理大模型
输入/输出模态
文本 → 文本
发布时间
2025-12-01
模型文件大小
1.34TB
MoE架构
总参数 / 激活参数
6710亿 / 370亿
知识截止
暂无数据
DeepSeek V3.2

开源和体验地址

DeepSeek V3.2

官方介绍与博客

DeepSeek V3.2

API接口信息

接口速度
3/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.280/ 1M tokens$0.420/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-$0.280/ 1M tokens$0.028/ 1M tokens
文本-$0.280/ 1M tokens
缓存状态 = write
文本-$0.028/ 1M tokens
缓存状态 = hit

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

DeepSeek V3.2

评测结果

DeepSeek V3.2 当前已收录的代表性评测结果包括 LiveCodeBench(40 / 251,得分 83.30)、AIME2025(40 / 216,得分 93.10)、τ²-Bench - Telecom(63 / 264,得分 90.60)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

综合评估

共 9 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
51.84
89 / 117
LiveBench
思考模式
62.20
60 / 117
ARC-AGI-1
思考模式
57
100 / 147
HLE
常规模式
11.20
377 / 565
HLE
思考模式
25.10
251 / 565
HLE
思考模式
24.60
255 / 565
ARC-AGI-2
思考模式
4.03
112 / 136
CritPt
常规模式
0.90
159 / 201
CritPt
思考模式
2.90
116 / 201

科学与综合推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
75.10
280 / 463
GPQA Diamond
思考模式
82.40
202 / 463

编程与软件工程

共 6 项评测
评测名称 / 模式
得分
排名/总数
CodeForces
思考模式
2386
12 / 21
LiveCodeBench
常规模式
59.30
134 / 251
LiveCodeBench
思考模式
83.30
40 / 251
SWE-bench Verified
思考模式
70.20
62 / 116
SWE-bench Verified
思考模式工具
73.10
50 / 116
40.90
56 / 62

数学推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
常规模式
59
140 / 216
AIME2025
思考模式
93.10
40 / 216
AIME 2026
思考模式
92.70
19 / 30
2.10
56 / 80

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1511.20
49 / 106

Agent能力评测

共 5 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
常规模式工具
78.90
117 / 264
τ²-Bench - Telecom
思考模式工具
90.60
63 / 264
τ²-Bench
思考模式工具
80.30
14 / 44
Terminal Bench Hard
常规模式工具
32.60
93 / 244
Terminal Bench Hard
思考模式工具
35.60
70 / 244

指令跟随

共 2 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
49
161 / 282
IF Bench
思考模式
60.70
118 / 282

AI Agent - 信息收集

共 1 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
思考模式
51.40
45 / 58

AI Agent - 工具使用

共 2 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
思考模式工具
46.80
138 / 194
Terminal Bench 2.0
思考模式工具
46.40
41 / 48

长上下文能力

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
常规模式
45.70
145 / 171

OpenClaw智能体能力综合测评

共 2 项评测
评测名称 / 模式
得分
排名/总数
Pinch Bench
思考模式工具
84.30
19 / 38
Claw Bench
思考模式工具
79
21 / 29

和其他模型对比

DeepSeek V3.2

发布机构

DeepSeek V3.2 (正式版)

模型解读

DeepSeek V3.2 系列共包含三个版本:V3.2-Exp、V3.2 正式版和 V3.2-Speciale。V3.2-Exp 是2025年9月发布的实验版本,用于验证新架构;V3.2 正式版于2026年1月发布,是完成完整后训练流程的通用旗舰版本;V3.2-Speciale 是同期发布的高算力推理变体,专为极限推理场景设计。

DeepSeek V3.2 正式版于2026年1月10日发布,总参数 671B,每个 token 激活 37B 参数,上下文窗口 128K,知识截止日期为2025年5月,MIT 协议开源。架构上沿用了 V3.2-Exp 已验证的 DSA 稀疏注意力机制,但后训练部分做了大幅扩展,是 V3.2 系列中面向通用场景的完整产品版本。

后训练阶段,DeepSeek 在 V3.2 上做了两项较大的投入。一是大幅扩展强化学习的计算预算,后训练阶段消耗的算力超过预训练总量的 10%,通过规模化 RL 来提升模型的推理与规划能力,而不只是依赖预训练数据的堆砌。二是构建了大规模 agent 任务合成流水线,覆盖超过 1,800 个不同环境和 85,000 个 agent 任务,涵盖搜索、编程、工具调用等场景,为 RL 训练提供数据支撑。这批合成任务的难度足够高——即使是 frontier 闭源模型在这些任务上的准确率也不超过 62%,确保了 RL 训练的有效性。

V3.2 也是 DeepSeek 首个将思考链整合进工具调用流程的模型,同时支持思考模式和非思考模式下的工具调用。这使得模型在执行多步 agent 任务时,可以在调用外部工具之前先生成推理过程,而不是直接执行。

性能方面,V3.2 在多个推理 benchmark 上达到了与 GPT-5 和 Kimi K2-thinking 相近的水平,在 agent 场景下的表现也显著缩小了与闭源前沿模型的差距。

DeepSeek V3.2

常见问题

DeepSeek V3.2 是什么模型?

DeepSeek V3.2 是 DeepSeek 于2026年1月发布的通用旗舰模型,671B 参数,采用 DSA 稀疏注意力机制,结合大规模强化学习与 agent 任务合成训练,性能对标 GPT-5,支持工具调用与思考模式,MIT 协议开源。

DeepSeek V3.2 支持哪些输入和输出模态?

当前官方资料记录其支持文本输入,并生成文本输出。

DeepSeek V3.2 的上下文窗口和最大输出是多少?

上下文窗口为 128K,最大输出为 8K。未公开或无法确认的规格不做推测。

DeepSeek V3.2 适合哪些任务?

根据已收录的官方能力标签,它适合推理大模型、多语言相关任务;实际效果应结合具体工作流验证。

DeepSeek V3.2 是否提供 API,价格如何查看?

页面已收录 DeepSeek-AI 的 6 条定价规则。价格可能随地域、上下文档位、缓存和时间变化,应以页面价格表及官方计费页为准。

DeepSeek V3.2 是否开源?

代码与模型权重按 DEEPSEEK LICENSE AGREEMENT 记录;使用前仍应核对官方许可原文。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码