DataLearner 标志

DeepSeek-V4-ProvsQwen3.8-Max

在 11 个共同 benchmark 中,Qwen3.8-Max 整体领先:DeepSeek-V4-Pro 领先 5 项,Qwen3.8-Max 领先 6 项,持平 0 项,平均分差 -12.67。

DeepSeek-AI
DeepSeek-V4-Pro

DeepSeek-AI · 2026-08-13 · 推理大模型

阿里巴巴
Qwen3.8-Max

阿里巴巴 · 2026-08-03 · 推理大模型

DeepSeek-V4-Pro5 (45%)(55%)6 Qwen3.8-Max

评测分数

按能力类目分组,每组内按分差大小排列;共 11 项。

AI Agent - Tool Usage

DeepSeek-V4-Pro 领先 3/3
评测项DeepSeek-V4-ProQwen3.8-Max分差
AutomationBench31.802 / 8极高强度思考(工具)27.305 / 8极高强度思考(工具)+4.50
Toolathlon-Verified74.102 / 5极高强度思考(工具)72.504 / 5极高强度思考(工具)+1.60
Terminal-Bench 2.187.906 / 44极高强度思考(工具)86.608 / 44极高强度思考(工具)+1.30

Coding and Software Engineer

DeepSeek-V4-Pro 领先 2/3
评测项DeepSeek-V4-ProQwen3.8-Max分差
SWE-Bench Pro - Public52.1040 / 57Normal (With Tools)67.705 / 57极高强度思考(工具)-15.60
DeepSWE62.7011 / 27极高强度思考(工具)56.6014 / 27极高强度思考(工具)+6.10
NL2Repo-Bench61.501 / 8极高强度思考(工具)55.904 / 8极高强度思考(工具)+5.60

Math and Reasoning

Qwen3.8-Max 领先 2/2
评测项DeepSeek-V4-ProQwen3.8-Max分差
FrontierMath Tier 4 v22.4430 / 34最高(无工具)46.3411 / 34极高强度思考(无工具)-43.90
FrontierMath v245.2626 / 34最高(无工具)74.7411 / 34极高强度思考(无工具)-29.47

Agent Level Benchmark

Qwen3.8-Max 领先 1/1
评测项DeepSeek-V4-ProQwen3.8-Max分差
Agents' Last Exam25.709 / 11极高强度思考(工具)277 / 11极高强度思考(工具)-1.30

General Knowledge

Qwen3.8-Max 领先 1/1
评测项DeepSeek-V4-ProQwen3.8-Max分差
HLE7.70165 / 181Normal (No Tools)56.2013 / 181极高强度思考(工具)-48.50

科学与综合推理

Qwen3.8-Max 领先 1/1
评测项DeepSeek-V4-ProQwen3.8-Max分差
GPQA Diamond72.90147 / 226Normal (No Tools)92.6021 / 226极高强度思考(无工具)-19.70

规格对比

字段DeepSeek-V4-ProQwen3.8-Max
发布机构DeepSeek-AI阿里巴巴
发布时间2026-08-132026-08-03
模型类型推理大模型推理大模型
架构MoE 架构MoE 架构
参数规模1.6万亿2.4万亿
上下文长度1M1M
最大输出384K128K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项DeepSeek-V4-ProQwen3.8-Max
文本输入$0.435 / 1M tokens¥12 / 1M tokens
文本输出$0.87 / 1M tokens¥36 / 1M tokens
缓存读取$0.003625 / 1M tokens¥1.5 / 1M tokens

小结

  • DeepSeek-V4-Pro在以下类目领先:AI Agent - Tool Usage (3/3)、Coding and Software Engineer (2/3)
  • Qwen3.8-Max在以下类目领先:Math and Reasoning (2/2)、Agent Level Benchmark (1/1)、General Knowledge (1/1)、科学与综合推理 (1/1)

11 个共同 benchmark 上,Qwen3.8-Max 平均高出 12.67 分。

单项差距最大的 benchmark:HLE — DeepSeek-V4-Pro 7.70,Qwen3.8-Max 56.20(分差 -48.50)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。