DeepSeek-V4-ProvsQwen3.8-Max
在 11 个共同 benchmark 中,Qwen3.8-Max 整体领先:DeepSeek-V4-Pro 领先 5 项,Qwen3.8-Max 领先 6 项,持平 0 项,平均分差 -12.67。
DeepSeek-V4-Pro
DeepSeek-AI · 2026-08-13 · 推理大模型
Qwen3.8-Max
阿里巴巴 · 2026-08-03 · 推理大模型
DeepSeek-V4-Pro5 项(45%)(55%)6 项Qwen3.8-Max
评测分数
按能力类目分组,每组内按分差大小排列;共 11 项。
AI Agent - Tool Usage
DeepSeek-V4-Pro 领先 3/3| 评测项 | DeepSeek-V4-Pro | Qwen3.8-Max | 分差 |
|---|---|---|---|
| AutomationBench | 31.802 / 8极高强度思考(工具) | 27.305 / 8极高强度思考(工具) | +4.50 |
| Toolathlon-Verified | 74.102 / 5极高强度思考(工具) | 72.504 / 5极高强度思考(工具) | +1.60 |
| Terminal-Bench 2.1 | 87.906 / 44极高强度思考(工具) | 86.608 / 44极高强度思考(工具) | +1.30 |
Coding and Software Engineer
DeepSeek-V4-Pro 领先 2/3| 评测项 | DeepSeek-V4-Pro | Qwen3.8-Max | 分差 |
|---|---|---|---|
| SWE-Bench Pro - Public | 52.1040 / 57Normal (With Tools) | 67.705 / 57极高强度思考(工具) | -15.60 |
| DeepSWE | 62.7011 / 27极高强度思考(工具) | 56.6014 / 27极高强度思考(工具) | +6.10 |
| NL2Repo-Bench | 61.501 / 8极高强度思考(工具) | 55.904 / 8极高强度思考(工具) | +5.60 |
Math and Reasoning
Qwen3.8-Max 领先 2/2| 评测项 | DeepSeek-V4-Pro | Qwen3.8-Max | 分差 |
|---|---|---|---|
| FrontierMath Tier 4 v2 | 2.4430 / 34最高(无工具) | 46.3411 / 34极高强度思考(无工具) | -43.90 |
| FrontierMath v2 | 45.2626 / 34最高(无工具) | 74.7411 / 34极高强度思考(无工具) | -29.47 |
Agent Level Benchmark
Qwen3.8-Max 领先 1/1| 评测项 | DeepSeek-V4-Pro | Qwen3.8-Max | 分差 |
|---|---|---|---|
| Agents' Last Exam | 25.709 / 11极高强度思考(工具) | 277 / 11极高强度思考(工具) | -1.30 |
General Knowledge
Qwen3.8-Max 领先 1/1| 评测项 | DeepSeek-V4-Pro | Qwen3.8-Max | 分差 |
|---|---|---|---|
| HLE | 7.70165 / 181Normal (No Tools) | 56.2013 / 181极高强度思考(工具) | -48.50 |
科学与综合推理
Qwen3.8-Max 领先 1/1| 评测项 | DeepSeek-V4-Pro | Qwen3.8-Max | 分差 |
|---|---|---|---|
| GPQA Diamond | 72.90147 / 226Normal (No Tools) | 92.6021 / 226极高强度思考(无工具) | -19.70 |
规格对比
| 字段 | DeepSeek-V4-Pro | Qwen3.8-Max |
|---|---|---|
| 发布机构 | DeepSeek-AI | 阿里巴巴 |
| 发布时间 | 2026-08-13 | 2026-08-03 |
| 模型类型 | 推理大模型 | 推理大模型 |
| 架构 | MoE 架构 | MoE 架构 |
| 参数规模 | 1.6万亿 | 2.4万亿 |
| 上下文长度 | 1M | 1M |
| 最大输出 | 384K | 128K |
API 调用价格
价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。
| 价格项 | DeepSeek-V4-Pro | Qwen3.8-Max |
|---|---|---|
| 文本输入 | $0.435 / 1M tokens | ¥12 / 1M tokens |
| 文本输出 | $0.87 / 1M tokens | ¥36 / 1M tokens |
| 缓存读取 | $0.003625 / 1M tokens | ¥1.5 / 1M tokens |
小结
- DeepSeek-V4-Pro在以下类目领先:AI Agent - Tool Usage (3/3)、Coding and Software Engineer (2/3)
- Qwen3.8-Max在以下类目领先:Math and Reasoning (2/2)、Agent Level Benchmark (1/1)、General Knowledge (1/1)、科学与综合推理 (1/1)
11 个共同 benchmark 上,Qwen3.8-Max 平均高出 12.67 分。
单项差距最大的 benchmark:HLE — DeepSeek-V4-Pro 7.70,Qwen3.8-Max 56.20(分差 -48.50)。
本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。