DataLearner 标志

DeepSeek-V4-ProvsQwen3.7-Max-Preview

在 9 个共同 benchmark 中,Qwen3.7-Max-Preview 整体领先:DeepSeek-V4-Pro 领先 0 项,Qwen3.7-Max-Preview 领先 9 项,持平 0 项,平均分差 -21.77。

DeepSeek-AI
DeepSeek-V4-Pro

DeepSeek-AI · 2026-08-13 · 推理大模型

阿里巴巴
Qwen3.7-Max-Preview

阿里巴巴 · 2026-05-20 · 推理大模型

DeepSeek-V4-Pro0 (0%)(100%)9 Qwen3.7-Max-Preview

评测分数

按能力类目分组,每组内按分差大小排列;共 9 项。

Coding and Software Engineer

Qwen3.7-Max-Preview 领先 4/4
评测项DeepSeek-V4-ProQwen3.7-Max-Preview分差
LiveCodeBench56.8076 / 123Normal (No Tools)91.604 / 123最高(无工具)-34.80
SWE-bench Multilingual69.8018 / 23Normal (With Tools)78.304 / 23Thinking (With Tools)-8.50
SWE-Bench Pro - Public52.1038 / 55Normal (With Tools)60.6010 / 55Thinking (With Tools)-8.50
SWE-bench Verified73.6046 / 113Normal (With Tools)80.4013 / 113Thinking (With Tools)-6.80

General Knowledge

Qwen3.7-Max-Preview 领先 2/2
评测项DeepSeek-V4-ProQwen3.7-Max-Preview分差
HLE7.70159 / 175Normal (No Tools)53.5016 / 175Thinking (With Tools)-45.80
MMLU Pro82.9048 / 132Normal (No Tools)89.604 / 132最高(无工具)-6.70

AI Agent - Tool Usage

Qwen3.7-Max-Preview 领先 1/1
评测项DeepSeek-V4-ProQwen3.7-Max-Preview分差
Terminal Bench 2.059.1022 / 47Normal (With Tools)69.705 / 47Thinking (With Tools)-10.60

Math and Reasoning

Qwen3.7-Max-Preview 领先 1/1
评测项DeepSeek-V4-ProQwen3.7-Max-Preview分差
IMO-AnswerBench35.3021 / 21Normal (No Tools)902 / 21最高(无工具)-54.70

科学与综合推理

Qwen3.7-Max-Preview 领先 1/1
评测项DeepSeek-V4-ProQwen3.7-Max-Preview分差
GPQA Diamond72.90146 / 225Normal (No Tools)92.4022 / 225最高(无工具)-19.50

规格对比

字段DeepSeek-V4-ProQwen3.7-Max-Preview
发布机构DeepSeek-AI阿里巴巴
发布时间2026-08-132026-05-20
模型类型推理大模型推理大模型
架构MoE 架构稠密模型
参数规模1.6万亿暂无数据
上下文长度1M1M
最大输出384K64K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项DeepSeek-V4-ProQwen3.7-Max-Preview
文本输入$0.435 / 1M tokens$2.5 / 1M tokens
文本输出$0.87 / 1M tokens$7.5 / 1M tokens
缓存读取$0.003625 / 1M tokens$0.25 / 1M tokens
缓存写入暂无公开价格$3.125 / 1M tokens

小结

  • Qwen3.7-Max-Preview在以下类目领先:Coding and Software Engineer (4/4)、General Knowledge (2/2)、AI Agent - Tool Usage (1/1)、Math and Reasoning (1/1)、科学与综合推理 (1/1)

9 个共同 benchmark 上,Qwen3.7-Max-Preview 平均高出 21.77 分。

单项差距最大的 benchmark:IMO-AnswerBench — DeepSeek-V4-Pro 35.30,Qwen3.7-Max-Preview 90(分差 -54.70)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。