DataLearner 标志

Qwen3.7 MaxvsQwen3.6-Max-Preview

在 12 个共同 benchmark 中,Qwen3.7 Max 整体领先:Qwen3.7 Max 领先 11 项,Qwen3.6-Max-Preview 领先 1 项,持平 0 项,平均分差 +3.12。

阿里巴巴
Qwen3.7 Max

阿里巴巴 · 2026-05-20 · 推理大模型

阿里巴巴
Qwen3.6-Max-Preview

阿里巴巴 · 2026-04-18 · 聊天大模型

Qwen3.7 Max11 项(92%)(8%)1 项Qwen3.6-Max-Preview

评测分数

按能力类目分组,每组内按分差大小排列;共 12 项。

仓库修复与多文件工程

Qwen3.7 Max 领先 2/2
评测项Qwen3.7 MaxQwen3.6-Max-Preview分差
SWE-bench Multilingual78.308 / 30Thinking (With Tools)73.8014 / 30Thinking (With Tools)+4.50
SWE-bench Verified80.4013 / 116Thinking (With Tools)78.8021 / 116Thinking (With Tools)+1.60

科学知识与推理

Qwen3.7 Max 领先 2/2
评测项Qwen3.7 MaxQwen3.6-Max-Preview分差
CritPt13.4063 / 204Thinking (No Tools)3.70111 / 204Thinking (No Tools)+9.70
GPQA Diamond92.4022 / 253Max (No Tools)90.4037 / 253Max (No Tools)+2

综合知识考试

Qwen3.7 Max 领先 2/2
评测项Qwen3.7 MaxQwen3.6-Max-Preview分差
HLE53.5029 / 235Thinking (With Tools)50.2041 / 235Thinking (With Tools)+3.30
MMLU-Pro89.605 / 175Max (No Tools)88.506 / 175Max (No Tools)+1.10

多轮记忆与持续上下文

Qwen3.6-Max-Preview 领先 1/1
评测项Qwen3.7 MaxQwen3.6-Max-Preview分差
Context Arena56.0179 / 126Normal (No Tools)70.6261 / 126Normal (No Tools)-14.61

常识推理

Qwen3.7 Max 领先 1/1
评测项Qwen3.7 MaxQwen3.6-Max-Preview分差
SimpleBench70.4018 / 96Normal (No Tools)6326 / 96Normal (No Tools)+7.40

指令与格式遵循

Qwen3.7 Max 领先 1/1
评测项Qwen3.7 MaxQwen3.6-Max-Preview分差
IF Bench79.105 / 31Max (No Tools)74.2011 / 31Max (No Tools)+4.90

数学

Qwen3.7 Max 领先 1/1
评测项Qwen3.7 MaxQwen3.6-Max-Preview分差
IMO-AnswerBench903 / 24Max (No Tools)83.8014 / 24Max (No Tools)+6.20

算法与竞赛编程

Qwen3.7 Max 领先 1/1
评测项Qwen3.7 MaxQwen3.6-Max-Preview分差
LiveCodeBench91.605 / 125Max (No Tools)87.1014 / 125Max (No Tools)+4.50

自主开发与终端任务

Qwen3.7 Max 领先 1/1
评测项Qwen3.7 MaxQwen3.6-Max-Preview分差
Terminal Bench Hard50.8022 / 244Thinking (With Tools)43.9037 / 244Thinking (With Tools)+6.90

规格对比

字段Qwen3.7 MaxQwen3.6-Max-Preview
发布机构阿里巴巴阿里巴巴
发布时间2026-05-202026-04-18
模型类型推理大模型聊天大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度1M262K
最大输出64K64K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Qwen3.7 MaxQwen3.6-Max-Preview
文本输入¥12 / 1M tokens$1.3 / 1M tokens
文本输出¥36 / 1M tokens$7.8 / 1M tokens

小结

  • Qwen3.7 Max在以下类目领先:仓库修复与多文件工程 (2/2)、科学知识与推理 (2/2)、综合知识考试 (2/2)、常识推理 (1/1)、指令与格式遵循 (1/1)、数学 (1/1)、算法与竞赛编程 (1/1)、自主开发与终端任务 (1/1)
  • Qwen3.6-Max-Preview在以下类目领先:多轮记忆与持续上下文 (1/1)

12 个共同 benchmark 上,Qwen3.7 Max 平均高出 3.12 分。

单项差距最大的 benchmark:Context Arena — Qwen3.7 Max 56.01,Qwen3.6-Max-Preview 70.62(分差 -14.61)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。