DataLearner logo

Qwen3.7 Max Benchmark Details

Qwen3.7 Max currently shows benchmark results led by MMLU Pro (4 / 133, score 89.60), LiveCodeBench (4 / 126, score 91.60), GPQA Diamond (22 / 224, score 92.40).

Benchmark Results

Qwen3.7 Max

Benchmark Results

Thinking
Tool usage

General Knowledge

4 evaluations
Benchmark / mode
Score
Rank/total
MMLU Pro
Thinking Level · Max
89.60
4 / 133
LiveBench
Deep Thinking Mode
74.29
21 / 115
HLE
Thinking ModeTools
53.50
18 / 181
HLE
Thinking Level · Max
41.40
61 / 181

Other

1 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Thinking Level · Max
92.40
22 / 224

Coding and Software Engineer

6 evaluations
Benchmark / mode
Score
Rank/total
Text Arena (Coding)
Standard Mode
1540.77
11 / 35
LiveCodeBench
Thinking Level · Max
91.60
4 / 126
SWE-bench Verified
Thinking ModeTools
80.40
13 / 114
SWE-bench Multilingual
Thinking ModeTools
78.30
4 / 25
SWE-Bench Pro - Public
Thinking ModeTools
60.60
12 / 57
SciCode
Thinking Level · Max
53.50
3 / 5

Common Sense Reasoning

1 evaluations
Benchmark / mode
Score
Rank/total
SimpleBench
Standard Mode
70.40
7 / 67

Instruction Following

1 evaluations
Benchmark / mode
Score
Rank/total
IF Bench
Thinking Level · Max
79.10
4 / 33

AI Agent - Tool Usage

2 evaluations
Benchmark / mode
Score
Rank/total
MCP-Atlas
Thinking ModeTools
76.40
17 / 39
Terminal Bench 2.0
Thinking ModeTools
69.70
5 / 48

Math and Reasoning

1 evaluations
Benchmark / mode
Score
Rank/total
IMO-AnswerBench
Thinking Level · Max
90
3 / 23