DataLearner logo

Qwen3.6-Max-Preview Benchmark Details

Qwen3.6-Max-Preview currently shows benchmark results led by MMLU Pro (5 / 132, score 88.50), LiveCodeBench (10 / 123, score 87.10), GPQA Diamond (19 / 187, score 90.40).

Benchmark Results

Qwen3.6-Max-Preview

Benchmark Results

Thinking
Tool usage

General Knowledge

4 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Thinking Level · Max
90.40
19 / 187
MMLU Pro
Thinking Level · Max
88.50
5 / 132
HLE
Thinking ModeTools
50.20
27 / 172
HLE
Thinking Level · Max
28.80
92 / 172

Coding and Software Engineer

5 evaluations
Benchmark / mode
Score
Rank/total
LiveCodeBench
Thinking Level · Max
87.10
10 / 123
SWE-bench Verified
Thinking ModeTools
78.80
21 / 112
SWE-bench Multilingual
Thinking ModeTools
73.80
9 / 23
SWE-Bench Pro - Public
Thinking ModeTools
56.60
20 / 54
SWE-Bench Pro - Public
Deep Thinking ModeTools
57.30
18 / 54

Common Sense Reasoning

1 evaluations
Benchmark / mode
Score
Rank/total
Simple Bench
Standard Mode
63
10 / 63

Instruction Following

1 evaluations
Benchmark / mode
Score
Rank/total
IF Bench
Thinking Level · Max
74.20
7 / 30

AI Agent - Tool Usage

2 evaluations
Benchmark / mode
Score
Rank/total
Terminal Bench 2.0
Thinking ModeTools
61.60
16 / 47
Terminal Bench 2.0
Deep Thinking ModeTools
65.40
11 / 47

Math and Reasoning

1 evaluations
Benchmark / mode
Score
Rank/total
IMO-AnswerBench
Thinking Level · Max
83.80
12 / 21

Productivity Knowledge

1 evaluations
Benchmark / mode
Score
Rank/total
GDPval-AA
Deep Thinking Mode
51
12 / 21