DataLearner logo

Qwen3-Max-Thinking Benchmark Details

Qwen3-Max-Thinking currently shows benchmark results led by C-Eval (1 / 48, score 93.70), HLE (54 / 565, score 49.80), LiveCodeBench (26 / 251, score 85.90).

Benchmark Results

Qwen3-Max-Thinking

Benchmark Results

Thinking
Tool usage

General Knowledge

6 evaluations
Benchmark / mode
Score
Rank/total
C-Eval
Thinking Mode
93.70
1 / 48
MMLU-Pro
Thinking Mode
85.70
24 / 176
HLE
Thinking Mode
30.20
203 / 565
HLE
Thinking Mode
28
226 / 565
HLE
Thinking ModeTools
49.80
54 / 565
CritPt
Thinking Mode
1.70
132 / 201

Other

1 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Thinking Mode
87.40
127 / 463

Coding and Software Engineer

2 evaluations
Benchmark / mode
Score
Rank/total
LiveCodeBench
Thinking Mode
85.90
26 / 251
SWE-bench Verified
Thinking Mode
75.30
38 / 116

Math and Reasoning

2 evaluations
Benchmark / mode
Score
Rank/total
IMO-AnswerBench
Thinking Mode
83.90
13 / 24
AIME2025
Thinking Mode
82.30
91 / 216

Agent Level Benchmark

3 evaluations
Benchmark / mode
Score
Rank/total
τ²-Bench - Telecom
Thinking ModeTools
83.60
101 / 264
τ²-Bench
Thinking ModeTools
82.10
11 / 44
Terminal Bench Hard
Thinking ModeTools
24.20
134 / 244

Instruction Following

2 evaluations
Benchmark / mode
Score
Rank/total
IF Bench
Thinking Mode
70.70
65 / 282
IF Bench
Thinking ModeTools
70.90
64 / 282

Claw-style Agent Evaluation

1 evaluations
Benchmark / mode
Score
Rank/total
Pinch Bench
Thinking ModeTools
80.30
24 / 38