DataLearner logo

Qwen3-30B-A3B-2507 Benchmark Details

Qwen3-30B-A3B-2507 currently shows benchmark results led by LiveCodeBench (86 / 250, score 70.70), MMLU Pro (72 / 176, score 78.40), IF Bench (154 / 282, score 50.70).

Benchmark Results

Qwen3-30B-A3B-2507

Benchmark Results

Thinking
Tool usage

General Knowledge

4 evaluations
Benchmark / mode
Score
Rank/total
MMLU Pro
Standard Mode
78.40
72 / 176
HLE
Thinking Mode
10.30
388 / 563
HLE
Thinking Mode
9.80
392 / 563
CritPt
Thinking Mode
0.30
182 / 200

Other

2 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Standard Mode
70.40
320 / 462
GPQA Diamond
Thinking Mode
70.70
318 / 462

Coding and Software Engineer

4 evaluations
Benchmark / mode
Score
Rank/total
LiveCodeBench
Standard Mode
43.20
181 / 250
LiveCodeBench
Thinking Mode
70.70
86 / 250
SciCode
Thinking Mode
33
120 / 130
SWE-bench Verified
Thinking Mode
22
115 / 116

Math and Reasoning

2 evaluations
Benchmark / mode
Score
Rank/total
AIME2025
Standard Mode
61.30
137 / 215
AIME2025
Thinking Mode
56.30
143 / 215

Agent Level Benchmark

4 evaluations
Benchmark / mode
Score
Rank/total
τ²-Bench
Thinking ModeTools
49
36 / 44
τ²-Bench - Telecom
Thinking ModeTools
28.10
220 / 264
τ³-Banking
Thinking ModeTools
5.40
149 / 164
Terminal Bench Hard
Thinking ModeTools
5.30
210 / 244

Instruction Following

1 evaluations
Benchmark / mode
Score
Rank/total
IF Bench
Thinking Mode
50.70
154 / 282

AI Agent - Information Search

1 evaluations
Benchmark / mode
Score
Rank/total
BrowseComp
Thinking ModeTools
2.29
57 / 57

AI Agent - Tool Usage

1 evaluations
Benchmark / mode
Score
Rank/total
Terminal-Bench 2.1
Thinking ModeTools
1.50
190 / 192

Multimodal Understanding

1 evaluations
Benchmark / mode
Score
Rank/total
GDP.pdf
Thinking Mode
0.40
118 / 118