DataLearner logo

Qwen3.5-35B-A3B Benchmark Details

Qwen3.5-35B-A3B currently shows benchmark results led by IF Bench (50 / 282, score 72.50), τ²-Bench - Telecom (69 / 264, score 89.20), Claw Bench (8 / 29, score 91.40).

Benchmark Results

Qwen3.5-35B-A3B

Benchmark Results

Thinking
Tool usage

General Knowledge

4 evaluations
Benchmark / mode
Score
Rank/total
HLE
Standard Mode
13.40
355 / 565
HLE
Thinking Mode
21
281 / 565
CritPt
Standard Mode
0.60
169 / 201
CritPt
Thinking Mode
0.90
159 / 201

Other

2 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Standard Mode
81.90
207 / 463
GPQA Diamond
Thinking Mode
84.50
168 / 463

Agent Level Benchmark

5 evaluations
Benchmark / mode
Score
Rank/total
τ²-Bench - Telecom
Standard ModeTools
86.30
82 / 264
τ²-Bench - Telecom
Thinking ModeTools
89.20
69 / 264
Terminal Bench Hard
Standard ModeTools
10.60
182 / 244
Terminal Bench Hard
Thinking ModeTools
26.50
123 / 244
τ³-Banking
Standard ModeTools
4.90
158 / 167

Instruction Following

2 evaluations
Benchmark / mode
Score
Rank/total
IF Bench
Standard Mode
44.50
183 / 282
IF Bench
Thinking Mode
72.50
50 / 282

Text Embedding

2 evaluations
Benchmark / mode
Score
Rank/total
Context Arena
Standard Mode
33.10
111 / 126
Context Arena
Thinking Mode
67.48
68 / 126

Long Context

2 evaluations
Benchmark / mode
Score
Rank/total
AA-LCR
Standard Mode
63
125 / 171
LongBench v2
Standard Mode
59
10 / 14

Claw-style Agent Evaluation

2 evaluations
Benchmark / mode
Score
Rank/total
Claw Bench
Thinking ModeTools
91.40
8 / 29
Pinch Bench
Thinking ModeTools
78.40
27 / 38

AI Agent - Tool Usage

1 evaluations
Benchmark / mode
Score
Rank/total
Terminal-Bench 2.1
Standard ModeTools
40.80
147 / 194

Productivity Knowledge

1 evaluations
Benchmark / mode
Score
Rank/total
GDPval-AA v2
Standard ModeTools
740
101 / 106

Multimodal Understanding

2 evaluations
Benchmark / mode
Score
Rank/total
MMMU-Pro
Standard Mode
69.20
134 / 229
MMMU-Pro
Thinking Mode
72.70
115 / 229
Qwen3.5-35B-A3B Benchmark Results & Rankings | DataLearnerAI