DataLearner 标志

Qwen3.5-35B-A3B 评测详情

Qwen3.5-35B-A3B 当前已收录的代表性评测结果包括 IF Bench(50 / 282,得分 72.50)、τ²-Bench - Telecom(69 / 264,得分 89.20)、Claw Bench(8 / 29,得分 91.40)。

评测结果

Qwen3.5-35B-A3B

评测结果

思考模式
工具使用

综合评估

共 4 项评测
评测名称 / 模式
得分
排名/总数
HLE
常规模式
13.40
355 / 565
HLE
思考模式
21
281 / 565
CritPt
常规模式
0.60
169 / 201
CritPt
思考模式
0.90
159 / 201

科学与综合推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
81.90
207 / 463
GPQA Diamond
思考模式
84.50
168 / 463

Agent能力评测

共 5 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
常规模式工具
86.30
82 / 264
τ²-Bench - Telecom
思考模式工具
89.20
69 / 264
Terminal Bench Hard
常规模式工具
10.60
182 / 244
Terminal Bench Hard
思考模式工具
26.50
123 / 244
τ³-Banking
常规模式工具
4.90
158 / 167

指令跟随

共 2 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
44.50
183 / 282
IF Bench
思考模式
72.50
50 / 282

文本向量检索

共 2 项评测
评测名称 / 模式
得分
排名/总数
Context Arena
常规模式
33.10
111 / 126
Context Arena
思考模式
67.48
68 / 126

长上下文能力

共 2 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
常规模式
63
125 / 171
LongBench v2
常规模式
59
10 / 14

OpenClaw智能体能力综合测评

共 2 项评测
评测名称 / 模式
得分
排名/总数
Claw Bench
思考模式工具
91.40
8 / 29
Pinch Bench
思考模式工具
78.40
27 / 38

AI Agent - 工具使用

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
常规模式工具
40.80
147 / 194

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
常规模式工具
740
101 / 106

多模态理解

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
69.20
134 / 229
MMMU-Pro
思考模式
72.70
115 / 229