DataLearner 标志

Qwen3-30B-A3B-2507 评测详情

Qwen3-30B-A3B-2507 当前已收录的代表性评测结果包括 LiveCodeBench(86 / 250,得分 70.70)、MMLU Pro(72 / 176,得分 78.40)、IF Bench(154 / 282,得分 50.70)。

评测结果

Qwen3-30B-A3B-2507

评测结果

思考模式
工具使用

综合评估

共 4 项评测
评测名称 / 模式
得分
排名/总数
MMLU Pro
常规模式
78.40
72 / 176
HLE
思考模式
10.30
388 / 563
HLE
思考模式
9.80
392 / 563
CritPt
思考模式
0.30
182 / 200

科学与综合推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
70.40
320 / 462
GPQA Diamond
思考模式
70.70
318 / 462

编程与软件工程

共 4 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
43.20
181 / 250
LiveCodeBench
思考模式
70.70
86 / 250
SciCode
思考模式
33
120 / 130
SWE-bench Verified
思考模式
22
115 / 116

数学推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
常规模式
61.30
137 / 215
AIME2025
思考模式
56.30
143 / 215

Agent能力评测

共 4 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench
思考模式工具
49
36 / 44
τ²-Bench - Telecom
思考模式工具
28.10
220 / 264
τ³-Banking
思考模式工具
5.40
149 / 164
Terminal Bench Hard
思考模式工具
5.30
210 / 244

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
思考模式
50.70
154 / 282

AI Agent - 信息收集

共 1 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
思考模式工具
2.29
57 / 57

AI Agent - 工具使用

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
思考模式工具
1.50
190 / 192

多模态理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
思考模式
0.40
118 / 118