DataLearner 标志

Mistral-Small-3.2 评测详情

Mistral-Small-3.2 当前已收录的代表性评测结果包括 MMLU(53 / 124,得分 80.50)、MATH(20 / 42,得分 69.42)、MMLU-Pro(104 / 176,得分 69.06)。

评测结果

Mistral-Small-3.2

评测结果

思考模式
工具使用

综合评估

共 4 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
80.50
53 / 124
MMLU-Pro
常规模式
69.06
104 / 176
GPQA
常规模式
44.22
12 / 17
HLE
常规模式
4.30
510 / 565

数学推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
MATH
常规模式
69.42
20 / 42
AIME2025
常规模式
27
189 / 216

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
46.13
419 / 463

常识问答

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
12.10
39 / 47

编程与软件工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
SciCode
常规模式
28.60
125 / 131
LiveCodeBench
常规模式
27.50
230 / 251

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1252.90
79 / 106

Agent能力评测

共 3 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
常规模式工具
29.50
215 / 264
Terminal Bench Hard
常规模式工具
6.80
194 / 244
τ³-Banking
常规模式工具
6.20
148 / 167

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
33.50
251 / 282

AI Agent - 工具使用

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
常规模式工具
5.60
181 / 194

多模态理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
48
207 / 229