DataLearner 标志

Mistral Large 3 评测详情

Mistral Large 3 当前已收录的代表性评测结果包括 Creative Writing(62 / 106,得分 1409.30)、Terminal Bench Hard(165 / 244,得分 15.90)、LiveCodeBench(177 / 251,得分 46.50)。

评测结果

Mistral Large 3

评测结果

思考模式
工具使用

综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
常规模式
4.20
515 / 565

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
68
338 / 463

编程与软件工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
46.50
177 / 251
SciCode
常规模式
36.60
113 / 131

数学推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
常规模式
38
171 / 216

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1409.30
62 / 106

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
20.40
87 / 93

Agent能力评测

共 3 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
常规模式工具
24.60
231 / 264
Terminal Bench Hard
常规模式工具
15.90
165 / 244
τ³-Banking
常规模式工具
5.80
150 / 167

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
36.20
241 / 282

OpenClaw智能体能力综合测评

共 3 项评测
评测名称 / 模式
得分
排名/总数
Claw Bench
思考模式工具
78.60
22 / 29
Pinch Bench
思考模式工具
72.20
29 / 38
54.48
37 / 45

AI Agent - 工具使用

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
常规模式工具
12
172 / 194

多模态理解

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
55.70
188 / 229
GDP.pdf
常规模式
1.20
113 / 119