DataLearner 标志

Mistral Large 4 评测详情

Mistral Large 4 当前已收录的代表性评测结果包括 Harvey's Legal Agent Benchmark(6 / 50,得分 15.83)、SWE-Atlas-QnA(2 / 7,得分 59.40)、Terminal-Bench 4.0(31 / 100,得分 28.30)。

评测结果

Mistral Large 4

评测结果

思考模式
工具使用

仓库修复与多文件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
DeepSWE
开启思考工具
61.70
48 / 97
SWE-Atlas-QnA
开启思考工具
59.40
2 / 7
AA Cyber Index
开启思考工具
49.51
1 / 1

金融

共 3 项评测
评测名称 / 模式
得分
排名/总数
63.29
13 / 21
56.21
34 / 46
54.68
17 / 44

法律

共 2 项评测
评测名称 / 模式
得分
排名/总数
31.73
32 / 46
15.83
6 / 50

生物与基因

共 1 项评测
评测名称 / 模式
得分
排名/总数
67.04
14 / 21

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 4.0
开启思考工具
28.30
31 / 100
22.73
37 / 100
14.26
1 / 1

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
30.56
33 / 48

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
78.40
22 / 65

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
IOI (Vals v2)
高工具
45.28
23 / 30

数学

共 1 项评测
评测名称 / 模式
得分
排名/总数
10
28 / 29

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
80.43
40 / 67
40.69
45 / 65

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
12.16
14 / 14

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
48.05
29 / 37