DataLearner logo

Mistral Large 4 Benchmark Details

Mistral Large 4 currently shows benchmark results led by Harvey's Legal Agent Benchmark (6 / 50, score 15.83), SWE-Atlas-QnA (2 / 7, score 59.40), Terminal-Bench 4.0 (31 / 100, score 28.30).

Benchmark Results

Mistral Large 4

Benchmark Results

Thinking
Tool usage

Repository Engineering

3 evaluations
Benchmark / mode
Score
Rank/total
DeepSWE
Thinking EnabledTools
61.70
48 / 97
SWE-Atlas-QnA
Thinking EnabledTools
59.40
2 / 7
AA Cyber Index
Thinking EnabledTools
49.51
1 / 1

Finance

3 evaluations
Benchmark / mode
Score
Rank/total
63.29
13 / 21
56.21
34 / 46
54.68
17 / 44

Legal

2 evaluations
Benchmark / mode
Score
Rank/total
31.73
32 / 46
15.83
6 / 50

Biology & Genomics

1 evaluations
Benchmark / mode
Score
Rank/total
67.04
14 / 21

Agentic Development

3 evaluations
Benchmark / mode
Score
Rank/total
Terminal-Bench 4.0
Thinking EnabledTools
28.30
31 / 100
22.73
37 / 100
14.26
1 / 1

Maintenance & Optimization

1 evaluations
Benchmark / mode
Score
Rank/total
30.56
33 / 48

Code Generation & Editing

1 evaluations
Benchmark / mode
Score
Rank/total
78.40
22 / 65

Algorithmic Coding

1 evaluations
Benchmark / mode
Score
Rank/total
IOI (Vals v2)
HighTools
45.28
23 / 30

Mathematics

1 evaluations
Benchmark / mode
Score
Rank/total
10
28 / 29

Clinical Workflows

2 evaluations
Benchmark / mode
Score
Rank/total
80.43
40 / 67
40.69
45 / 65

Scientific Reasoning

1 evaluations
Benchmark / mode
Score
Rank/total
12.16
14 / 14

Capability Indices

1 evaluations
Benchmark / mode
Score
Rank/total
48.05
29 / 37