DataLearner logo

Mistral-Small-3.1-24B-Instruct-2503 Benchmark Details

Mistral-Small-3.1-24B-Instruct-2503 currently shows benchmark results led by HumanEval (13 / 101, score 88.41), MBPP (15 / 69, score 74.71), MMLU (52 / 124, score 80.62).

Benchmark Results

Mistral-Small-3.1-24B-Instruct-2503

Benchmark Results

Thinking

Knowledge Exams

2 evaluations
Benchmark / mode
Score
Rank/total
MMLU
Standard Mode
80.62
52 / 124
MMLU-Pro
Standard Mode
66.76
110 / 175

Code Generation & Editing

2 evaluations
Benchmark / mode
Score
Rank/total
HumanEval
Standard Mode
88.41
13 / 101
MBPP
Standard Mode
74.71
15 / 69

Mathematics

1 evaluations
Benchmark / mode
Score
Rank/total
MATH
Standard Mode
69.30
21 / 42

Scientific Reasoning

2 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Standard Mode
45.96
235 / 253
GPQA
Standard Mode
44.42
11 / 17

Honesty & Factuality

1 evaluations
Benchmark / mode
Score
Rank/total
SimpleQA
Standard Mode
10.43
41 / 46

Writing

1 evaluations
Benchmark / mode
Score
Rank/total
Creative Writing
Standard Mode
760.90
102 / 110