DataLearner logo

GPT-4.1 mini Benchmark Details

GPT-4.1 mini currently shows benchmark results led by MMLU (23 / 124, score 87.50), IC SWE-Lancer (Diamond) (4 / 8, score 33), FrontierMath (39 / 60, score 4.50).

Benchmark Results

GPT-4.1 mini

Benchmark Results

Thinking
Tool usage

Knowledge Exams

1 evaluations
Benchmark / mode
Score
Rank/total
MMLU
Standard Mode
87.50
23 / 124

Scientific Reasoning

1 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Standard Mode
65
200 / 253

Repository Engineering

2 evaluations
Benchmark / mode
Score
Rank/total
33
4 / 8
SWE-bench Verified
Standard Mode
23.60
114 / 116

Mathematics

2 evaluations
Benchmark / mode
Score
Rank/total
AIME 2024
Standard Mode
49.60
48 / 61
FrontierMath
Standard Mode
4.50
39 / 60

Writing

1 evaluations
Benchmark / mode
Score
Rank/total
Creative Writing
Standard Mode
1147
85 / 110

Agentic Development

2 evaluations
Benchmark / mode
Score
Rank/total
Aider-Polyglot
Standard Mode
32.40
43 / 59
Terminal Bench Hard
Standard ModeTools
7.60
190 / 244

Service Workflows

3 evaluations
Benchmark / mode
Score
Rank/total
τ²-Bench
Standard ModeTools
53
34 / 44
τ²-Bench - Telecom
Thinking EnabledTools
48.90
29 / 30
τ³-Banking
Standard ModeTools
5.40
152 / 167

Visual Understanding

1 evaluations
Benchmark / mode
Score
Rank/total
MMMU-Pro
Standard Mode
58.70
180 / 229

Capability Indices

1 evaluations
Benchmark / mode
Score
Rank/total
ECI
unknown
135
110 / 167