DataLearner logo

GPT-4.1 Benchmark Details

GPT-4.1 currently shows benchmark results led by GSM8K (5 / 70, score 95.90), MMLU (9 / 124, score 90.20), DROP (4 / 9, score 89.20).

Benchmark Results

GPT-4.1

Benchmark Results

Thinking
Tool usage

General Knowledge

3 evaluations
Benchmark / mode
Score
Rank/total
MMLU
Standard Mode
90.20
9 / 124
MMLU Pro
Standard Mode
80.50
61 / 133
HLE
Standard Mode
3.70
184 / 185

Math and Reasoning

6 evaluations
Benchmark / mode
Score
Rank/total
GSM8K
Standard Mode
95.90
5 / 70
MATH-500
Standard Mode
92.80
30 / 44
AIME 2024
Standard Mode
48.10
49 / 62
AIME2025
Standard Mode
36.70
97 / 106
FrontierMath
Standard Mode
5.50
37 / 60
0
72 / 80

Reading Comprehension

1 evaluations
Benchmark / mode
Score
Rank/total
DROP
Standard Mode
89.20
4 / 9

Other

1 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Standard Mode
66.30
208 / 270

Coding and Software Engineer

5 evaluations
Benchmark / mode
Score
Rank/total
SWE-bench Verified
Standard Mode
54.60
90 / 114
LiveCodeBench
Standard Mode
40.50
106 / 127
WeirdML v2
Standard ModeTools
39.04
48 / 52
35.10
1 / 1
14.40
8 / 8

Writing and Creative Capabilities

1 evaluations
Benchmark / mode
Score
Rank/total
Creative Writing
Standard Mode
1417
56 / 99

Common Sense Reasoning

1 evaluations
Benchmark / mode
Score
Rank/total
SimpleBench
Standard Mode
27
56 / 67

Agent Level Benchmark

2 evaluations
Benchmark / mode
Score
Rank/total
τ²-Bench
Standard ModeTools
54.70
32 / 43
Aider-Polyglot
Standard Mode
52.40
31 / 59

Other

1 evaluations
Benchmark / mode
Score
Rank/total
Fiction.liveBench
Standard Mode
63.90
15 / 16

Multimodal Understanding

1 evaluations
Benchmark / mode
Score
Rank/total
GeoBench ACW
Standard Mode
72
12 / 20