DataLearner logo

Grok 4 Benchmark Details

Grok 4 currently shows benchmark results led by MMLU-Pro (15 / 175, score 87), IOI 2024 (Vals v1) (1 / 10, score 23.20), IOI 2025 (Vals v1) (1 / 9, score 29.20).

Benchmark Results

Grok 4

Benchmark Results

Thinking
Tool usage
Internet

Knowledge Exams

4 evaluations
Benchmark / mode
Score
Rank/total
MMLU-Pro
Thinking Enabled
87
15 / 175
HLE
Thinking Enabled
25.40
133 / 235
HLE
Thinking EnabledTools
38.60
86 / 235
HLE
Thinking EnabledToolsInternet
38.60
86 / 235

Abstract Generalization

2 evaluations
Benchmark / mode
Score
Rank/total
ARC-AGI-1
Thinking Enabled
66.70
117 / 193
ARC-AGI-2
Thinking Enabled
15.90
120 / 181

Scientific Reasoning

2 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Thinking Enabled
87
70 / 253
CritPt
Thinking Enabled
2
131 / 204

Repository Engineering

1 evaluations
Benchmark / mode
Score
Rank/total
SWE-bench Verified
Thinking Enabled
58.60
85 / 116

Mathematics

7 evaluations
Benchmark / mode
Score
Rank/total
AIME2025
Thinking Enabled
91.70
38 / 110
AIME2025
Thinking EnabledTools
98.80
14 / 110
IMO-ProofBench
Thinking Enabled
46.70
4 / 16
23.30
10 / 16
IMO-ProofBench Advanced
Thinking Enabled
18.60
12 / 24
FrontierMath
Standard Mode
12.10
22 / 60
2.10
56 / 80

Agentic Development

3 evaluations
Benchmark / mode
Score
Rank/total
Aider-Polyglot
Thinking Level · High
79.60
7 / 59
Terminal-Bench
Thinking EnabledTools
38
13 / 35
Terminal Bench Hard
Thinking EnabledTools
37.90
59 / 244

Commonsense

1 evaluations
Benchmark / mode
Score
Rank/total
SimpleBench
Thinking Enabled
60.50
36 / 96

Algorithmic Coding

2 evaluations
Benchmark / mode
Score
Rank/total
IOI 2025 (Vals v1)
Thinking EnabledTools
29.20
1 / 9
IOI 2024 (Vals v1)
Thinking EnabledTools
23.20
1 / 10

Cross-capability Suites

1 evaluations
Benchmark / mode
Score
Rank/total
LiveBench
Standard Mode
62.02
61 / 117

Visual Understanding

2 evaluations
Benchmark / mode
Score
Rank/total
MMMU-Pro
Thinking Enabled
68.80
141 / 229
GeoBench ACW
Standard Mode
45
20 / 20

ML Engineering

1 evaluations
Benchmark / mode
Score
Rank/total
WeirdML v2
Standard ModeTools
45.73
41 / 52

Long Reasoning

1 evaluations
Benchmark / mode
Score
Rank/total
Fiction.liveBench
Standard Mode
94.40
3 / 16

Logical Planning

1 evaluations
Benchmark / mode
Score
Rank/total
BALROG
Standard ModeTools
43.60
4 / 12

Capability Frontier Metrics

1 evaluations
Benchmark / mode
Score
Rank/total
METR Time Horizons v1.1
Standard ModeTools
110.07
13 / 22

Capability Indices

1 evaluations
Benchmark / mode
Score
Rank/total
ECI
unknown
146.46
66 / 167