DataLearner logo

Grok 3 Benchmark Details

Grok 3 currently shows benchmark results led by MMMU (22 / 74, score 78), AIME 2024 (22 / 61, score 84.20), LiveCodeBench (92 / 251, score 70.60).

Benchmark Results

Grok 3

Benchmark Results

Thinking
Tool usage

Knowledge Exams

1 evaluations
Benchmark / mode
Score
Rank/total
HLE
Standard Mode
4.10
525 / 568

Scientific Reasoning

1 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Standard Mode
80.40
232 / 461

Honesty & Factuality

1 evaluations
Benchmark / mode
Score
Rank/total
SimpleQA
Standard Mode
43.40
18 / 46

Mathematics

4 evaluations
Benchmark / mode
Score
Rank/total
AIME 2024
Standard Mode
84.20
22 / 61
AIME2025
Standard Mode
77.10
104 / 215
FrontierMath
Standard Mode
3.80
45 / 60
0
72 / 80

Algorithmic Coding

1 evaluations
Benchmark / mode
Score
Rank/total
LiveCodeBench
Standard Mode
70.60
92 / 251

Writing

1 evaluations
Benchmark / mode
Score
Rank/total
Creative Writing
Standard Mode
1183.50
80 / 106

Visual Understanding

1 evaluations
Benchmark / mode
Score
Rank/total
MMMU
unknown
78
22 / 74

Commonsense

1 evaluations
Benchmark / mode
Score
Rank/total
SimpleBench
Standard Mode
36.10
71 / 93

Agentic Development

2 evaluations
Benchmark / mode
Score
Rank/total
Aider-Polyglot
Standard Mode
53.30
30 / 59
Terminal Bench Hard
Standard ModeTools
11.40
181 / 244

Service Workflows

1 evaluations
Benchmark / mode
Score
Rank/total
τ²-Bench - Telecom
Standard ModeTools
48.80
175 / 264

Instruction Following

1 evaluations
Benchmark / mode
Score
Rank/total
IF Bench
Standard Mode
46.90
171 / 282

Capability Indices

1 evaluations
Benchmark / mode
Score
Rank/total
ECI
unknown
138.34
102 / 167