DataLearner logo

Claude Opus 4 Benchmark Details

Claude Opus 4 currently shows benchmark results led by MATH-500 (4 / 46, score 98.20), MMLU-Pro (28 / 175, score 85), Aider-Polyglot (13 / 59, score 72).

Benchmark Results

Claude Opus 4

Benchmark Results

Thinking
Tool usage

Knowledge Exams

5 evaluations
Benchmark / mode
Score
Rank/total
MMLU-Pro
Standard Mode
85
28 / 175
HLE
Standard Mode
10.70
389 / 568
HLE
Standard Mode
6.20
463 / 568
HLE
Thinking Enabled
12.30
369 / 568
HLE
Thinking Enabled
10.72
388 / 568

Abstract Generalization

2 evaluations
Benchmark / mode
Score
Rank/total
ARC-AGI-1
Standard Mode
35.67
146 / 176
ARC-AGI-2
Standard Mode
8.61
115 / 164

Scientific Reasoning

2 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Standard Mode
79.60
242 / 461
GPQA Diamond
Thinking Enabled
79.60
242 / 461

Repository Engineering

1 evaluations
Benchmark / mode
Score
Rank/total
SWE-bench Verified
Standard Mode
72.50
53 / 116

Mathematics

11 evaluations
Benchmark / mode
Score
Rank/total
MATH-500
Standard Mode
98.20
4 / 46
AIME 2024
Standard Mode
76
35 / 61
AIME2025
Standard Mode
75.50
107 / 215
AIME2025
Thinking Enabled
73.30
113 / 215
FrontierMath
Standard Mode
4.50
39 / 60
FrontierMath
Thinking Enabled
4.10
41 / 60
0
72 / 80
4.20
40 / 80
FrontierMath - Tier 4
Thinking Enabled
4.20
40 / 80
IMO-ProofBench
Thinking Enabled
2.90
16 / 16
IMO-ProofBench Advanced
Thinking Enabled
2.90
24 / 24

Algorithmic Coding

2 evaluations
Benchmark / mode
Score
Rank/total
LiveCodeBench
Standard Mode
56.60
144 / 251
LiveCodeBench
Thinking Enabled
63.60
122 / 251

Writing

1 evaluations
Benchmark / mode
Score
Rank/total
Creative Writing
Standard Mode
1576.80
41 / 106

Visual Understanding

1 evaluations
Benchmark / mode
Score
Rank/total
MMMU
unknown
76.50
28 / 74

Commonsense

1 evaluations
Benchmark / mode
Score
Rank/total
SimpleBench
Thinking Enabled
58.80
39 / 96

Agentic Development

3 evaluations
Benchmark / mode
Score
Rank/total
Aider-Polyglot
Standard Mode
70.70
16 / 59
72
13 / 59
Terminal Bench Hard
Thinking EnabledTools
31.10
105 / 244

Service Workflows

2 evaluations
Benchmark / mode
Score
Rank/total
τ²-Bench - Telecom
Thinking EnabledTools
73.40
129 / 264
τ²-Bench
Thinking EnabledTools
72.50
24 / 44

Instruction Following

2 evaluations
Benchmark / mode
Score
Rank/total
IF Bench
Standard Mode
43.30
191 / 282
IF Bench
Thinking Enabled
53.70
142 / 282

Capability Indices

1 evaluations
Benchmark / mode
Score
Rank/total
ECI
unknown
142.67
85 / 167