DataLearner logo

Claude Sonnet 4 Benchmark Details

Claude Sonnet 4 currently shows benchmark results led by SWE-bench Verified (14 / 116, score 80.20), MMLU-Pro (40 / 175, score 84), Terminal-Bench (10 / 35, score 41.30). 1 source link is attached for reference.

Benchmark Results

Claude Sonnet 4

Benchmark Results

Thinking
Tool usage
Parallel

Knowledge Exams

5 evaluations
Benchmark / mode
Score
Rank/total
MMLU-Pro
Thinking Enabled
84
40 / 175
HLE
Standard Mode
5.52
473 / 568
HLE
Standard Mode
4.30
514 / 568
HLE
Thinking Enabled
10.70
389 / 568
HLE
Thinking Enabled
9.60
402 / 568

Abstract Generalization

4 evaluations
Benchmark / mode
Score
Rank/total
ARC-AGI-1
Standard Mode
23.80
155 / 176
ARC-AGI-1
Thinking Enabled
40
140 / 176
ARC-AGI-2
Standard Mode
1.30
151 / 164
ARC-AGI-2
Thinking Enabled
5.93
123 / 164

Scientific Reasoning

5 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Standard Mode
68
338 / 461
GPQA Diamond
Thinking Enabled
75.40
277 / 461
GPQA Diamond
DeepTools
83.80
182 / 461
CritPt
Standard Mode
1.10
151 / 204
CritPt
Thinking Enabled
0.30
186 / 204

Repository Engineering

3 evaluations
Benchmark / mode
Score
Rank/total
SWE-bench Verified
Thinking EnabledTools
72.70
52 / 116
SWE-bench Verified
Thinking Level · HighTools
80.20
14 / 116
SWE-Bench Pro - Public
Thinking Enabled
42.70
55 / 62

Mathematics

8 evaluations
Benchmark / mode
Score
Rank/total
AIME2025
Standard Mode
38
171 / 215
AIME2025
Thinking Enabled
70.50
119 / 215
AIME2025
DeepTools
85
77 / 215
AIME 2024
Standard Mode
43.40
50 / 61
IMO-ProofBench
Thinking Enabled
27.10
8 / 16
IMO-ProofBench Advanced
Thinking Enabled
4.80
19 / 24
FrontierMath
Standard Mode
4.10
41 / 60
0
72 / 80

Algorithmic Coding

7 evaluations
Benchmark / mode
Score
Rank/total
CodeClash
Standard ModeTools
1223
4 / 8
LiveCodeBench
Standard Mode
48.50
171 / 251
LiveCodeBench
Thinking Enabled
66
106 / 251
IOI 2024 (Vals v1)
Standard ModeTools
9.70
5 / 10
IOI 2024 (Vals v1)
Thinking EnabledTools
5.20
7 / 10
IOI 2025 (Vals v1)
Standard ModeTools
3.30
6 / 9
IOI 2025 (Vals v1)
Thinking EnabledTools
4
5 / 9

Writing

1 evaluations
Benchmark / mode
Score
Rank/total
Creative Writing
Standard Mode
1480.30
53 / 106

Agentic Development

8 evaluations
Benchmark / mode
Score
Rank/total
Aider-Polyglot
Standard Mode
56.40
26 / 59
61.30
20 / 59
Terminal-Bench
Standard ModeTools
26
26 / 35
Terminal-Bench
Thinking EnabledTools
35.50
18 / 35
41.30
10 / 35
Terminal-Bench 2.1
Thinking EnabledTools
36.30
157 / 199
Terminal Bench Hard
Standard ModeTools
27.30
120 / 244
Terminal Bench Hard
Thinking EnabledTools
31.10
105 / 244

Visual Understanding

4 evaluations
Benchmark / mode
Score
Rank/total
MMMU
Standard Mode
76.50
28 / 74
MMMU
unknown
74.40
34 / 74
MMMU-Pro
Standard Mode
62.40
165 / 229
MMMU-Pro
Thinking Enabled
61.80
170 / 229

Commonsense

1 evaluations
Benchmark / mode
Score
Rank/total
SimpleBench
Thinking Enabled
45.50
63 / 96

Service Workflows

6 evaluations
Benchmark / mode
Score
Rank/total
τ²-Bench - Telecom
Standard ModeTools
52.30
169 / 264
τ²-Bench - Telecom
Thinking EnabledTools
65
150 / 264
τ²-Bench
Standard ModeTools
52
35 / 44
SAGE
Standard ModeTools
35
49 / 64
SAGE
Thinking EnabledTools
32
52 / 64
τ³-Banking
Thinking EnabledTools
16.70
102 / 167

Instruction Following

3 evaluations
Benchmark / mode
Score
Rank/total
IF Bench
Standard Mode
45.40
180 / 282
IF Bench
Thinking Enabled
54.70
137 / 282
IF Bench
Thinking EnabledTools
55
134 / 282

Cross-capability Suites

2 evaluations
Benchmark / mode
Score
Rank/total
LiveBench
Standard Mode
50.98
91 / 117
61.27
67 / 117

Cross-industry Work

1 evaluations
Benchmark / mode
Score
Rank/total
GDPval-AA
Thinking Enabled
33
13 / 15

Long Reasoning

2 evaluations
Benchmark / mode
Score
Rank/total
AA-LCR
Standard Mode
44
154 / 174
AA-LCR
Thinking Enabled
70.30
104 / 174

Desktop Workflows

1 evaluations
Benchmark / mode
Score
Rank/total
OSWorld-Verified
Thinking EnabledTools
42.20
26 / 28

Tool Orchestration

3 evaluations
Benchmark / mode
Score
Rank/total
Pinch Bench
Thinking EnabledTools
80.50
23 / 38
Claw Bench
Thinking EnabledTools
77.80
23 / 29
48.78
39 / 45

Clinical Workflows

4 evaluations
Benchmark / mode
Score
Rank/total
MedScribe
Standard ModeTools
72.41
57 / 66
MedScribe
Thinking EnabledTools
69.35
61 / 66
MedCode
Standard ModeTools
33.94
54 / 64
MedCode
Thinking EnabledTools
34.96
52 / 64

Capability Indices

1 evaluations
Benchmark / mode
Score
Rank/total
ECI
unknown
141.69
89 / 167

Sources

Claude Sonnet 4 Benchmark Results & Rankings | DataLearnerAI