DataLearner logo

Claude Sonnet 4 Benchmark Details

Claude Sonnet 4 currently shows benchmark results led by SWE-bench Verified (14 / 115, score 80.20), Terminal-Bench (10 / 35, score 41.30), MMLU Pro (39 / 133, score 84). 1 source link is attached for reference.

Benchmark Results

Claude Sonnet 4

Benchmark Results

Thinking
Tool usage
Parallel

General Knowledge

9 evaluations
Benchmark / mode
Score
Rank/total
MMLU Pro
Thinking Enabled
84
39 / 133
LiveBench
Standard Mode
50.98
89 / 115
61.27
65 / 115
ARC-AGI-1
Standard Mode
23.80
80 / 92
ARC-AGI-1
Thinking Enabled
40
73 / 92
HLE
Standard Mode
5.52
180 / 189
HLE
Thinking Enabled
9.60
166 / 189
ARC-AGI-2
Standard Mode
1.30
78 / 85
ARC-AGI-2
Thinking Enabled
5.90
69 / 85

Other

3 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Standard Mode
68
204 / 270
GPQA Diamond
Thinking Enabled
75.40
167 / 270
GPQA Diamond
DeepTools
83.80
111 / 270

Coding and Software Engineer

6 evaluations
Benchmark / mode
Score
Rank/total
CodeClash
Standard ModeTools
1223
4 / 8
SWE-bench Verified
Thinking EnabledTools
72.70
52 / 115
SWE-bench Verified
Thinking Level · HighTools
80.20
14 / 115
LiveCodeBench
Standard Mode
48.50
100 / 127
LiveCodeBench
Thinking Enabled
66
62 / 127
SWE-Bench Pro - Public
Thinking Enabled
42.70
54 / 60

Math and Reasoning

12 evaluations
Benchmark / mode
Score
Rank/total
AIME2025
Standard Mode
38
95 / 106
AIME2025
Thinking Enabled
70.50
71 / 106
AIME2025
DeepTools
85
50 / 106
AIME 2024
Standard Mode
43.40
50 / 62
IMO-ProofBench
Thinking Enabled
27.10
8 / 16
IMO 2024
Standard Mode
9.70
5 / 10
IMO 2024
Thinking Enabled
5.20
8 / 10
IMO-ProofBench Advanced
Thinking Enabled
4.80
14 / 19
FrontierMath
Standard Mode
4.10
41 / 60
IMO 2025
Standard Mode
3.30
6 / 9
IMO 2025
Thinking Enabled
4
5 / 9
0
72 / 80

Writing and Creative Capabilities

1 evaluations
Benchmark / mode
Score
Rank/total
Creative Writing
Standard Mode
1480.30
49 / 99

AI Agent - Tool Usage

4 evaluations
Benchmark / mode
Score
Rank/total
OSWorld-Verified
Thinking EnabledTools
42.20
24 / 26
Terminal-Bench
Standard ModeTools
26
26 / 35
Terminal-Bench
Thinking EnabledTools
35.50
18 / 35
41.30
10 / 35

Multimodal Understanding

1 evaluations
Benchmark / mode
Score
Rank/total
MMMU
Standard Mode
76.50
16 / 28

Common Sense Reasoning

1 evaluations
Benchmark / mode
Score
Rank/total
SimpleBench
Thinking Enabled
45.50
58 / 92

Agent Level Benchmark

4 evaluations
Benchmark / mode
Score
Rank/total
τ²-Bench - Telecom
Thinking EnabledTools
65
29 / 35
Aider-Polyglot
Standard Mode
56.40
26 / 59
61.30
20 / 59
τ²-Bench
Standard ModeTools
52
35 / 44

Instruction Following

1 evaluations
Benchmark / mode
Score
Rank/total
IF Bench
Thinking EnabledTools
55
28 / 35

Productivity Knowledge

1 evaluations
Benchmark / mode
Score
Rank/total
GDPval-AA
Thinking Enabled
33
19 / 21

Long Context

1 evaluations
Benchmark / mode
Score
Rank/total
AA-LCR
Thinking Enabled
65
22 / 28

Claw-style Agent Evaluation

2 evaluations
Benchmark / mode
Score
Rank/total
Pinch Bench
Thinking EnabledTools
80.50
23 / 38
Claw Bench
Thinking EnabledTools
77.80
23 / 29

Sources