DataLearner logo

Claude Sonnet 3.7 Benchmark Details

Claude Sonnet 3.7 currently shows benchmark results led by Aider-Polyglot (18 / 59, score 64.90), MMMU (33 / 74, score 75), SWE-bench Verified (61 / 116, score 70.30). 1 source link is attached for reference.

Benchmark Results

Claude Sonnet 3.7

Benchmark Results

Thinking
Tool usage

Knowledge Exams

1 evaluations
Benchmark / mode
Score
Rank/total
HLE
Thinking Enabled
10.30
195 / 235

Scientific Reasoning

3 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Standard Mode
68
191 / 253
GPQA Diamond
Thinking Enabled
77
150 / 253
CritPt
Thinking Enabled
0.90
162 / 204

Repository Engineering

2 evaluations
Benchmark / mode
Score
Rank/total
SWE-bench Verified
Standard ModeTools
62.30
80 / 116
SWE-bench Verified
Thinking EnabledTools
70.30
61 / 116

Mathematics

5 evaluations
Benchmark / mode
Score
Rank/total
MATH-500
Standard Mode
82.20
43 / 46
AIME2025
Standard Mode
54.80
93 / 110
AIME 2024
Standard Mode
23.30
58 / 61
FrontierMath
Standard Mode
3.10
46 / 60
FrontierMath
Thinking Enabled
4.10
41 / 60

Writing

1 evaluations
Benchmark / mode
Score
Rank/total
Creative Writing
Standard Mode
1411.70
67 / 110

Visual Understanding

5 evaluations
Benchmark / mode
Score
Rank/total
MMMU
unknown
75
33 / 74
GeoBench ACW
Standard Mode
68
14 / 20
MMMU-Pro
Standard Mode
60.10
177 / 229
VPCT
Standard Mode
39
18 / 24
VPCT
64K
35
22 / 24

Commonsense

2 evaluations
Benchmark / mode
Score
Rank/total
SimpleBench
Standard Mode
44.90
64 / 96
SimpleBench
Thinking Enabled
46.40
59 / 96

Agentic Development

4 evaluations
Benchmark / mode
Score
Rank/total
Aider-Polyglot
Standard Mode
60.40
21 / 59
64.90
18 / 59
Terminal Bench Hard
Standard ModeTools
21.20
145 / 244
Terminal Bench Hard
Thinking EnabledTools
21
148 / 244

Service Workflows

2 evaluations
Benchmark / mode
Score
Rank/total
τ²-Bench
Thinking EnabledTools
61.80
31 / 44
τ²-Bench - Telecom
Thinking EnabledTools
55
27 / 30

Cross-industry Work

1 evaluations
Benchmark / mode
Score
Rank/total
GDPval-AA
Thinking Enabled
28
14 / 15

Long Reasoning

2 evaluations
Benchmark / mode
Score
Rank/total
AA-LCR
Thinking Enabled
61
5 / 6
Fiction.liveBench
Standard Mode
50
16 / 16

Desktop Workflows

1 evaluations
Benchmark / mode
Score
Rank/total
OSWorld-Verified
Thinking EnabledTools
28
28 / 28

Maintenance & Optimization

1 evaluations
Benchmark / mode
Score
Rank/total
GSO
Standard ModeTools
3.80
19 / 21

Capability Frontier Metrics

2 evaluations
Benchmark / mode
Score
Rank/total
METR Time Horizons v1.1
Standard ModeTools
60.39
16 / 22
56.09
17 / 22

Capability Indices

1 evaluations
Benchmark / mode
Score
Rank/total
ECI
unknown
141.16
92 / 167

Sources