DataLearner 标志

Claude Sonnet 3.7 评测详情

Claude Sonnet 3.7 当前已收录的代表性评测结果包括 Aider-Polyglot(18 / 59,得分 64.90)、MMMU(33 / 74,得分 75)、SWE-bench Verified(61 / 116,得分 70.30)。并附有 1 个数据来源链接供参考。

评测结果

Claude Sonnet 3.7

评测结果

思考模式
工具使用

综合评估

共 4 项评测
评测名称 / 模式
得分
排名/总数
HLE
常规模式
4.20
515 / 565
HLE
开启思考
10.30
390 / 565
HLE
开启思考
9.70
396 / 565
CritPt
开启思考
0.90
159 / 201

科学与综合推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
68
338 / 463
GPQA Diamond
开启思考
77
267 / 463

编程与软件工程

共 5 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式工具
62.30
80 / 116
SWE-bench Verified
开启思考工具
70.30
61 / 116
LiveCodeBench
常规模式
39.40
189 / 251
LiveCodeBench
开启思考
47.30
173 / 251
GSO
常规模式工具
3.80
19 / 21

数学推理

共 6 项评测
评测名称 / 模式
得分
排名/总数
MATH-500
常规模式
82.20
43 / 46
AIME2025
常规模式
54.80
149 / 216
AIME2025
开启思考
56.30
144 / 216
AIME 2024
常规模式
23.30
58 / 62
FrontierMath
常规模式
3.10
46 / 60
FrontierMath
开启思考
4.10
41 / 60

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1409.10
63 / 106

多模态理解

共 5 项评测
评测名称 / 模式
得分
排名/总数
MMMU
unknown
75
33 / 74
GeoBench ACW
常规模式
68
14 / 20
MMMU-Pro
常规模式
60.10
177 / 229
VPCT
常规模式
39
18 / 24
VPCT
64K
35
22 / 24

常识推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
44.90
61 / 93
SimpleBench
开启思考
46.40
56 / 93

Agent能力评测

共 9 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
60.40
21 / 59
64.90
18 / 59
τ²-Bench
开启思考工具
61.80
31 / 44
METR Time Horizons v1.1
常规模式工具
60.39
16 / 22
56.09
17 / 22
τ²-Bench - Telecom
常规模式工具
50
172 / 264
τ²-Bench - Telecom
开启思考工具
55
163 / 264
Terminal Bench Hard
常规模式工具
21.20
145 / 244
Terminal Bench Hard
开启思考工具
21
148 / 244

指令跟随

共 2 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
44
187 / 282
IF Bench
开启思考
48.30
165 / 282

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA
开启思考
28
14 / 15

长上下文能力

共 2 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
常规模式
51.70
138 / 171
AA-LCR
开启思考
61
128 / 171

AI Agent - 工具使用

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld-Verified
开启思考工具
28
26 / 26

长上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
Fiction.liveBench
常规模式
50
16 / 16

数据来源