DataLearner 标志

Claude Sonnet 4 评测详情

Claude Sonnet 4 当前已收录的代表性评测结果包括 SWE-bench Verified(14 / 116,得分 80.20)、MMLU-Pro(40 / 175,得分 84)、Terminal-Bench(10 / 35,得分 41.30)。并附有 1 个数据来源链接供参考。

评测结果

Claude Sonnet 4

评测结果

思考模式
工具使用
并行模式

综合知识考试

共 5 项评测
评测名称 / 模式
得分
排名/总数
MMLU-Pro
开启思考
84
40 / 175
HLE
常规模式
5.52
473 / 568
HLE
常规模式
4.30
514 / 568
HLE
开启思考
10.70
389 / 568
HLE
开启思考
9.60
402 / 568

抽象归纳与泛化

共 4 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
常规模式
23.80
155 / 176
ARC-AGI-1
开启思考
40
140 / 176
ARC-AGI-2
常规模式
1.30
151 / 164
ARC-AGI-2
开启思考
5.93
123 / 164

科学知识与推理

共 5 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
68
338 / 461
GPQA Diamond
开启思考
75.40
277 / 461
GPQA Diamond
深度工具
83.80
182 / 461
CritPt
常规模式
1.10
151 / 204
CritPt
开启思考
0.30
186 / 204

仓库修复与多文件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
开启思考工具
72.70
52 / 116
SWE-bench Verified
思考水平·高工具
80.20
14 / 116
42.70
55 / 62

数学

共 8 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
常规模式
38
171 / 215
AIME2025
开启思考
70.50
119 / 215
AIME2025
深度工具
85
77 / 215
AIME 2024
常规模式
43.40
50 / 61
IMO-ProofBench
开启思考
27.10
8 / 16
4.80
19 / 24
FrontierMath
常规模式
4.10
41 / 60
0
72 / 80

算法与竞赛编程

共 7 项评测
评测名称 / 模式
得分
排名/总数
CodeClash
常规模式工具
1223
4 / 8
LiveCodeBench
常规模式
48.50
171 / 251
LiveCodeBench
开启思考
66
106 / 251
IOI 2024 (Vals v1)
常规模式工具
9.70
5 / 10
IOI 2024 (Vals v1)
开启思考工具
5.20
7 / 10
IOI 2025 (Vals v1)
常规模式工具
3.30
6 / 9
IOI 2025 (Vals v1)
开启思考工具
4
5 / 9

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1480.30
53 / 106

自主开发与终端任务

共 8 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
56.40
26 / 59
61.30
20 / 59
Terminal-Bench
常规模式工具
26
26 / 35
Terminal-Bench
开启思考工具
35.50
18 / 35
Terminal-Bench
深度工具
41.30
10 / 35
Terminal-Bench 2.1
开启思考工具
36.30
157 / 199
Terminal Bench Hard
常规模式工具
27.30
120 / 244
Terminal Bench Hard
开启思考工具
31.10
105 / 244

图像感知与视觉推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
MMMU
常规模式
76.50
28 / 74
MMMU
unknown
74.40
34 / 74
MMMU-Pro
常规模式
62.40
165 / 229
MMMU-Pro
开启思考
61.80
170 / 229

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
开启思考
45.50
60 / 93

客服与业务流程

共 6 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
常规模式工具
52.30
169 / 264
τ²-Bench - Telecom
开启思考工具
65
150 / 264
τ²-Bench
常规模式工具
52
35 / 44
SAGE
常规模式工具
35
49 / 64
SAGE
开启思考工具
32
52 / 64
τ³-Banking
开启思考工具
16.70
102 / 167

指令与格式遵循

共 3 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
45.40
180 / 282
IF Bench
开启思考
54.70
137 / 282
IF Bench
开启思考工具
55
134 / 282

跨能力综合测试

共 2 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
50.98
91 / 117
61.27
67 / 117

跨行业工作评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA
开启思考
33
13 / 15

跨长文理解与整合

共 2 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
常规模式
44
154 / 174
AA-LCR
开启思考
70.30
104 / 174

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld-Verified
开启思考工具
42.20
26 / 28

跨应用与工具编排

共 3 项评测
评测名称 / 模式
得分
排名/总数
Pinch Bench
开启思考工具
80.50
23 / 38
Claw Bench
开启思考工具
77.80
23 / 29
48.78
39 / 45

临床工作与医疗决策

共 4 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
常规模式工具
72.41
57 / 66
MedScribe
开启思考工具
69.35
61 / 66
MedCode
常规模式工具
33.94
54 / 64
MedCode
开启思考工具
34.96
52 / 64

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
141.69
89 / 167

数据来源