DataLearner 标志

Claude Sonnet 4 评测详情

Claude Sonnet 4 当前已收录的代表性评测结果包括 SWE-bench Verified(14 / 115,得分 80.20)、Terminal-Bench(10 / 35,得分 41.30)、MMLU Pro(39 / 133,得分 84)。并附有 1 个数据来源链接供参考。

评测结果

Claude Sonnet 4

评测结果

思考模式
工具使用
并行模式

综合评估

共 9 项评测
评测名称 / 模式
得分
排名/总数
MMLU Pro
开启思考
84
39 / 133
LiveBench
常规模式
50.98
89 / 115
61.27
65 / 115
ARC-AGI-1
常规模式
23.80
80 / 92
ARC-AGI-1
开启思考
40
73 / 92
HLE
常规模式
5.52
180 / 189
HLE
开启思考
9.60
166 / 189
ARC-AGI-2
常规模式
1.30
78 / 85
ARC-AGI-2
开启思考
5.90
69 / 85

科学与综合推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
68
204 / 270
GPQA Diamond
开启思考
75.40
167 / 270
GPQA Diamond
深度工具
83.80
111 / 270

编程与软件工程

共 6 项评测
评测名称 / 模式
得分
排名/总数
CodeClash
常规模式工具
1223
4 / 8
SWE-bench Verified
开启思考工具
72.70
52 / 115
SWE-bench Verified
思考水平·高工具
80.20
14 / 115
LiveCodeBench
常规模式
48.50
100 / 127
LiveCodeBench
开启思考
66
62 / 127
42.70
54 / 60

数学推理

共 12 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
常规模式
38
95 / 106
AIME2025
开启思考
70.50
71 / 106
AIME2025
深度工具
85
50 / 106
AIME 2024
常规模式
43.40
50 / 62
IMO-ProofBench
开启思考
27.10
8 / 16
IMO 2024
常规模式
9.70
5 / 10
IMO 2024
开启思考
5.20
8 / 10
4.80
14 / 19
FrontierMath
常规模式
4.10
41 / 60
IMO 2025
常规模式
3.30
6 / 9
IMO 2025
开启思考
4
5 / 9
0
72 / 80

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1480.30
49 / 99

AI Agent - 工具使用

共 4 项评测
评测名称 / 模式
得分
排名/总数
OSWorld-Verified
开启思考工具
42.20
24 / 26
Terminal-Bench
常规模式工具
26
26 / 35
Terminal-Bench
开启思考工具
35.50
18 / 35
Terminal-Bench
深度工具
41.30
10 / 35

多模态理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
MMMU
常规模式
76.50
16 / 28

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
开启思考
45.50
58 / 92

Agent能力评测

共 4 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
开启思考工具
65
29 / 35
Aider-Polyglot
常规模式
56.40
26 / 59
61.30
20 / 59
τ²-Bench
常规模式工具
52
35 / 44

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
开启思考工具
55
28 / 35

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA
开启思考
33
19 / 21

长上下文能力

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
开启思考
65
22 / 28

OpenClaw智能体能力综合测评

共 2 项评测
评测名称 / 模式
得分
排名/总数
Pinch Bench
开启思考工具
80.50
23 / 38
Claw Bench
开启思考工具
77.80
23 / 29

数据来源