DataLearner 标志

Claude Sonnet 3.7 评测详情

Claude Sonnet 3.7 当前已收录的代表性评测结果包括 Aider-Polyglot(18 / 59,得分 64.90)、SimpleBench(35 / 67,得分 46.40)、SWE-bench Verified(61 / 114,得分 70.30)。并附有 1 个数据来源链接供参考。

评测结果

Claude Sonnet 3.7

评测结果

思考模式
工具使用

综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
10.30
155 / 181

科学与综合推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
77
133 / 226
68
167 / 226

编程与软件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
70.30
61 / 114
62.30
80 / 114
GSO
常规模式工具
3.80
19 / 21

数学推理

共 5 项评测
评测名称 / 模式
得分
排名/总数
82.20
41 / 44
54.80
85 / 107
23.30
58 / 62
4.10
41 / 60
3.10
46 / 60

常识推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
44.90
39 / 67
SimpleBench
开启思考
46.40
35 / 67

Agent能力评测

共 7 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
60.40
21 / 59
64.90
18 / 59
61.80
30 / 43
METR Time Horizons v1.1
常规模式工具
60.39
16 / 22
56.09
17 / 22

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
28
20 / 21

长上下文能力

共 1 项评测
评测名称 / 模式
得分
排名/总数
61
18 / 18

AI Agent - 工具使用

共 1 项评测
评测名称 / 模式
得分
排名/总数

多模态理解

共 3 项评测
评测名称 / 模式
得分
排名/总数
GeoBench ACW
常规模式
68
14 / 20
VPCT
常规模式
39
18 / 24
VPCT
64K
35
22 / 24

长上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
Fiction.liveBench
常规模式
50
16 / 16

数据来源