DataLearner 标志

Claude 3.5 Sonnet New 评测详情

Claude 3.5 Sonnet New 当前已收录的代表性评测结果包括 HumanEval(5 / 140,得分 93.70)、BBH(2 / 21,得分 92.60)、MMLU(19 / 124,得分 88.30)。

评测结果

Claude 3.5 Sonnet New

评测结果

思考模式
工具使用

综合评估

共 3 项评测
评测名称 / 模式
得分
排名/总数
BBH
常规模式
92.60
2 / 21
MMLU
常规模式
88.30
19 / 124
MMLU-Pro
常规模式
78
74 / 176

编程与软件工程

共 5 项评测
评测名称 / 模式
得分
排名/总数
HumanEval
常规模式
93.70
5 / 140
SWE-bench Verified
常规模式
49
99 / 116
WeirdML v2
常规模式工具
39.97
47 / 52
LiveCodeBench
常规模式
38.70
192 / 251
GSO
常规模式工具
4.60
17 / 21

数学推理

共 5 项评测
评测名称 / 模式
得分
排名/总数
MATH
常规模式
78.30
12 / 42
MATH-500
常规模式
78
44 / 46
AIME 2024
常规模式
16
59 / 62
FrontierMath
常规模式
2.10
47 / 60
0
72 / 80

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
65
358 / 463

常识问答

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
28.40
26 / 47

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
41.40
63 / 93

Agent能力评测

共 3 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
51.60
32 / 59
BALROG
常规模式工具
32.60
10 / 12
METR Time Horizons v1.1
常规模式工具
29.58
20 / 22

多模态理解

共 2 项评测
评测名称 / 模式
得分
排名/总数
GeoBench ACW
常规模式
62
18 / 20
VPCT
常规模式
33
24 / 24