DataLearner 标志

Claude 3.5 Haiku 评测详情

Claude 3.5 Haiku 当前已收录的代表性评测结果包括 MBPP(10 / 96,得分 85.60)、HumanEval(30 / 140,得分 88.10)、MMLU(61 / 124,得分 77.60)。

评测结果

Claude 3.5 Haiku

评测结果

思考模式
工具使用

综合评估

共 4 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
77.60
61 / 124
MMLU-Pro
常规模式
65
114 / 176
GPQA
常规模式
37.50
15 / 17
HLE
常规模式
3.60
547 / 565

编程与软件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
HumanEval
常规模式
88.10
30 / 140
MBPP
常规模式
85.60
10 / 96
LiveCodeBench
常规模式
31.40
215 / 251

数学推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
MATH
常规模式
69.20
23 / 42
FrontierMath
常规模式
0.30
57 / 60

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
41.60
429 / 463

常识问答

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
8.02
44 / 47

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1143.50
82 / 106

Agent能力评测

共 3 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
28
44 / 59
τ²-Bench - Telecom
常规模式工具
24.60
231 / 264
Terminal Bench Hard
常规模式工具
2.30
229 / 244

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
42.80
198 / 282

AI Agent - 工具使用

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
常规模式工具
10.10
174 / 194

多模态理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
45.60
212 / 229