DataLearner 标志

Opus 4.5 评测详情

Opus 4.5 当前已收录的代表性评测结果包括 MMLU Pro(2 / 133,得分 90)、Terminal Bench Hard(1 / 13,得分 44)、SWE-bench Verified(9 / 115,得分 80.90)。并附有 3 个数据来源链接供参考。

评测结果

Opus 4.5

评测结果

思考模式
工具使用

综合评估

共 9 项评测
评测名称 / 模式
得分
排名/总数
MMLU Pro
扩展
90
2 / 133
ARC-AGI-1
扩展
80
46 / 92
75.96
11 / 115
LiveBench
思考水平·低
55.77
80 / 115
LiveBench
思考水平·中
59.10
72 / 115
LiveBench
思考水平·高
58.59
74 / 115
HLE
扩展
30.80
95 / 189
HLE
扩展工具
43.20
58 / 189
ARC-AGI-2
扩展
37.60
51 / 85

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
87
81 / 270

编程与软件工程

共 6 项评测
评测名称 / 模式
得分
排名/总数
1479
20 / 35
1512
17 / 35
LiveCodeBench
扩展工具
87
15 / 127
SWE-bench Verified
扩展工具
80.90
9 / 115
WeirdML v2
16K工具
63.70
24 / 52
GSO
常规模式工具
26.50
8 / 21

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1683.20
25 / 99

多模态理解

共 3 项评测
评测名称 / 模式
得分
排名/总数
MMMU
扩展
80.70
10 / 28
GeoBench ACW
常规模式
75
10 / 20
VPCT
32K
40
15 / 24

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
62
24 / 92

Agent能力评测

共 7 项评测
评测名称 / 模式
得分
排名/总数
METR Time Horizons v1.1
常规模式工具
293
6 / 22
288.90
7 / 22
90.70
21 / 35
τ²-Bench
扩展工具
81.99
13 / 44
44
1 / 13
BALROG
常规模式工具
43.50
5 / 12
BALROG
64K工具
43
7 / 12

数学推理

共 9 项评测
评测名称 / 模式
得分
排名/总数
AIME 2026
扩展
93.30
8 / 20
34.39
39 / 58
23.80
7 / 19
20.70
17 / 60
4.20
40 / 80
2.10
56 / 80
4.20
40 / 80
4.20
40 / 80

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
扩展工具
58
26 / 35

AI Agent - 工具使用

共 2 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
思考水平·高工具
69.80
28 / 41
Terminal Bench 2.0
扩展工具
59.30
20 / 48

OpenClaw智能体能力综合测评

共 2 项评测
评测名称 / 模式
得分
排名/总数
Claw Bench
扩展工具
91.50
7 / 29
Pinch Bench
扩展工具
87.20
9 / 38

长上下文能力

共 1 项评测
评测名称 / 模式
得分
排名/总数
LongBench v2
常规模式
64.40
2 / 13

数据来源