DataLearner 标志

Opus 4.5 评测详情

Opus 4.5 当前已收录的代表性评测结果包括 MMLU Pro(2 / 133,得分 90)、Terminal Bench Hard(1 / 13,得分 44)、SWE-bench Verified(9 / 114,得分 80.90)。并附有 3 个数据来源链接供参考。

评测结果

Opus 4.5

评测结果

思考模式
工具使用

综合评估

共 9 项评测
评测名称 / 模式
得分
排名/总数
MMLU Pro
扩展
90
2 / 133
ARC-AGI
扩展
80
24 / 68
75.96
11 / 115
LiveBench
思考水平·低
55.77
80 / 115
LiveBench
思考水平·中
59.10
72 / 115
LiveBench
思考水平·高
58.59
74 / 115
HLE
扩展
30.80
88 / 181
HLE
扩展工具
43.20
52 / 181
ARC-AGI-2
扩展
37.60
29 / 62

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
87
71 / 226

编程与软件工程

共 6 项评测
评测名称 / 模式
得分
排名/总数
1479
20 / 35
1512
17 / 35
LiveCodeBench
扩展工具
87
14 / 126
SWE-bench Verified
扩展工具
80.90
9 / 114
WeirdML v2
16K工具
63.70
24 / 52
GSO
常规模式工具
26.50
8 / 21

多模态理解

共 3 项评测
评测名称 / 模式
得分
排名/总数
MMMU
扩展
80.70
11 / 29
GeoBench ACW
常规模式
75
10 / 20
VPCT
32K
40
15 / 24

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
62
14 / 67

Agent能力评测

共 7 项评测
评测名称 / 模式
得分
排名/总数
METR Time Horizons v1.1
常规模式工具
293
6 / 22
288.90
7 / 22
90.70
21 / 35
τ²-Bench
扩展工具
81.99
13 / 43
44
1 / 13
BALROG
常规模式工具
43.50
5 / 12
BALROG
64K工具
43
7 / 12

数学推理

共 8 项评测
评测名称 / 模式
得分
排名/总数
AIME 2026
扩展
93.30
8 / 19
34.39
30 / 34
20.70
17 / 60
4.20
40 / 80
2.10
56 / 80
4.20
40 / 80
4.20
40 / 80

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
扩展工具
58
24 / 33

AI Agent - 工具使用

共 2 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
思考水平·高工具
69.80
26 / 38
Terminal Bench 2.0
扩展工具
59.30
20 / 48

OpenClaw智能体能力综合测评

共 2 项评测
评测名称 / 模式
得分
排名/总数
Claw Bench
扩展工具
91.50
7 / 29
Pinch Bench
扩展工具
87.20
9 / 38

长上下文能力

共 1 项评测
评测名称 / 模式
得分
排名/总数
LongBench v2
常规模式
64.40
2 / 13

数据来源