DataLearner 标志

Opus 4.1 评测详情

Opus 4.1 当前已收录的代表性评测结果包括 MMLU-Pro(8 / 177,得分 88)、Terminal-Bench 1.0(4 / 32,得分 46.50)、IOI 2024 (Vals v1)(3 / 10,得分 18.70)。并附有 1 个数据来源链接供参考。

评测结果

Opus 4.1

评测结果

思考模式
工具使用

综合知识考试

共 3 项评测
评测名称 / 模式
得分
排名/总数
MMLU-Pro
扩展
88
8 / 177
HLE
常规模式
7.92
213 / 238
HLE
开启思考
11.52
191 / 238

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
81
124 / 255

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
扩展工具
74.50
41 / 119

数学

共 7 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
扩展
78
70 / 111
12.63
104 / 114
FrontierMath
常规模式
5.90
36 / 61
7.20
33 / 61
4.20
40 / 80
4.20
40 / 80
2.44
64 / 71

自主开发与终端任务

共 4 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 1.0
常规模式工具
43.30
8 / 32
Terminal-Bench 1.0
扩展工具
46.50
4 / 32
Terminal Bench Hard
开启思考工具
34.30
81 / 244
32
98 / 244

图像感知与视觉推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMMU
unknown
77.10
27 / 76
MMMU-Pro
开启思考
67.90
145 / 229

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
60
38 / 96

算法与竞赛编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
IOI 2024 (Vals v1)
常规模式工具
18.70
3 / 10
IOI 2025 (Vals v1)
常规模式工具
6.40
4 / 9

指令与格式遵循

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
扩展工具
55
28 / 34

跨能力综合测试

共 2 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
54.45
124 / 157
61.81
102 / 157

临床工作与医疗决策

共 4 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
常规模式工具
71.75
60 / 67
MedScribe
开启思考工具
73.90
56 / 67
MedCode
常规模式工具
41.37
40 / 65
MedCode
开启思考工具
47.23
26 / 65

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
SAGE
常规模式工具
31.38
54 / 64
SAGE
开启思考工具
30.39
58 / 64

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
144.11
81 / 167

多轮记忆与持续上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
EBR-bench
常规模式工具
7.94
20 / 23

数据来源