DataLearner 标志

GPT-4.1 评测详情

GPT-4.1 当前已收录的代表性评测结果包括 GSM8K(5 / 70,得分 95.90)、MMLU(9 / 124,得分 90.20)、DROP(4 / 9,得分 89.20)。

评测结果

GPT-4.1

评测结果

思考模式
工具使用

综合评估

共 3 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
90.20
9 / 124
MMLU Pro
常规模式
80.50
61 / 133
HLE
常规模式
3.70
184 / 185

数学推理

共 6 项评测
评测名称 / 模式
得分
排名/总数
GSM8K
常规模式
95.90
5 / 70
MATH-500
常规模式
92.80
30 / 44
AIME 2024
常规模式
48.10
49 / 62
AIME2025
常规模式
36.70
97 / 106
FrontierMath
常规模式
5.50
37 / 60
0
72 / 80

阅读理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
DROP
常规模式
89.20
4 / 9

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
66.30
208 / 270

编程与软件工程

共 5 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式
54.60
90 / 114
LiveCodeBench
常规模式
40.50
106 / 127
WeirdML v2
常规模式工具
39.04
48 / 52
35.10
1 / 1
14.40
8 / 8

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1417
56 / 99

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
27
56 / 67

Agent能力评测

共 2 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench
常规模式工具
54.70
32 / 43
Aider-Polyglot
常规模式
52.40
31 / 59

长上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
Fiction.liveBench
常规模式
63.90
15 / 16

多模态理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GeoBench ACW
常规模式
72
12 / 20