DataLearner 标志

GPT-4.1 mini 评测详情

GPT-4.1 mini 当前已收录的代表性评测结果包括 MMLU(23 / 124,得分 87.50)、IC SWE-Lancer(Diamond)(4 / 8,得分 33)、FrontierMath(39 / 60,得分 4.50)。

评测结果

GPT-4.1 mini

评测结果

思考模式
工具使用

综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
87.50
23 / 124

科学与综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
65
174 / 224

编程与软件工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
33
4 / 8
SWE-bench Verified
常规模式
23.60
112 / 114

数学推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
AIME 2024
常规模式
49.60
48 / 62
FrontierMath
常规模式
4.50
39 / 60

Agent能力评测

共 2 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench
常规模式工具
53
33 / 43
Aider-Polyglot
常规模式
32.40
44 / 59