DataLearner 标志

GPT-4.1 mini 评测详情

GPT-4.1 mini 当前已收录的代表性评测结果包括 MMLU(23 / 124,得分 87.50)、IC SWE-Lancer (Diamond)(4 / 8,得分 33)、FrontierMath(40 / 61,得分 4.50)。

评测结果

GPT-4.1 mini

评测结果

思考模式
工具使用

综合知识考试

共 1 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
87.50
23 / 124

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
65
202 / 255

仓库修复与多文件工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
33
4 / 8
SWE-bench Verified
常规模式
23.60
117 / 119

数学

共 3 项评测
评测名称 / 模式
得分
排名/总数
AIME 2024
常规模式
49.60
48 / 61
6.67
108 / 114
FrontierMath
常规模式
4.50
40 / 61

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1147
85 / 110

自主开发与终端任务

共 2 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
32.40
43 / 59
Terminal Bench Hard
常规模式工具
7.60
190 / 244

客服与业务流程

共 3 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench
常规模式工具
53
34 / 44
τ²-Bench - Telecom
开启思考工具
48.90
30 / 31
τ³-Banking
常规模式工具
5.40
152 / 167

图像感知与视觉推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
58.70
180 / 229

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
135
110 / 167