DataLearner 标志
GP

GPT-5.4 mini

推理大模型GPT MiniGPT-5.4

GPT-5.4 mini

发布时间: 2026-03-17更新于: 2026-07-17知识截止: 2025-08-31浏览量: 1,541
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
400K
多语言支持
支持
推理能力
3/5

GPT-5.4 mini 是OpenAI于 2026-03-17 发布的推理大模型。支持文本、图像输入和文本输出,上下文窗口为 400K,主要能力包括推理大模型、多语言。页面已收录官方资料、API 定价、公开评测,便于核对规格和使用成本。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

GPT-5.4 mini

模型基本信息

推理过程
支持
思考模式
思考水平 · 高 (High) (默认)思考水平 · 低 (Low)思考水平 · 中 (Medium)思考水平 · 极高 (Extra-High)
上下文长度
400K tokens
最大输出长度
128K tokens
模型类型
推理大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-03-17
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
2025-08-31
GPT-5.4 mini

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
GPT-5.4 mini

官方介绍与博客

DataLearnerAI博客
暂无
GPT-5.4 mini

API接口信息

接口速度
4/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.750/ 1M tokens$4.50/ 1M tokens
批量模式
类型适用条件输入输出
文本-$0.375/ 1M tokens$2.25/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-—$0.037/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

GPT-5.4 mini

评测结果

GPT-5.4 mini 当前已收录的代表性评测结果包括 Terminal Bench Hard(19 / 244,得分 52.30)、SAGE(10 / 64,得分 50.81)、PinchBench v2(13 / 45,得分 79.23)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

抽象归纳与泛化

共 8 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
低工具
13
183 / 193
ARC-AGI-1
中工具
40.83
152 / 193
ARC-AGI-1
高工具
58
132 / 193
ARC-AGI-1
极高工具
63.67
121 / 193
ARC-AGI-2
低工具
1.11
171 / 181
ARC-AGI-2
中工具
4.44
146 / 181
ARC-AGI-2
高工具
13.19
122 / 181
ARC-AGI-2
极高工具
18.90
115 / 181

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
HLE
极高
28.20
125 / 235
HLE
极高工具
41.50
78 / 235

科学知识与推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
64.14
204 / 253
2.90
119 / 204
CritPt
极高
10
74 / 204

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1665
37 / 110

数学

共 5 项评测
评测名称 / 模式
得分
排名/总数
FrontierMath v2
常规模式
17.19
54 / 58
24.56
47 / 58
51.23
29 / 58
9.76
33 / 42
2.10
56 / 80

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
54.40
34 / 62

跨能力综合测试

共 5 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
36.95
114 / 117
49.54
95 / 117
58.33
78 / 117
63.57
56 / 117
LiveBench
深度
66.37
50 / 117

自主开发与终端任务

共 5 项评测
评测名称 / 模式
得分
排名/总数
Terminal Bench 2.0
极高工具
60
19 / 48
Terminal Bench Hard
常规模式工具
18.20
154 / 244
34.10
82 / 244
52.30
19 / 244
Terminal-Bench 4.0
极高工具
2
79 / 98

跨应用与工具编排

共 4 项评测
评测名称 / 模式
得分
排名/总数
79.23
13 / 45
Claw Bench
思考模式工具
75.30
25 / 29
MCP-Atlas
极高工具
56.70
40 / 44
Tool Decathlon
极高工具
42.90
5 / 10

多轮记忆与持续上下文

共 5 项评测
评测名称 / 模式
得分
排名/总数
Context Arena
常规模式
23.34
119 / 126
39.26
99 / 126
47.64
91 / 126
49.60
90 / 126
50.92
88 / 126

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld-Verified
极高工具
72.10
20 / 28

跨能力聚合指数

共 3 项评测
评测名称 / 模式
得分
排名/总数

图像感知与视觉推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
60.50
174 / 229
71.20
122 / 229
MMMU-Pro
极高
73.30
110 / 229

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
极高
52.10
60 / 134

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
SAGE
极高工具
50.81
10 / 64
τ³-Banking
极高工具
25.60
75 / 167

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
极高工具
60.75
37 / 44
12.50
38 / 42
0
36 / 43

金融

共 2 项评测
评测名称 / 模式
得分
排名/总数
45.43
35 / 42
Finance Agent v2
极高工具
45.36
36 / 43

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
极高
13.40
66 / 122

专业数据分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-AnalystAgent
极高工具联网
15
21 / 29

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Code Migration
极高工具
12.94
37 / 43

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
47.97
39 / 61

和其他模型对比

GPT-5.4 mini

发布机构

GPT-5.4 mini

模型解读

GPT-5.4 mini 简介与核心特点

GPT-5.4 mini 是 OpenAI 于 2026 年 3 月 17 日正式发布的小型语言模型,属于 GPT-5.4 系列的轻量化变体。OpenAI 将其定位为“迄今性能最强的 mini 级模型”,旨在将 GPT-5.4 旗舰版的核心能力——包括推理、编程、多模态理解与工具调用——压缩至体积更小、速度更快的架构中,以满足高并发、低延迟工作负载的需求。其运行速度超过前代 GPT-5 mini 的 2 倍,并在多项评测中接近 GPT-5.4 旗舰版水平。

架构与技术规格

GPT-5.4 mini 的模型参数量尚未对外公开。其上下文窗口为 400,000 tokens,支持在单次会话中处理大型代码库、长文档及多轮复杂交互。官方公布的知识截止日期为 2025 年 8 月 31 日。训练数据的具体构成未予披露。该模型支持可配置的推理强度(reasoning_effort)参数,最高可设置为“high”。

核心能力与支持模态

GPT-5.4 mini 支持文本与图像的多模态输入,输出为纯文本。通过 API 访问时,该模型支持工具调用(Tool Use)、函数调用(Function Calling)、网络搜索(Web Search)、文件搜索(File Search)、计算机使用(Computer Use)以及技能(Skills)调用。在计算机使用场景中,模型能够快速解析密集用户界面的截图并执行相应操作,是高响应速度多模态应用的理想选择。

性能与基准评测

根据 OpenAI 公布的官方基准数据(均在 high 推理强度下完成),GPT-5.4 mini 在代码生成基准 SWE-Bench Pro 上得分为 54.38%,落后于旗舰版 GPT-5.4 约 3 个百分点;在计算机操控基准 OSWorld-Verified 上得分为 72.13%,接近旗舰版 75.03%,并超越人类基线 72.4%。在同等延迟条件下,mini 持续优于 GPT-5 mini,展现出该性能区间最优的延迟-性能比之一。

应用场景与局限

OpenAI 推荐将 GPT-5.4 mini 用于以下典型场景:需要低延迟反馈的代码助手(如代码编辑、代码库导航、前端生成和调试循环);多代理系统中的子代理角色(负责代码搜索、文件审查等支撑性任务);涉及实时截图解析的计算机使用类应用;以及需要对图像进行实时推理的多模态应用。在 OpenAI Codex 中,mini 仅消耗 GPT-5.4 配额的 30%,约为旗舰版成本的三分之一。对于需要深度多步骤规划或最高精度输出的任务,官方仍推荐选用 GPT-5.4 旗舰版。

访问方式与许可

GPT-5.4 mini 通过 OpenAI API、Codex 应用(含 CLI、IDE 扩展和 Web 端)以及 ChatGPT 向用户开放。在 ChatGPT 中,免费(Free)和 Go 层级用户可通过”+“菜单的“Thinking”功能访问;其余付费用户在达到 GPT-5.4 速率上限时,系统将自动回退至 GPT-5.4 mini。API 按 token 计费:标准输入 $0.75/百万 token,缓存输入 $0.075/百万 token,输出 $4.50/百万 token;数据驻留(Data Residency)地区端点额外加收 10%。模型为闭源,不提供开源权重。

GPT-5.4 mini

常见问题

GPT-5.4 mini 是什么模型?

GPT-5.4 mini 是OpenAI于 2026-03-17 发布的推理大模型。支持文本、图像输入和文本输出,上下文窗口为 400K,主要能力包括推理大模型、多语言。页面已收录官方资料、API 定价、公开评测,便于核对规格和使用成本。

GPT-5.4 mini 支持哪些输入和输出模态?

当前官方资料记录其支持文本、图像输入,并生成文本输出。

GPT-5.4 mini 的上下文窗口和最大输出是多少?

上下文窗口为 400K,最大输出为 128K。未公开或无法确认的规格不做推测。

GPT-5.4 mini 适合哪些任务?

根据已收录的官方能力标签,它适合推理大模型、多语言相关任务;实际效果应结合具体工作流验证。

GPT-5.4 mini 是否提供 API,价格如何查看?

页面已收录 OpenAI 的 8 条定价规则。价格可能随地域、上下文档位、缓存和时间变化,应以页面价格表及官方计费页为准。

GPT-5.4 mini 是否开源?

代码与模型权重按 不开源 记录;使用前仍应核对官方许可原文。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码