DataLearner 标志
GP

GPT-5.4 nano

多模态大模型GPT NanoGPT-5.4

GPT-5.4 nano

发布时间: 2026-03-17更新于: 2026-06-15知识截止: 2025-08-31浏览量: 612
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
400K
多语言支持
支持
推理能力
2/5

GPT-5.4 nano 是由 OpenAI 发布的 AI 模型,发布时间为 2026-03-17,定位为 多模态大模型,上下文长度为 400K,采用 不开源 许可,在 GDPval-AA v2 上取得 1035.00 分。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

GPT-5.4 nano

模型基本信息

推理过程
支持
思考模式
思考水平 · 高 (High) (默认)思考水平 · 低 (Low)思考水平 · 中 (Medium)思考水平 · 极高 (Extra-High)
上下文长度
400K tokens
最大输出长度
128K tokens
模型类型
多模态大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-03-17
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
2025-08-31
GPT-5.4 nano

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
暂无
GPT-5.4 nano

官方介绍与博客

DataLearnerAI博客
暂无
GPT-5.4 nano

API接口信息

接口速度
5/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.200/ 1M tokens$1.25/ 1M tokens
批量模式
类型适用条件输入输出
文本-$0.100/ 1M tokens$0.625/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-—$0.010/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

GPT-5.4 nano

评测结果

GPT-5.4 nano 当前已收录的代表性评测结果包括 IF Bench(28 / 282,得分 75.90)、Terminal Bench Hard(45 / 244,得分 42.40)、HLE(151 / 568,得分 37.70)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

抽象归纳与泛化

共 8 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
低工具
18.33
159 / 176
ARC-AGI-1
中工具
33
150 / 176
ARC-AGI-1
高工具
38.17
142 / 176
ARC-AGI-1
极高工具
51.50
132 / 176
ARC-AGI-2
低工具
1.53
149 / 164
ARC-AGI-2
中工具
1.94
144 / 164
ARC-AGI-2
高工具
3.61
138 / 164
ARC-AGI-2
极高工具
5.69
124 / 164

综合知识考试

共 5 项评测
评测名称 / 模式
得分
排名/总数
HLE
常规模式
4.10
525 / 568
HLE
中
15.90
332 / 568
HLE
极高
28.30
227 / 568
HLE
极高
24.30
262 / 568
HLE
极高工具
37.70
151 / 568

科学知识与推理

共 6 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
55.56
398 / 461
72.22
305 / 461
76.10
272 / 461
81.70
211 / 461
5.10
98 / 204
CritPt
极高
9.30
79 / 204

图像感知与视觉推理

共 5 项评测
评测名称 / 模式
得分
排名/总数
MMMU
极高
66.10
53 / 74
MMMU
极高工具
69.50
47 / 74
MMMU-Pro
常规模式
43.80
217 / 229
59.50
179 / 229
MMMU-Pro
极高
65.40
152 / 229

数学

共 5 项评测
评测名称 / 模式
得分
排名/总数
FrontierMath v2
常规模式
4.56
58 / 58
20.35
49 / 58
44.91
32 / 58
12.20
31 / 42
6.30
35 / 80

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
52.40
41 / 62

客服与业务流程

共 5 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
常规模式工具
34.80
197 / 264
52.60
168 / 264
76
120 / 264
SAGE
高工具
38.08
45 / 64
τ³-Banking
极高工具
27.40
69 / 167

指令与格式遵循

共 3 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
32.70
254 / 282
64.40
104 / 282
IF Bench
极高
75.90
28 / 282

跨能力综合测试

共 5 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
32.39
117 / 117
48.67
98 / 117
58.46
77 / 117
62.75
58 / 117
LiveBench
深度
69.58
39 / 117

自主开发与终端任务

共 6 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
极高工具
60.70
117 / 199
Terminal Bench 2.0
极高工具
46.30
42 / 48
Terminal Bench Hard
常规模式工具
24.20
134 / 244
33.30
86 / 244
42.40
45 / 244
Terminal-Bench 4.0
极高工具
0.50
90 / 95

跨应用与工具编排

共 3 项评测
评测名称 / 模式
得分
排名/总数
Claw Bench
思考模式工具
89.70
10 / 29
68.99
27 / 45
Tool Decathlon
极高工具
35.50
9 / 10

多轮记忆与持续上下文

共 5 项评测
评测名称 / 模式
得分
排名/总数
Context Arena
常规模式
13.04
126 / 126
23.31
120 / 126
32.74
113 / 126
39.03
100 / 126
52.79
85 / 126

跨长文理解与整合

共 3 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
常规模式
29.70
167 / 174
67.30
117 / 174
AA-LCR
极高
76.70
81 / 174

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld-Verified
极高工具
39
27 / 28

跨能力聚合指数

共 2 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
145.78
73 / 167
Vals Index
高工具
33
37 / 42

跨行业工作评估

共 2 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
常规模式工具
681
108 / 110
GDPval-AA v2
极高工具
1035
93 / 110

办公与文档流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-Briefcase
极高工具
670
84 / 88

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
极高
47.20
83 / 134

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
极高工具
52.24
39 / 44
6.25
41 / 42

金融

共 2 项评测
评测名称 / 模式
得分
排名/总数
44.75
36 / 42
38.22
37 / 42

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
极高
7.80
92 / 122

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
14.47
35 / 43

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
26.10
43 / 60

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
高工具
77.09
48 / 66
MedCode
高工具
41.03
43 / 64
GPT-5.4 nano

发布机构

GPT-5.4 nano

模型解读

GPT-5.4 nano 简介与核心特点

GPT-5.4 nano 是 OpenAI 于 2026 年 3 月 17 日正式发布的超轻量级语言模型,是 GPT-5.4 系列中体积最小、成本最低的变体,也是 GPT-5 nano 的直接升级版本。该模型专为高吞吐量 API 场景设计,目标是以极低延迟和极低单位成本完成大批量短任务。OpenAI 将其定位为“速度与成本最重要时的首选模型”,目前仅通过 API 对开发者开放,不在 ChatGPT 产品中直接面向消费者提供。

架构与技术规格

GPT-5.4 nano 的模型参数量尚未对外公开。官方暂未明确说明其上下文窗口大小。基于 GPT-5.4 系列统一的训练数据,其知识截止日期同为 2025 年 8 月 31 日。该模型针对短任务、高吞吐量场景进行了专项优化,在“extended multi-step reasoning”(扩展多步推理)方面存在明确的设计取舍。

核心能力与支持模态

GPT-5.4 nano 支持文本与图像的多模态输入,输出为纯文本。官方说明其具备以下能力:在短定义交互中对开发者意图的强指令遵循;用于轻量级自动化场景的函数与工具调用;针对常见代码任务的快速完成能力;以及结合文本进行基础图像解析的能力。与 GPT-5.4 mini 相比,nano 不具备完整的计算机使用能力,在计算机操控任务上的表现明显偏弱。

性能与基准评测

根据 OpenAI 公布的官方数据,GPT-5.4 nano 在代码生成基准 SWE-Bench Pro 上得分为 52.4%,略低于 GPT-5.4 mini 的 54.38%,但相较前代 GPT-5 nano 仍有显著提升;在计算机操控基准 OSWorld-Verified 上得分为 39.01%,明显低于 GPT-5.4 mini 的 72.13%,也低于 GPT-5 mini 的 42.0%,表明 nano 在复杂多步骤交互类任务上存在明确局限,适用场景应严格限定在结构清晰的短任务中。

应用场景与局限

OpenAI 官方推荐将 GPT-5.4 nano 用于以下高频、高吞吐量的典型场景:内容分类(Classification)、数据提取(Data Extraction)、排序(Ranking),以及多代理系统中处理简单支撑性子任务的轻量编程子代理。对于需要复杂推理、长上下文处理、多步骤计划或计算机界面操控的任务,官方明确不推荐使用 nano 模型,应选用 GPT-5.4 mini 或 GPT-5.4 旗舰版。

访问方式与许可

GPT-5.4 nano 目前仅通过 OpenAI API 向开发者提供访问,不在 ChatGPT 产品中直接向消费者开放。模型为闭源,不提供开源权重。API 按 token 计费:输入 $0.20/百万 token,输出 $1.25/百万 token,是 OpenAI 现有量产模型体系中定价最低的选项之一,约为 GPT-5.4 mini 输入成本的 26.7%,适合对成本极度敏感的大批量业务场景。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码