DataLearner 标志
GP

GPT-5.6 Luna

推理大模型工具使用GPT-5.6

GPT-5.6 Luna

发布时间: 2026-06-26更新于: 2026-08-23知识截止: 2026-02-16浏览量: 996
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1.05M
多语言支持
支持
推理能力
3/5

GPT-5.6 Luna 是 OpenAI 于 2026 年 6 月 26 日限定预览、7 月 9 日正式全面开放的 GPT-5.6 系列低成本模型,面向摘要、起草、分类和常规自动化等高吞吐日常任务。2026 年 7 月 30 日 OpenAI 将其价格一次性下调 80%,当前为每百万 tokens 输入 0.20 美元、输出 1.20 美元,比旗舰 Sol 便宜约 25 倍。反直觉的是它的智能体成绩并不低:Agents’ Last Exam 50.3 分,与 Terra 的 50.4 和 Sol 的 53.6 仅差 3.3 分;其余为 AA Intelligence Index 51、Terminal-Bench 2.1 84.70、DeepSWE 67.20、AA Coding Agent Index 74.6,每任务成本约 0.21 美元。但它有一个必须避开的硬伤:MRCR 长上下文召回仅 41.3%,而 Sol 为 91.5%、Terra 为 89.6%,因此尽管名义上下文同为 1.05M tokens,也不应用于大文档分析或长代码库推理,只适合较短、范围明确的任务。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

GPT-5.6 Luna

模型基本信息

推理过程
支持
思考模式
思考水平 · 中 (Medium) (默认)常规模式思考水平 · 低 (Low)思考水平 · 高 (High)
上下文长度
1.05M tokens
最大输出长度
128K tokens
模型类型
推理大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-06-26
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
2026-02-16
GPT-5.6 Luna

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
暂无
GPT-5.6 Luna

官方介绍与博客

DataLearnerAI博客
暂无
GPT-5.6 Luna

API接口信息

接口速度
5/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.200/ 1M tokens$1.20/ 1M tokens
long-context
类型适用条件输入输出
文本-$0.400/ 1M tokens$1.80/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本30m$0.250/ 1M tokens$0.020/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

GPT-5.6 Luna

评测结果

GPT-5.6 Luna 当前已收录的代表性评测结果包括 AA-LCR(11 / 174,得分 83.70)、PinchBench v2(4 / 45,得分 88.67)、ECI(21 / 167,得分 156.32)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

抽象归纳与泛化

共 15 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
低工具
34.17
148 / 176
ARC-AGI-1
中工具
56.50
124 / 176
ARC-AGI-1
高工具
76.50
93 / 176
ARC-AGI-1
最高
88
67 / 176
ARC-AGI-1
极高工具
87.67
69 / 176
ARC-AGI-2
低工具
5.14
126 / 164
ARC-AGI-2
中工具
7.36
118 / 164
ARC-AGI-2
高工具
29.31
98 / 164
ARC-AGI-2
最高
59.54
69 / 164
ARC-AGI-2
极高工具
47.64
83 / 164

综合知识考试

共 6 项评测
评测名称 / 模式
得分
排名/总数
HLE
常规模式
7.20
442 / 568
HLE
低
19.80
293 / 568
HLE
中
25.80
246 / 568
HLE
高
33.40
189 / 568
HLE
最高
39.50
140 / 568
HLE
极高
37
162 / 568

科学知识与推理

共 13 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
63.64
365 / 461
82.32
203 / 461
85.90
150 / 461
89.20
100 / 461
91.60
61 / 461
89.50
95 / 461
CritPt
常规模式
0.30
186 / 204
2.60
125 / 204
4.90
102 / 204
16.60
54 / 204
CritPt
最高
20.60
38 / 204
CritPt
极高
20.60
38 / 204
MysteryMechanism
最高工具
14.41
13 / 13

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1825.80
17 / 106

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
46.80
54 / 93

多轮记忆与持续上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
81.80
34 / 126

跨长文理解与整合

共 6 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
常规模式
42.70
157 / 174
70
107 / 174
75
88 / 174
80.30
43 / 174
AA-LCR
最高
83.70
11 / 174
AA-LCR
极高
81.70
32 / 174

自主开发与终端任务

共 16 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
常规模式工具
39
154 / 199
43.40
149 / 199
53.20
132 / 199
69.70
95 / 199
84.70
40 / 199
Terminal-Bench 2.1
最高工具
75.70
80 / 199
Terminal-Bench 2.1
极高工具
77.90
74 / 199
16
46 / 46
22.20
45 / 46
29.40
36 / 46
CursorBench 4.0
最高工具
35.90
24 / 46
CursorBench 4.0
极高工具
33
30 / 46
0.50
90 / 95
2.50
72 / 95
Terminal-Bench 4.0
最高工具
17.27
40 / 95
Terminal-Bench 4.0
极高工具
3.50
68 / 95

仓库修复与多文件工程

共 5 项评测
评测名称 / 模式
得分
排名/总数
DeepSWE
低工具
1.55
91 / 91
DeepSWE
中工具
11.28
90 / 91
DeepSWE
高工具
44.25
72 / 91
DeepSWE
最高工具
67.19
33 / 91
DeepSWE
极高工具
67.20
32 / 91

跨能力聚合指数

共 4 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
156.32
21 / 167
Vals Index
最高工具
59.88
14 / 42
37.32
24 / 29

编码综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数

跨应用与工具编排

共 2 项评测
评测名称 / 模式
得分
排名/总数
88.67
4 / 45
Agents' Last Exam
极高工具
50.30
7 / 24

跨行业工作评估

共 6 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
常规模式工具
1007
95 / 110
GDPval-AA v2
低工具
1075
90 / 110
GDPval-AA v2
中工具
1190
77 / 110
GDPval-AA v2
高工具
1375
55 / 110
GDPval-AA v2
最高工具
1489
33 / 110
GDPval-AA v2
极高工具
1428
46 / 110

办公与文档流程

共 6 项评测
评测名称 / 模式
得分
排名/总数
AA-Briefcase
常规模式工具
704
83 / 88
AA-Briefcase
低工具
744
81 / 88
AA-Briefcase
中工具
934
71 / 88
AA-Briefcase
高工具
1173
53 / 88
AA-Briefcase
最高工具
1339
34 / 88
AA-Briefcase
极高工具
1268
43 / 88

图像感知与视觉推理

共 6 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
60.30
175 / 229
74
99 / 229
75.80
80 / 229
77.60
66 / 229
MMMU-Pro
最高
78.60
55 / 229
MMMU-Pro
极高
78.60
55 / 229

科学计算与科研编程

共 6 项评测
评测名称 / 模式
得分
排名/总数
46.10
88 / 134
46.80
85 / 134
51.60
62 / 134
SciCode
最高
53.60
51 / 134
SciCode
极高
50.50
70 / 134
3.30
12 / 12

客服与业务流程

共 8 项评测
评测名称 / 模式
得分
排名/总数
61.16
18 / 26
SAGE
最高工具
44.22
34 / 64
τ³-Banking
常规模式工具
9.70
134 / 167
τ³-Banking
低工具
12.80
122 / 167
τ³-Banking
中工具
17.70
99 / 167
τ³-Banking
高工具
25.20
77 / 167
τ³-Banking
最高工具
31.10
57 / 167
τ³-Banking
极高工具
28.70
67 / 167

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
最高工具
87.90
16 / 44
36.54
26 / 42
1.25
32 / 43

金融

共 3 项评测
评测名称 / 模式
得分
排名/总数
67.12
13 / 42
Tax Agent Bench
最高工具
60.81
15 / 20
Finance Agent v2
最高工具
55.04
15 / 42

数学

共 5 项评测
评测名称 / 模式
得分
排名/总数
FrontierMath v2
常规模式
39.65
36 / 58
41.40
35 / 58
82.11
8 / 58
60.98
9 / 42
60
12 / 28

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
高工具
60.86
27 / 52

综合偏好评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
1522.94
15 / 35

文档与图表理解

共 5 项评测
评测名称 / 模式
得分
排名/总数
14.20
64 / 122
15.20
61 / 122
22.20
29 / 122
GDP.pdf
最高
24
21 / 122
GDP.pdf
极高
23.80
24 / 122

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Code Migration
最高工具
44.55
15 / 43

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
77.06
20 / 60

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
IOI (Vals v2)
最高工具
61.78
10 / 26

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
最高工具
84.39
24 / 66
MedCode
最高工具
42.39
39 / 64

和其他模型对比

GPT-5.6 Luna

发布机构

GPT-5.6 Luna

模型解读

系列里最便宜的一档,便宜得很夸张

GPT-5.6 Luna 是 OpenAI 于 2026 年 6 月 26 日限定预览、2026 年 7 月 9 日随 GPT-5.6 系列正式全面开放的低成本高吞吐模型,面向摘要、起草、分类和常规自动化这类量大、单价敏感的日常任务。

它最戏剧性的变化发生在 2026 年 7 月 30 日:OpenAI 一次性把 Luna 的价格下调了 80%,当前为每百万 tokens 输入 0.20 美元、输出 1.20 美元,缓存输入 0.02 美元。对比同系列旗舰 Sol(促销价 4/20 美元),Luna 在输入和输出两端都便宜 约 25 倍。

令人意外的是,它的智能体成绩并不低

便宜 25 倍通常意味着能力断崖,但 Luna 在部分基准上的表现相当反直觉:Agents’ Last Exam 50.3 分,而旗舰 Sol 是 53.6、Terra 是 50.4——三者只差 3.3 分。其它成绩包括 Artificial Analysis Intelligence Index(max 档)51 分、Terminal-Bench 2.1 84.70、DeepSWE 67.20、AA Coding Agent Index 74.6,每任务成本约 0.21 美元,约为 Sol 的五分之一,折算下来性价比约为每美元 24 个基准分。

但有一个硬伤,必须避开

Luna 的长上下文召回是整个系列的明显断点:MRCR 仅 41.3%,而 Sol 为 91.5%、Terra 为 89.6%。这不是「略差一些」,而是量级差异。

它的直接含义是:不要把 Luna 用在大文档分析、长代码库推理或任何需要跨长上下文准确检索的场景——哪怕它名义上也支持 1.05M tokens 的上下文窗口,塞进去的内容它未必找得回来。真正适合它的是较短、范围明确、单步能完成的任务。需要读长文档时,升到 Terra 的成本仍然远低于 Sol。

规格与安全评估

上下文窗口 1.05M tokens(输入最高 922K、最大输出 128K),知识截止 2026 年 2 月 16 日,输入支持文本与图像。与系列一致,单次输入超过 272K tokens 后按输入 2 倍、输出 1.5 倍计费。

Luna 与 Sol、Terra 共享同一份 OpenAI GPT-5.6 系统卡,网络安全与生物/化学两项风险能力评级均为 High,详细披露见 GPT-5.6 Sol 页面。

官方来源

GPT-5.6 Luna

常见问题

Luna、Terra、Sol 三个怎么选?

按任务难度和成本敏感度选。Luna 面向成本敏感、高吞吐的日常任务(摘要、起草、常规自动化),AA Intelligence Index 51 分、每任务约 $0.21;Terra 面向高并发生产场景(客服、内部工具、文档分析),55 分、约 $0.55;Sol 面向最高难度的编程、科研与安全任务,59 分、约 $1.0 量级。Luna 的性价比约为每美元 24 个基准分,是三者中最高的。

Luna 不适合做什么?

不适合大文档长链路工作流。它的长上下文召回相对偏弱,MRCR 只有 41.3%,虽然名义上下文是 1.05M tokens,但实际在超长上下文里精确检索信息的能力跟不上。官方和实测都指向同一结论:把它用在较短、范围明确的任务上。

Luna 的价格是多少?

每百万 tokens 输入 $1.00、缓存命中输入 $0.10、输出 $6.00(另有 $2.00 / $9.00 一档的计价档位)。作为对比,Terra 是 $2.50 / $15.00,Sol 是 $5.00 / $30.00——Luna 大约是 Sol 的五分之一。

Luna 的实测成绩怎么样?

在库内已收录的成绩中,Terminal-Bench 2.1 无工具档 84.70 排 44 个模型第 10,DeepSWE 67.20 排 27 个第 6,Agents' Last Exam 50.30 排 11 个第 3,FrontierMath v2 82.11 排 34 个第 8,GPQA Diamond 91.60 排 226 个第 27。作为系列里最便宜的一档,这些成绩相当能打。但 AA Intelligence Index 51 分在 8 个模型中排第 7,综合智能水平确实是三者最低。

Luna 的安全评级如何?

Luna 与 Sol、Terra 共享同一份 OpenAI GPT-5.6 system card 安全评估,网络安全与生物/化学风险两项能力评级均为「High」。详细披露内容在 GPT-5.6 Sol 页面。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码