DataLearner 标志
GP

GPT-5.6 Terra

推理大模型编程大模型GPT-5.6

GPT-5.6 Terra

发布时间: 2026-06-26更新于: 2026-08-23知识截止: 2026-02-16浏览量: 770
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1.05M
多语言支持
支持
推理能力
4/5

GPT-5.6 Terra 是 OpenAI 于 2026 年 6 月 26 日限定预览、7 月 9 日正式全面开放的 GPT-5.6 系列均衡型模型,在 Sol / Terra / Luna 三档中被普遍推荐为默认选择:Artificial Analysis Intelligence Index(max 档)得分 55、Sol 为 59,但每任务成本约 0.55 美元只有 Sol 的一半;Agents’ Last Exam 上三款模型挤在 50.3–53.6 的 3.3 分区间内,价格却相差十倍以上。其余成绩包括 Terminal-Bench 2.1 87.40、DeepSWE 69.60、AA Coding Agent Index 77.4、MRCR 长上下文召回 89.6%(远高于 Luna 的 41.3%)。短板是长链路编码:CodeRabbit 测得其通过率 40.7%,Sol 为 63.7%,更适合范围明确、成本敏感的编码工作。上下文 1.05M tokens,输入超 272K 后按输入 2 倍、输出 1.5 倍计费。价格自 2026 年 7 月 30 日下调 20% 后为输入 2.00 美元 / 输出 12.00 美元每百万 tokens。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

GPT-5.6 Terra

模型基本信息

推理过程
支持
思考模式
思考水平 · 中 (Medium) (默认)常规模式思考水平 · 低 (Low)思考水平 · 高 (High)
上下文长度
1.05M tokens
最大输出长度
128K tokens
模型类型
推理大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-06-26
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
2026-02-16
GPT-5.6 Terra

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
暂无
GPT-5.6 Terra

官方介绍与博客

DataLearnerAI博客
暂无
GPT-5.6 Terra

API接口信息

接口速度
4/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$2.00/ 1M tokens$12.00/ 1M tokens
long-context
类型适用条件输入输出
文本-$4.00/ 1M tokens$18.00/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本30m$2.50/ 1M tokens$0.200/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

GPT-5.6 Terra

评测结果

GPT-5.6 Terra 当前已收录的代表性评测结果包括 Terminal Bench Hard(2 / 244,得分 62.90)、ECI(7 / 167,得分 159.31)、CritPt(9 / 204,得分 30)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

抽象归纳与泛化

共 15 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
低工具
60.17
115 / 176
ARC-AGI-1
中工具
77
92 / 176
ARC-AGI-1
高工具
92
50 / 176
ARC-AGI-1
最高
96.50
22 / 176
ARC-AGI-1
极高工具
94
38 / 176
ARC-AGI-2
低工具
18.75
103 / 164
ARC-AGI-2
中工具
37.50
91 / 164
ARC-AGI-2
高工具
67.08
54 / 164
ARC-AGI-2
最高
83.90
30 / 164
ARC-AGI-2
极高工具
74.17
42 / 164

综合知识考试

共 7 项评测
评测名称 / 模式
得分
排名/总数
51.10
5 / 6
HLE
常规模式
11.40
379 / 568
HLE
低
29.20
218 / 568
HLE
中
33.30
190 / 568
HLE
高
38.50
149 / 568
HLE
最高
42.90
106 / 568
HLE
极高
41.90
122 / 568

科学知识与推理

共 12 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
77.27
265 / 461
87.37
128 / 461
87.20
131 / 461
89.60
93 / 461
93.31
32 / 461
90.80
68 / 461
CritPt
常规模式
2
131 / 204
9.40
77 / 204
17.40
49 / 204
22.90
33 / 204
CritPt
最高
30
9 / 204
CritPt
极高
27.10
21 / 204

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1850.30
11 / 106

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
48.90
52 / 93

客服与业务流程

共 13 项评测
评测名称 / 模式
得分
排名/总数
60.50
158 / 264
72.80
131 / 264
78.40
118 / 264
86.30
82 / 264
80.40
112 / 264
62.38
16 / 26
SAGE
最高工具
47
26 / 64
τ³-Banking
常规模式工具
15.70
107 / 167
τ³-Banking
低工具
18.80
96 / 167
τ³-Banking
中工具
25.60
75 / 167
τ³-Banking
高工具
28.70
67 / 167
τ³-Banking
最高工具
40.20
32 / 167
τ³-Banking
极高工具
29.70
63 / 167

指令与格式遵循

共 5 项评测
评测名称 / 模式
得分
排名/总数
59.70
120 / 282
62.20
112 / 282
64.40
104 / 282
IF Bench
最高
71.20
60 / 282
IF Bench
极高
66.30
95 / 282

自主开发与终端任务

共 21 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
常规模式工具
56.20
126 / 199
62.50
110 / 199
72.30
91 / 199
75.70
80 / 199
87.40
23 / 199
Terminal-Bench 2.1
最高工具
78.40
70 / 199
Terminal-Bench 2.1
极高工具
80.10
61 / 199
43.90
37 / 244
57.60
11 / 244
57.60
11 / 244
62.90
2 / 244
25.20
41 / 46
27.60
40 / 46
30.70
35 / 46
CursorBench 4.0
最高工具
41.30
16 / 46
CursorBench 4.0
极高工具
33.60
27 / 46
1.50
80 / 95
1
83 / 95
1.50
80 / 95
Terminal-Bench 4.0
最高工具
21.52
33 / 95
Terminal-Bench 4.0
极高工具
10.10
55 / 95

多轮记忆与持续上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
92.17
11 / 126

跨长文理解与整合

共 6 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
常规模式
58.70
133 / 174
71.30
101 / 174
74
92 / 174
77.70
73 / 174
AA-LCR
最高
83
16 / 174
AA-LCR
极高
79
61 / 174

仓库修复与多文件工程

共 7 项评测
评测名称 / 模式
得分
排名/总数
SWE-Bench Pro V2
极高工具
92.37
9 / 10
86.30
6 / 11
DeepSWE
低工具
24.05
88 / 91
DeepSWE
中工具
35.11
82 / 91
DeepSWE
高工具
53.76
59 / 91
DeepSWE
最高工具
69.62
19 / 91
DeepSWE
极高工具
69.60
20 / 91

跨能力聚合指数

共 4 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
159.31
7 / 167
65.14
7 / 42
42.08
13 / 29

编码综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数

跨应用与工具编排

共 3 项评测
评测名称 / 模式
得分
排名/总数
75.89
16 / 45
59.65
10 / 17
Agents' Last Exam
极高工具
50.40
6 / 24

跨行业工作评估

共 6 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
常规模式工具
1169
80 / 110
GDPval-AA v2
低工具
1178
79 / 110
GDPval-AA v2
中工具
1318
63 / 110
GDPval-AA v2
高工具
1415
48 / 110
GDPval-AA v2
最高工具
1477
37 / 110
GDPval-AA v2
极高工具
1479
36 / 110

办公与文档流程

共 6 项评测
评测名称 / 模式
得分
排名/总数
AA-Briefcase
常规模式工具
947
70 / 88
AA-Briefcase
低工具
1014
65 / 88
AA-Briefcase
中工具
1041
64 / 88
AA-Briefcase
高工具
1201
50 / 88
AA-Briefcase
最高工具
1330
36 / 88
AA-Briefcase
极高工具
1337
35 / 88

图像感知与视觉推理

共 6 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
66.70
148 / 229
76.10
77 / 229
76.80
72 / 229
79.10
50 / 229
MMMU-Pro
最高
80.70
36 / 229
MMMU-Pro
极高
79.50
48 / 229

科学计算与科研编程

共 6 项评测
评测名称 / 模式
得分
排名/总数
49.90
75 / 134
50.50
70 / 134
52.40
58 / 134
SciCode
最高
55
39 / 134
SciCode
极高
52.30
59 / 134
8.60
8 / 12

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
最高工具
85.18
20 / 44
41.35
15 / 42
0.83
33 / 43

金融

共 3 项评测
评测名称 / 模式
得分
排名/总数
66.20
17 / 42
Tax Agent Bench
最高工具
65.20
11 / 20
Finance Agent v2
最高工具
54.44
16 / 42

数学

共 3 项评测
评测名称 / 模式
得分
排名/总数
85.96
4 / 58
74
10 / 28
70.73
8 / 42

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
高工具
78.27
10 / 52

综合偏好评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
1521.61
16 / 35

文档与图表理解

共 5 项评测
评测名称 / 模式
得分
排名/总数
17.60
49 / 122
17
54 / 122
20.80
36 / 122
GDP.pdf
最高
24
21 / 122
GDP.pdf
极高
24.60
19 / 122

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Code Migration
最高工具
47.80
8 / 43

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
74.59
22 / 60

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
IOI (Vals v2)
最高工具
87.61
5 / 26

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
最高工具
82.87
35 / 66
MedCode
最高工具
43.41
34 / 64

和其他模型对比

GPT-5.6 Terra

发布机构

GPT-5.6 Terra

模型解读

OpenAI 自己推荐的默认档

GPT-5.6 Terra 是 OpenAI 于 2026 年 6 月 26 日限定预览、2026 年 7 月 9 日随 GPT-5.6 系列正式全面开放的均衡型模型。在 Sol(旗舰)、Terra(均衡)、Luna(低成本)这条三档产品线里,它是被普遍建议作为默认选择的那一个——用不到一半于 Sol 的成本,换取与 Sol 差距很小的表现。

差距到底有多小

把三款模型放在一起看,Terra 的位置会非常清楚:

  • Artificial Analysis Intelligence Index(max 档):Terra 55,Sol 59。4 分之差,但每任务成本约 0.55 美元,只有 Sol 的一半。
  • Agents’ Last Exam:Terra 50.4,Sol 53.6,Luna 50.3。三者挤在 3.3 分区间内,而价格却相差十倍以上——这组数字比任何宣传语都更能说明该怎么选。
  • Terminal-Bench 2.1:87.40(Sol 88.8);DeepSWE 69.60;AA Coding Agent Index 77.4;Vals Index 准确率 65.14%。
  • MRCR 长上下文召回 89.6%,接近 Sol 的 91.5%,远高于 Luna 的 41.3%。这是 Terra 相对 Luna 最关键的一处优势。

但它确实不适合长链路编码

短板同样具体。第三方评测机构 CodeRabbit 的测试显示,Terra 在长链路编码任务中的通过率为 40.7%,而 Sol 为 63.7%,并且它在单个任务上的输出更啰嗦。结论比较明确:范围明确、成本敏感的编码工作交给 Terra 很合适;跨越很多步骤、需要反复自我纠错的高复杂度编码任务,还是应该升到 Sol。

规格与价格

上下文窗口 1.05M tokens(输入最高 922K、最大输出 128K),知识截止 2026 年 2 月 16 日,输入支持文本与图像。与系列内其它模型一样,单次输入超过 272K tokens 后按输入 2 倍、输出 1.5 倍计费。

价格方面,OpenAI 在 2026 年 7 月 30 日把 Terra 下调了 20%,当前为每百万 tokens 输入 2.00 美元、输出 12.00 美元,缓存输入 0.20 美元。作为参照,Sol 促销价为 4/20 美元,Luna 为 0.20/1.20 美元。

安全评估与系列共享的风险等级

Terra 与 Sol、Luna 共享同一份 OpenAI GPT-5.6 系统卡,网络安全与生物/化学两项风险能力评级均为 High;系统卡中关于未授权操作与测试规避的详细披露,见 GPT-5.6 Sol 页面。接入自动化流程时应同样做好沙箱与操作审计。

官方来源

GPT-5.6 Terra

常见问题

Terra 适合什么场景?

兼顾智能水平与成本的高并发生产场景——客服、内部工具、文档分析这类量大且难度中等的任务。它以约 GPT-5.5 一半的价格提供接近的能力,每任务成本约 $0.55,是 Sol 的一半。价格为每百万 tokens 输入 $2.50、缓存命中 $0.25、输出 $15.00。

Terra 能用来做复杂编码任务吗?

范围明确的可以,长链路的不建议。第三方评测机构 CodeRabbit 的测试显示 Terra 在长链路编码任务中的通过率为 40.7%,而 Sol 是 63.7%,差距明显;Terra 单任务输出也更啰嗦。库内成绩上 DeepSWE 69.60 排 27 个模型第 3、AA Coding Agent Index 77.40 排第 2,看起来很强,但那是极高强度思考档下的单轮成绩,不等同于长任务的稳定性。

Terra 最亮眼的成绩是什么?

抽象推理。ARC-AGI 96.50 在 68 个模型中排第 2,ARC-AGI-2 83.90 在 62 个中排第 7,ARC-AGI-3 0.80 在 9 个中排第 2。数学也很强:FrontierMath v2 85.96 排 34 个第 4,Tier 4 v2 70.73 排第 6。Agents' Last Exam 50.40 排 11 个第 2。

Terra 和 Sol 的差距有多大?

AA Intelligence Index 上 Terra 55 分、Sol 59 分,账面差 4 分;但价格差一倍,长链路编码通过率差 23 个百分点(40.7% vs 63.7%)。结论是:难度可控、量大的活用 Terra 划算;最高难度的编程、科研和安全任务应该上 Sol。

Terra 的安全评级如何?

与 Sol、Luna 共享同一份 OpenAI GPT-5.6 system card 安全评估,网络安全与生物/化学风险两项能力评级均为「High」。详细披露内容参见 GPT-5.6 Sol 页面。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码