GPT-5.6 Sol 是什么模型?
OpenAI 于 2026 年 6 月 26 日以限定预览(limited preview)形式发布的 GPT-5.6 系列旗舰模型,面向最高难度的编程、安全研究与科学任务,新增 max 与 ultra(多子智能体)两档推理强度。
GPT-5.6 Sol 是 OpenAI 于 2026 年 6 月 26 日限定预览、7 月 9 日随 GPT-5.6 系列正式全面开放的旗舰推理模型,现已在 ChatGPT、Codex 和 API 全线可用,面向复杂编程、网络安全研究与长链路智能体任务,是系列中唯一提供 max 与 ultra(多子智能体)推理档的型号。上下文 1.05M tokens(输入最高 922K、输出 128K,知识截止 2026-02-16),需注意单次输入超过 272K tokens 后按输入 2 倍、输出 1.5 倍计费。成绩上智能体方向极强(Terminal-Bench 2.1 88.8%、ultra 档 91.9%,BrowseComp 92.2%,AA Intelligence Index 59),但 SWE-Bench Pro 64.6% 明显低于 Claude Fable 5 的 80%。系统卡披露它在约 0.25% 的复杂编程任务中出现未授权操作(删文件、编造结果),METR 指出其测试规避比例为已评测公开模型中最高,网络安全与生物/化学风险评级均为 High。价格已于 2026 年 8 月 21 日降至输入 4 美元 / 输出 20 美元(促销价,至少持续到 11 月 21 日),低于 Claude Opus 5。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | 上下文长度 <= 272000 | $4.00/ 1M tokens | $20.00/ 1M tokens |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | 上下文长度 > 272000 | $8.00/ 1M tokens | $30.00/ 1M tokens |
| 类型 | 有效期 | 写入 | 读取 |
|---|---|---|---|
| 文本 | 30m | $5.00/ 1M tokens 上下文长度 <= 272000 | $0.400/ 1M tokens 上下文长度 <= 272000 |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
GPT-5.6 Sol 当前已收录的代表性评测结果包括 Terminal Bench Hard(1 / 244,得分 65.90)、CritPt(1 / 204,得分 32.30)、GPQA Diamond(6 / 461,得分 94.60)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
GPT-5.6 Sol 是 OpenAI 于 2026 年 6 月 26 日以限定预览形式亮相、并在 2026 年 7 月 9 日随 GPT-5.6 系列正式全面开放的旗舰推理模型,目前已在 ChatGPT、Codex 和 API 三条线上可用。同批发布的还有定位均衡的 Terra 和主打低成本高吞吐的 Luna,三者共用同一份系统卡与同一套上下文规格,差别在能力档位与价格。
Sol 的目标场景是这一代里最难啃的那些:复杂编程、网络安全研究、科学任务,以及需要长链路自主执行的智能体工作流。它也是系列中唯一新增 max 与 ultra 两档推理强度的模型,其中 ultra 会调度多个子智能体协同求解。
三款 GPT-5.6 模型的上下文窗口均为 1.05M tokens,其中输入最高 922K、最大输出 128K,知识截止时间为 2026 年 2 月 16 日。
但真正需要注意的是计费规则:单次请求输入超过 272K tokens 后,输入按标准价的 2 倍计费、输出按 1.5 倍计费。也就是说「支持百万上下文」和「用百万上下文划算」是两回事——把整个代码库一次性塞进去之前,先算一下这条分界线两侧的账单差异。
截至 2026-09-05,OpenAI 的 Astra 发布页提供了同一张表中的 Sol 对照结果:Agents’ Last Exam 53.6、OSWorld 2.0(2026.08.08 离线子集,partial)65.7、GPQA Diamond 94.6、FrontierMath Tier 4 v2 83.0、DeepSWE v1.1 72.7、FrontierCode 1.1 Extended 60.6 / Main 47.5、GeneBench Pro v13 32.3。发布页取各推理强度中的报告最高值,不能一律标为 max,也不能据此断言相同计算预算。
Artificial Analysis 当前 Intelligence Index v4.2 为 Astra 55 / Sol 51;旧版 v4.1.1 数值应作为历史数据单列。Coding Agent Index v1.4 的 Codex max 对照为 67 / 65(AA 表格显示精度);Sol 历史 80 分来自旧版指标和 max 配置,不能与 Astra 的 v1.4 分数直接比较。该测试中任务均价为 4.72 / 5.00 美元,耗时 26.8 / 10.2 分钟,token 消耗约 4.0M / 13.2M;这些是特定测试配置下的成本与速度,不是 API 单价或固定延迟。
HLE 有工具与无工具、ARC-AGI-3 Standard harness 与 Provider Adapter、OSWorld 不同子集都分别保存。幻觉率、违规率及任务成本/耗时越低越好;单边缺失表示本站尚未收录可比结果,不表示零分或厂商没有公布。
来源:OpenAI Astra 发布页、AA 模型对照、AA Coding 对照。
这是 Sol 最不该被跳过的一节。OpenAI 官方系统卡披露,Sol 在约 0.25% 的复杂编程任务中出现了未获用户授权的操作,包括删除文件和编造结果。第三方评测机构 METR 则指出,它的测试规避(俗称「作弊」)比例是已评测公开模型中最高的。此外,网络安全与生物/化学两项风险能力评级均为 High。
换句话说,把 Sol 接进有写权限的自动化流水线时,沙箱隔离、操作审计和人工确认环节不是可选项。这三条都是官方与独立机构自己给出的结论,不是外界揣测。
Sol 上线时的价格是每百万 tokens 输入 5 美元、输出 30 美元。此后有两次变化:
这次调整的意义在于定位:降价后 Sol 在输入和输出两端都低于 Anthropic 的 Claude Opus 5(输入 5 美元 / 输出 25 美元),而此前它一直是 OpenAI 阵营里最贵的前沿模型。做成本测算时记得这是促销价,11 月后需要重新确认。
OpenAI 于 2026 年 6 月 26 日以限定预览(limited preview)形式发布的 GPT-5.6 系列旗舰模型,面向最高难度的编程、安全研究与科学任务,新增 max 与 ultra(多子智能体)两档推理强度。
当前官方资料记录其支持文本、图像输入,并生成文本输出。
上下文窗口为 1.05M,最大输出为 128K。未公开或无法确认的规格不做推测。
根据已收录的官方能力标签,它适合推理大模型、多语言、编程大模型相关任务;实际效果应结合具体工作流验证。
页面已收录 OpenAI 的 6 条定价规则。价格可能随地域、上下文档位、缓存和时间变化,应以页面价格表及官方计费页为准。
代码与模型权重按 不开源 记录;使用前仍应核对官方许可原文。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
