DataLearner 标志
GP

GPT-6.1 Sol

推理大模型编程大模型GPT-6

OpenAI GPT-6.1 Sol

别名:GPT 6.1 Sol / gpt-6.1-sol

发布时间: 2026-09-29更新于: 2026-09-30知识截止: 2026-04-30浏览量: 11
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1.05M
多语言支持
暂无数据
推理能力
3/5

OpenAI 面向复杂编程、电脑操作和专业工作的推理模型,支持 105 万 token 上下文,标准 API 每百万 token 输入 $2、输出 $10。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

GPT-6.1 Sol

模型基本信息

推理过程
支持
思考模式
思考水平 · 最高 (Max) (默认)思考水平 · 低 (Low)思考水平 · 中 (Medium)思考水平 · 高 (High)思考水平 · 极高 (Extra-High)
上下文长度
1.05M tokens
最大输出长度
128K tokens
模型类型
推理大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-09-29
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
2026-04-30
GPT-6.1 Sol

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
暂无
GPT-6.1 Sol

官方介绍与博客

DataLearnerAI博客
暂无
GPT-6.1 Sol

API接口信息

接口速度
3/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本上下文长度 <= 272000$2.00/ 1M tokens$10.00/ 1M tokens
文本上下文长度 > 272000$4.00/ 1M tokens$15.00/ 1M tokens
批量模式
类型适用条件输入输出
文本上下文长度 <= 272000$1.00/ 1M tokens$5.00/ 1M tokens
文本上下文长度 > 272000$2.00/ 1M tokens$7.50/ 1M tokens
fast
类型适用条件输入输出
文本上下文长度 <= 272000$4.00/ 1M tokens$20.00/ 1M tokens
文本上下文长度 > 272000$8.00/ 1M tokens$30.00/ 1M tokens
flex
类型适用条件输入输出
文本上下文长度 <= 272000$1.00/ 1M tokens$5.00/ 1M tokens
文本上下文长度 > 272000$2.00/ 1M tokens$7.50/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-$2.50/ 1M tokens
上下文长度 <= 272000
$0.050/ 1M tokens
上下文长度 <= 272000
文本-$5.00/ 1M tokens
上下文长度 > 272000
$0.100/ 1M tokens
上下文长度 > 272000
文本-—$0.200/ 1M tokens
上下文长度 <= 272000
文本-—$0.400/ 1M tokens
上下文长度 > 272000

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

GPT-6.1 Sol

评测结果

GPT-6.1 Sol 当前已收录的代表性评测结果包括 AA-Briefcase(—,得分 1564.21)、HealthBench Consensus (length-adjusted)(—,得分 96)、MMMU-Pro(—,得分 85.95)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

综合知识考试

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
最高
52.92
—

跨长文理解与整合

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
最高
83
—

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
DeepSWE
高工具
75.20
—

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld 2.0
最高工具
71.40
—

办公与文档流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
AA-Briefcase
最高工具
1564.21
—
31.70
—

图像感知与视觉推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
最高
85.95
—

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
CritPt
最高
31.71
—

科学计算与科研编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
58.10
—
SciCode
最高
54.17
—

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
最高
31
—

自主开发与终端任务

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 4.0
最高工具
56.06
—

医学知识与健康咨询

共 5 项评测
评测名称 / 模式
得分
排名/总数

漏洞利用

共 2 项评测
评测名称 / 模式
得分
排名/总数

漏洞发现与分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
78.80
—

临床工作与医疗决策

共 1 项评测
评测名称 / 模式
得分
排名/总数

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
51.83
—

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
41.53
—
GPT-6.1 Sol

发布机构

OpenAI GPT-6.1 Sol

模型解读

GPT-6.1 Sol 是 OpenAI 于 2026 年 9 月 29 日发布、面向复杂编程、电脑操作和专业工作的推理模型。官方定位是以更低成本提供接近 GPT-6 Astra 的能力。标准输入与输出价格仍为每百万 token 2 美元和 10 美元,缓存读取则从 GPT-6 Sol 的 0.20 美元降至 0.10 美元。健康评测接近 Astra,但网络安全任务仍有差距,不能把这一定位理解为所有任务上的等效替代。

105 万上下文需要区分输入额度和长请求成本

官方文档列出 1,050,000 token 上下文、922,000 token 最大输入和 128,000 token 最大输出,知识截止日期为 2026 年 4 月 30 日。支持文本、图像输入和文本输出,不支持音频或视频模态;参数规模、精确语种数量和清单没有披露。标准短请求每百万 token 的输入、缓存读取、缓存写入、输出依次为 $2、$0.10、$2.50、$10。输入超过 272,000 token 后,整次请求依次按 $4、$0.20、$5、$15 计费。Batch 与 Flex 为标准价的一半,Fast 为两倍;适用的区域处理另加 10%。

工具工作流需要 Responses,不能照搬旧 Sol 的无思考配置

API 标识为 gpt-6.1-sol。支持 low、medium(默认)、high、xhigh、max,不支持 none 或 minimal。工具调用走 Responses API;Chat Completions 支持不带工具的调用。支持流式输出、结构化输出,以及网页搜索、文件搜索、图像生成工具、代码解释器、托管 shell、apply patch、Skills、电脑操作、MCP 和工具搜索。图像生成是调用工具,不代表模型原生输出图像。Responses Multi-agent 为 beta 功能。支持美国和欧盟数据驻留,欧盟驻留不支持 Fast;不支持微调。

官方健康评测接近 Astra,安全能力仍有差距

9 月 29 日系统卡的 HealthBench 长度校正分数中,GPT-6.1 Sol 的 Professional、主集、Hard、Consensus 分别为 64.2、58.5、36.2、96.0,Astra 分别为 64.7、58.3、36.6、95.5;这些数字不应与未经长度校正的成绩混用。SEC-Bench Pro 的 pass@1 为 78.8%,低于 Astra 的 85.4%;ExploitGym 每次尝试成功率为 35.1%,Astra 为 42.4%。系统卡将其网络安全能力按 Critical、生物与化学能力按 High 处理,并采用 Astra 的防护体系。历史 ExploitBench 成绩可能受数据污染影响,不能单独据此判断现实漏洞利用能力。

适合成本敏感的复杂工作,全面替代 Astra 尚缺独立证据

标准输入和输出单价是 Astra 的五分之一,但任务总成本还取决于推理 token 和工具使用。需要复杂编程、电脑操作且预算有限时,Sol 是值得比较的候选;追求最难任务的能力上限时,Astra 仍是官方推荐选项,极低成本任务可比较 Luna。Artificial Analysis 已公布 GPT-6.1 Sol(max)的独立评测:Terminal-Bench 4.0 为 56.06%,AA Intelligence Index v4.3 为 51.83,SciCode 为 54.17%,HLE 为 52.92%,GDP.pdf 为 31.00%,CritPt 为 31.71%,AA-LCR 为 83.00%。TB4 每任务平均成本为 1.82 美元、输出 108,185 token、耗时约 1,614 秒;Terminal-Bench Science 0.1 为另一项评测,AA 得分为 58.10%。OpenAIDevs 官方 X 原帖确认:DeepSWE v1.1 在 High 档位为 75.2%,AutomationBench 1.0.6 在 Medium 档位为 31.7%,OSWorld 2.0 离线任务集在 Max 档位为 71.4%(partial score);这些已披露档位均保留原配置。系统卡未披露完整配置的成绩,本站按用户指定采用 Max 档位和其余常规默认选项,并标明录入约定;这不表示官方确认以 Max 测试。

OpenAI model documentation · Release changelog · API pricing · System card · Multi-agent beta

Codex 桌面应用与 CLI、ChatGPT Work 网页和移动端的首发覆盖 Plus、Pro、Business、Enterprise、Edu;Enterprise 与 Edu 默认关闭,需管理员启用。Free 与 Go 不在首发范围,普通 Chat 不提供该模型。首发支持 Standard 和 Fast,Ultrafast 尚未开放。API 标准限额按 Tier 1 至 5 依次为 500/5,000/5,000/10,000/15,000 RPM,以及 500,000/1,000,000/2,000,000/4,000,000/40,000,000 TPM;实际访问和限额受账号、客户端与工作区设置影响。

Codex and ChatGPT Work availability

GPT-6.1 Sol

常见问题

API 模型标识是什么?

gpt-6.1-sol;工具调用需要使用 Responses API。

支持 none 思考档位吗?

不支持 none 或 minimal;支持 low、medium(默认)、high、xhigh 和 max。

输入超过 272K token 如何收费?

整次请求按长上下文费率计算,标准档每百万 token 输入 $4、缓存读 $0.20、缓存写 $5、输出 $15。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码