GPT-6 Sol 与 Claude Opus 5.5 都在 2026 年 9 月 22 日发布。前者是 OpenAI GPT-6 家族的均衡档,后者是 Anthropic 面向复杂编程与知识工作的 Opus 系列新型号。它们适合放在同一份采购候选清单里,但公开评测的运行环境、推理档位与工具配置并不完全相同。
目前能比较的成绩
这三行只是目前站内两款模型都有的成绩,不能把它们相加或平均成一个综合分。Opus 5.5 另有 Terminal-Bench 4.0 的 66.4%、CursorBench 4.0 的 57.8%、Terminal-Bench-Science 0.1 的 58.7% 与 Chartography 的 89.0%;Sol 另有 Agents' Last Exam V1 的 56.4% 和 DeepSWE v1.1 的 68.8%。缺少另一方同口径成绩时,这些数字只能说明各自已公开的覆盖范围。
Anthropic 官方发布页还给出 Opus 5.5 在 FrontierCode 默认 medium 档的 54.6%,以及 CursorBench 默认 medium 档的 52.5%。它们与 max 档是不同运行方式,不能混为同一条结果。Anthropic 与 Artificial Analysis 公布了 GDPval-AA v2.1 的 1846 Elo;站内目前的 GDPval-AA 条目仍标为 v2,因此此处只保留来源说明,不将 v2.1 数字写进旧榜单。
价格与规格
标准输入与输出单价上,Sol 都是 Opus 5.5 的一半;缓存读取标价相同。实际任务成本还取决于推理时生成的 token、缓存命中、工具调用与完成任务所需的轮数,不能只用每 token 单价判断。超过 Sol 长上下文计费阈值的请求也会按更高费率收取,长文档批处理应先按真实输入长度估算。
怎么选
如果工作流对费用敏感、需要大量反复调用,可先以 GPT-6 Sol 为基线,在真实任务集上记录成功率、耗时和总成本。如果任务主要是复杂的终端操作、多文件编程或知识工作,Opus 5.5 值得并行试跑;其公开的多项智能体成绩较强,但最终仍要看你的工具链和失败重试成本。无论选哪款,都应固定提示词、工具权限、推理档位与样本后再比较。
来源:OpenAI 官方发布页;Anthropic 官方发布页;Artificial Analysis GDPval-AA v2.1。数据按 2026 年 9 月 23 日可公开核对的成绩整理。

