DataLearner 标志

GPT-5.6 SolvsClaude Opus 4.8

在 13 个共同 benchmark 中,GPT-5.6 Sol 整体领先:GPT-5.6 Sol 领先 10 项,Claude Opus 4.8 领先 3 项,持平 0 项,平均分差 +23.04。

OpenAI
GPT-5.6 Sol

OpenAI · 2026-06-26 · 推理大模型

Anthropic
Claude Opus 4.8

Anthropic · 2026-05-28 · 推理大模型

GPT-5.6 Sol10 (77%)(23%)3 Claude Opus 4.8

评测分数

按能力类目分组,每组内按分差大小排列;共 13 项。

Coding and Software Engineer

GPT-5.6 Sol 领先 3/4
评测项GPT-5.6 SolClaude Opus 4.8分差
Text Arena (Coding)1,6204 / 35极高强度思考(无工具)1,5459 / 35Normal (No Tools)+75.22
WeirdML v288.762 / 52Thinking High (With Tools)70.4518 / 52Normal (With Tools)+18.31
DeepSWE72.701 / 32极高强度思考(工具)5917 / 32Deep Thinking (With Tools)+13.70
SWE-Bench Pro - Public64.608 / 59极高强度思考(工具)69.204 / 59Extended (with tools)-4.60

AI Agent - Tool Usage

GPT-5.6 Sol 领先 3/3
评测项GPT-5.6 SolClaude Opus 4.8分差
Terminal-Bench 4.037.275 / 11Max (With Tools)23.646 / 11Max (With Tools)+13.63
Terminal-Bench-Science 0.122.403 / 10Max (With Tools)10.505 / 10Max (With Tools)+11.90
Terminal-Bench 2.188.801 / 47最高(无工具)78.9023 / 47Thinking High (With Tools)+9.90

Math and Reasoning

GPT-5.6 Sol 领先 2/2
评测项GPT-5.6 SolClaude Opus 4.8分差
FrontierMath Tier 4 v282.932 / 40最高(无工具)56.109 / 40最高(无工具)+26.83
FrontierMath v289.121 / 58最高(无工具)809 / 58最高(无工具)+9.12

General Knowledge

Claude Opus 4.8 领先 1/1
评测项GPT-5.6 SolClaude Opus 4.8分差
HLE49.5038 / 188最高(无工具)57.9010 / 188Extended (with tools)-8.40

Text Embedding

GPT-5.6 Sol 领先 1/1
评测项GPT-5.6 SolClaude Opus 4.8分差
Context Arena97.632 / 126最高(无工具)90.0415 / 126最高(无工具)+7.59

Writing and Creative Capabilities

GPT-5.6 Sol 领先 1/1
评测项GPT-5.6 SolClaude Opus 4.8分差
Creative Writing1,9644 / 99Normal (No Tools)1,83513 / 99Normal (No Tools)+128.80

科学与综合推理

Claude Opus 4.8 领先 1/1
评测项GPT-5.6 SolClaude Opus 4.8分差
GPQA Diamond82.83121 / 270Normal (No Tools)85.3596 / 270Normal (No Tools)-2.53

规格对比

字段GPT-5.6 SolClaude Opus 4.8
发布机构OpenAIAnthropic
发布时间2026-06-262026-05-28
模型类型推理大模型推理大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度1.05M1M
最大输出128K125K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项GPT-5.6 SolClaude Opus 4.8
文本输入$4 / 1M tokens$5 / 1M tokens
文本输出$20 / 1M tokens$25 / 1M tokens
缓存读取$0.4 / 1M tokens$0.5 / 1M tokens
缓存写入$5 / 1M tokens$6.25 / 1M tokens

小结

  • GPT-5.6 Sol在以下类目领先:Coding and Software Engineer (3/4)、AI Agent - Tool Usage (3/3)、Math and Reasoning (2/2)、Text Embedding (1/1)、Writing and Creative Capabilities (1/1)
  • Claude Opus 4.8在以下类目领先:General Knowledge (1/1)、科学与综合推理 (1/1)

13 个共同 benchmark 上,GPT-5.6 Sol 平均高出 23.04 分。

单项差距最大的 benchmark:Creative Writing — GPT-5.6 Sol 1,964,Claude Opus 4.8 1,835(分差 +128.80)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。