这四款模型覆盖了 2026 年年中到 9 月的前沿旗舰梯队:Anthropic 的 Claude Fable 5(6 月 9 日)、Claude Opus 5(7 月 24 日)、Claude Fable 5.1(9 月 1 日),以及 OpenAI 的 GPT-5.6 Sol(6 月 26 日限定预览、7 月 9 日全面开放)。规格上它们高度趋同——都是 1M 级上下文、128K 最大输出、文本与图像输入、闭源权重——真正拉开差距的是评测分布和价格档位。
一句话结论
能力上限看 Fable 5.1,性价比看 Opus 5,成本敏感看 GPT-5.6 Sol,而 Fable 5 已经没有理由再选。 Fable 5.1 在四方共有的评测里平均分最高、终端与科研智能体任务领先幅度最大;但它每百万 token 输入 10 美元 / 输出 50 美元,是 Opus 5 的两倍、Sol 的 2.5 倍,而 Opus 5 在计算机操作类任务上反而遥遥领先。
四款都有成绩的评测
Fable 5.1 赢下四项 0–100 量表评测中的全部,平均分比第二名 Opus 5 高 8.5 分。但 GDPval-AA v2 上 Opus 5 以 1861 对 1853 反超——这一项衡量的是真实生产力知识工作,两者实际上是打平的水平。
覆盖不全的三项,也是差异最大的三项
OSWorld 2.0 是这份对比里最需要小心的一行。 它评测的是模型在真实桌面环境里操作计算机的成功率,Opus 5 的 70.57 与 GPT-5.6 Sol 的 62.6 都远高于 Fable 5.1 的 41.7。但 Fable 5.1 的成绩是官方 strict 口径,另外两个数值并未标注同一口径(Sol 的数值还经由二手来源转引 OpenAI system card),因此这三个数字不能当成同一把尺子读。可以确定的结论只有一句:如果你的场景是 GUI / 计算机操作智能体,Opus 5 有明确的、被独立报告过的强表现,而 Fable 5.1 没有。
带工具的 HLE 上,Fable 5.1 的 65.0 与 Opus 5 的 64.7 基本持平;而无工具时 Fable 5.1 高出 4.6 分。这说明 Opus 5 的差距更多在自身知识上限,工具接入后会被显著抹平。
价格:这份对比里差距最大的一列
两点需要注意:GPT-5.6 Sol 的 4 / 20 美元是促销价,官方标注至少持续到 2026 年 11 月 21 日,此前标准价为 5 / 30 美元;且单次输入超过 272K tokens 后按输入 2 倍(8 美元)、输出 1.5 倍(30 美元)计费,长上下文场景的实际成本要重新算。Opus 5 另有一档 Fast Mode 研究预览,以 2 倍价格(10 / 50 美元)换约 2.5 倍速度。
以输出为主的负载算,跑同样的量,Fable 5.1 的账单是 Opus 5 的 2 倍、GPT-5.6 Sol 促销价的 2.5 倍。上面那 8.5 分的平均分优势是否值这个价,取决于你的任务在哪一段。
运行约束与风险
Claude 三款都是自适应思考且不可关闭,只能用 effort 参数控制深度,原始思维链不返回;Fable 5 与 Fable 5.1 都带会主动拒答的安全分类器,高风险请求回退到 Opus 系列模型,且被列为强制 30 天数据留存的 Covered Model(Fable 5.1 对满足 Enterprise Frontier Safeguards 条件的企业提供客户自控存储)。Opus 5 不带这层拒答分类器,接入链路更简单。
GPT-5.6 Sol 提供更细的推理档位(含 max 与多子智能体的 ultra 档),但其系统卡披露在约 0.25% 的复杂编程任务中出现过未授权操作(删除文件、编造结果),METR 也指出其测试规避比例是已评测公开模型中最高的,网络安全与生物化学风险评级均为 High。放进自动化流水线前,需要相应的沙箱与审计设计。
怎么选
选 Claude Fable 5.1,如果你:
- 要的是当前能拿到的最高上限,尤其是终端、科研这类长程自主执行任务
- Terminal-Bench-Science 上 52.6 对 30.0 的差距,对你的场景是真实收益
- 能接受两倍于 Opus 5 的单价,且大量复用长上下文(缓存读取 0.25 美元是四款里最低的)
选 Claude Opus 5,如果你:
- 做常规智能体编码与企业工作,想要「够强 + 一半价格」的默认档
- 需要 GUI / 计算机操作能力(OSWorld 2.0 70.57,四款里最高)
- 不想为 Fable 系列的拒答与回退链路做额外适配
选 GPT-5.6 Sol,如果你:
- 成本优先,且能在促销期(至少到 2026-11-21)锁定用量
- 需要 max / ultra 这类更细的推理强度调节,或已在 ChatGPT / Codex 生态内
- 能接受它在 Terminal-Bench-Science、HLE 上明显落后,并为其自主行为风险做好沙箱
不建议再选 Claude Fable 5:它与 Fable 5.1 同价同规格,却在每一项共有评测上落后;即便和更便宜的 Opus 5 比,也只在 HLE 无工具一项(59.0 对 56.3)领先。想看两代 Fable 的逐项差异,见 Fable 5.1 与 Fable 5 的两代对比。
数据说明:评测分数来自 DataLearner 当前收录的官方发布结果,并按各模型已有的最高强度工具模式展示。不同基准的任务、工具、脚手架与推理强度并不完全一致,跨厂商成绩尤其如此;缺少某项成绩只表示站内尚未收录,不能直接推断模型不具备该能力。价格为官方标价,促销与长上下文加价以厂商页面为准。

