Claude Fable 5 与 Claude Fable 5.1 都是 Anthropic 面向「高难推理 + 长周期智能体工作」的普遍可用旗舰,相隔不到三个月发布(2026 年 6 月 9 日与 9 月 1 日)。两代规格、价格、模态、思考机制几乎完全一致,参数量都未公开,因此这次升级的全部含义都写在评测数据里。
一句话结论
Fable 5.1 是一次以「长程智能体任务」为核心的升级。 双方共有的 5 项 0–100 量表评测它全部赢下、平均分高 10.2 分,但增益高度集中:终端与科研智能体任务大幅跃升,知识密集型考试和编程 Agent 评测只是小步前进;价格没有任何变化,因此在这两个方向上没有理由继续留在 Fable 5。
两代共有的评测
前五项都是 0–100 量表,Fable 5 平均 51.5、Fable 5.1 平均 61.7,差 10.2 分。但这个平均分几乎完全由 Terminal-Bench-Science 一项撑起来——扣掉它,两代差距只剩 5.0 分。GDPval-AA v2 是 Elo 式评分而非百分制,因此不计入平均,只作趋势参考。
Fable 5.1 另有一项 Fable 5 尚无对应成绩的记录:HLE 带工具 65.0。它与无工具的 60.9 之间 4.1 分的差距,本身就说明 5.1 这一代的增益更多来自「会用工具」而不是「记得更多」。
升级最明显的地方:终端与科研智能体
Terminal-Bench-Science 0.1 是斯坦福研究者与 Terminal-Bench 团队发布的科研智能体评测,70 个由领域专家设计的终端任务,覆盖生命科学、物理、地球科学、数学与工程。Fable 5 在这一项只有 21.4,Fable 5.1 到 52.6,接近翻 1.5 倍——这类任务要求模型在几十上百步里持续保持目标、正确使用工具、从失败中恢复,是最能体现「长程自主执行」能力的一类基准。
Terminal-Bench 4.0(66 个容器化专业计算机任务)从 44.55 到 55.8,方向一致。如果你的用法是让模型在终端里连续跑几十分钟、自己决定下一步做什么,这两项就是这次升级的全部理由。
提升有限的地方:知识与编程 Agent
HLE 无工具从 59.0 到 60.9,只有 1.9 分。HLE 是覆盖数学、人文与自然科学的 2,500 题高难考试,衡量的是模型自身的知识与推理上限。这个几乎持平的结果说明 5.1 并不是一次基座能力的大跨越。
CursorBench 3.2(Cursor 基于真实工程工作设计的编程 Agent 评测)从 70.5 到 73.4,+2.9。日常写代码、改代码的体验差异,会比 Terminal-Bench 上的数字看起来小得多。
规格、价格与运行约束
价格档位没变,唯一的成本变化在提示词缓存读取:从每百万 token 1 美元降到 0.25 美元。对反复复用同一份长上下文的智能体循环,这是实打实的四分之一成本。
两代都有相同的运行约束需要提前知道:自适应思考始终开启,不接受 thinking: {"type": "disabled"},只能用 effort 参数控制深度;原始思维链永不返回。安全侧两代都带会主动拒答的分类器,网络安全与生物化学方向的高风险请求会回退到 Opus 系列模型;两代都被列为强制 30 天数据留存的 Covered Model,Fable 5.1 对满足 Enterprise Frontier Safeguards 条件的企业提供客户自控云存储与相应的零留存安排。
怎么选
直接升级到 Fable 5.1,如果你:
- 让模型在终端、科研或运维环境里做长程自主执行
- 需要 2026 年 6 月的知识截止,而不是 1 月
- 大量复用长上下文,能吃到缓存读取降价
留在 Fable 5 意义不大:价格、上下文、模态、思考机制完全相同,没有任何一项评测是 Fable 5 更强。唯一值得停一下的情形,是你的系统已经对 Fable 5 的拒答行为和回退链路做过针对性适配,需要重新验证一遍再切。
两者都不一定是最优解:Fable 5 系列的定价是 Claude Opus 5 的两倍(输入 10 对 5、输出 50 对 25)。如果你的负载是常规的智能体编码而不是最硬的长程任务,值得先看 Fable 5.1、Fable 5、Opus 5 与 GPT-5.6 Sol 的四方对比 再决定。
数据说明:评测分数来自 DataLearner 当前收录的官方发布结果,并按各模型已有的最高强度工具模式展示。不同基准的任务、工具、脚手架与推理强度并不完全一致;缺少某项成绩只表示站内尚未收录,不能直接推断模型不具备该能力。
