Claude Opus 5 相比 Opus 4.8 提升在哪里?价格涨了吗?
价格没涨。标准 API 价格维持在输入 $5、输出 $25 每百万 tokens,与前代 Opus 4.8 相同,延迟也保持在 Opus 档位。官方说法是智能水平已接近 Anthropic 当前最强的 Claude Fable 5,但价格与延迟没有跟着上移——这是这次升级最实际的一点。
Claude Opus 5
Claude Opus 5 是 Anthropic 于 2026-07-24 正式发布的 Opus 系列旗舰模型,官方 API 模型 ID 为 claude-opus-5,是 Claude Opus 4.8 的下一代产品,定位面向复杂智能体编码与企业工作。支持文本、图像输入和文本输出,上下文窗口 1M tokens,最大输出 128K tokens,支持自适应思考(effort 默认 high)。SWE-bench Verified 官方成绩为 96.0%,标准 API 价格维持输入 5 美元/输出 25 美元每百万 tokens,与前代 Opus 4.8 相同。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $5.00/ 1M | $25.00/ 1M |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $10.00/ 1M | $50.00/ 1M |
| 类型 | 有效期 | 写入 | 读取 |
|---|---|---|---|
| 文本 | 5m | $6.25/ 1M | $0.500/ 1M |
| 文本 | 1h | $10.00/ 1M | - |
Claude Opus 5 当前已收录的代表性评测结果包括 HLE(1 / 181,得分 64.70)、SWE-bench Verified(1 / 114,得分 96)、ARC-AGI(1 / 68,得分 97.50)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
Claude Opus 5 是 Anthropic 于 2026 年 7 月 24 日正式发布的 Opus 系列旗舰模型,官方 API 模型 ID 为 claude-opus-5(同时也是别名),AWS Bedrock ID 为 anthropic.claude-opus-5,Google Cloud ID 为 claude-opus-5。官方将其定位为“面向复杂智能体编码与企业工作”的模型,是 Claude Opus 4.8 的下一代产品:价格与延迟维持在 Opus 档位,但智能水平已接近 Anthropic 当前最强模型 Claude Fable 5。
Claude Opus 5 提供 1M token 上下文窗口,同步 Messages API 的最大输出长度为 128K tokens;通过 Message Batches API 并附加 output-300k-2026-03-24 beta header,输出上限可扩展至 300K tokens。官方文档给出的可靠知识截止时间为 2026 年 5 月,训练数据截止时间同为 2026 年 5 月。
Claude Opus 5 支持文本与图像输入、文本输出。思考机制与 Opus 4.8 一致:仅支持自适应思考(thinking: {type: 'adaptive'}),不支持手动设置固定 token 预算的旧式 extended thinking;未显式设置 thinking 字段时请求默认以非思考方式运行。推理深度由 effort 参数(low / medium / high / xhigh / max)控制,在 Claude API 与 Claude Code 上默认值均为 high。
根据 Anthropic 官方 System Card(2026-07-24)公布的评测结果,Claude Opus 5 在多项基准上较 Opus 4.8 有明显提升(除特别注明外,默认评测配置为自适应思考 + max 强度,5 次试验取平均):SWE-bench Verified 从 88.6% 提升到 96.0%;SWE-bench Pro(Public)从 69.2% 提升到 79.2%;SWE-bench Multilingual 达到 89.5%;BrowseComp 从 84.3% 提升到 90.8%;Humanity's Last Exam 无工具场景从 49.8% 提升到 56.3%,有工具场景从 57.9% 提升到 64.7%;ARC-AGI-2 从 72.1% 提升到 90.4%;ARC-AGI-1(xhigh 强度)达到 97.5%;GDPval-AA v2 从 1593 分提升到 1861 分;在新版 OSWorld 2.0 基准(与此前的 OSWorld-Verified 不可直接比较)上得分 70.57%。System Card 同时说明,Opus 5 在自动化行为审计中的不当行为倾向与误导用户倾向进一步下降,对协助高风险网络安全或生物相关请求的抵御能力也有提升。
Claude Opus 5 可通过 Claude API、Claude.ai(Max 计划默认模型,Pro 计划中最强模型)、Claude Code、Claude Cowork、Amazon Bedrock、Claude Platform on AWS、Google Cloud 与 Microsoft Foundry 访问。标准档 API 价格维持输入 5 美元/百万 tokens、输出 25 美元/百万 tokens,与 Opus 4.8 相同;官方另外提供 Fast Mode(在 Claude Platform 与 Claude Code 上可用),速度约为标准模式的 2.5 倍,价格为标准档的 2 倍(约输入 10 美元/百万 tokens、输出 50 美元/百万 tokens)。Claude Opus 5 未开源代码或权重,许可与商用条款按闭源专有模型处理。
价格没涨。标准 API 价格维持在输入 $5、输出 $25 每百万 tokens,与前代 Opus 4.8 相同,延迟也保持在 Opus 档位。官方说法是智能水平已接近 Anthropic 当前最强的 Claude Fable 5,但价格与延迟没有跟着上移——这是这次升级最实际的一点。
上下文窗口 1M tokens,同步 Messages API 的最大输出为 128K tokens。如果通过 Message Batches API 并附加 output-300k-2026-03-24 beta header,输出上限可扩展到 300K tokens。官方文档给出的可靠知识截止时间与训练数据截止时间都是 2026 年 5 月。
在 DataLearner 已收录的成绩里它拿了 8 个第一:SWE-bench Verified 96.0(114 个模型)、SWE-bench Multilingual 89.50(25 个)、ARC-AGI 97.50(68 个)、ARC-AGI-2 90.40(62 个)、ARC-AGI-3 30.20(9 个)、HLE 64.70 带工具(181 个)、WeirdML v2 91.59(52 个)、Text Arena Coding 1711.88(35 个),外加 OSWorld 2.0 70.57、GDPval-AA v2 1861 和 AA-Briefcase 1720 三项第一。SWE-Bench Pro(Public)79.20 排第 2,BrowseComp 90.80 排第 2。
有,而且集中在自动化流程上。AutomationBench 26 分在 8 个模型中排第 6,是它少见的中下游成绩。另外思考档位对结果影响很大:GPQA Diamond 在最高档能拿 93.88(226 个模型中第 9),切到 Low 档就掉到 87.88、第 62 位;Text Arena Coding 从最高档的 1711.88(第 1)掉到 High 档的 1668.82(第 3)。对精度敏感的任务不要下调 effort。
与 Opus 4.8 一致,仅支持自适应思考,通过 effort 参数控制,默认 high。不像部分模型那样提供显式的思考开关,实际控制手段是调整 effort 档位。
Anthropic 官方 API 是 claude-opus-5(同时也是别名),AWS Bedrock 是 anthropic.claude-opus-5,Google Cloud 是 claude-opus-5。支持文本与图像输入、文本输出,具备函数调用、工具使用、电脑操作和长上下文能力。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
