DataLearner 标志
CL

Claude Opus 5

推理大模型编程大模型Claude 5

Claude Opus 5

发布时间: 2026-07-24更新于: 2026-08-22 23:24:58.542知识截止: 2026-053,031
在线体验GitHubHugging FaceCompare
模型参数
未披露
上下文长度
1M
中文支持
支持
推理能力

Claude Opus 5 是 Anthropic 于 2026-07-24 正式发布的 Opus 系列旗舰模型,官方 API 模型 ID 为 claude-opus-5,是 Claude Opus 4.8 的下一代产品,定位面向复杂智能体编码与企业工作。支持文本、图像输入和文本输出,上下文窗口 1M tokens,最大输出 128K tokens,支持自适应思考(effort 默认 high)。SWE-bench Verified 官方成绩为 96.0%,标准 API 价格维持输入 5 美元/输出 25 美元每百万 tokens,与前代 Opus 4.8 相同。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Claude Opus 5

模型基本信息

推理过程
支持
思考模式
思考水平 · 高 (High) (默认)常规模式思考水平 · 低 (Low)思考水平 · 中 (Medium)思考水平 · 极高 (Extra-High)思考水平 · 最高 (Max)
上下文长度
1M tokens
最大输出长度
128K tokens
模型类型
推理大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-07-24
模型文件大小
暂无数据
MoE架构
总参数 / 激活参数
暂无数据 / 不涉及
知识截止
2026-05
Claude Opus 5

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无GitHub开源地址
Hugging Face
暂无开源HuggingFace地址
在线体验
Claude Opus 5

官方介绍与博客

DataLearnerAI博客
暂无介绍博客
Claude Opus 5

API接口信息

接口速度
3/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$5.00/ 1M$25.00/ 1M
快速模式
类型适用条件输入输出
文本-$10.00/ 1M$50.00/ 1M
缓存定价Prompt缓存
类型有效期写入读取
文本5m$6.25/ 1M$0.500/ 1M
文本1h$10.00/ 1M-
Claude Opus 5

评测结果

Claude Opus 5 当前已收录的代表性评测结果包括 HLE(1 / 181,得分 64.70)、SWE-bench Verified(1 / 114,得分 96)、ARC-AGI(1 / 68,得分 97.50)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

综合评估

共 5 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI
极高
97.50
1 / 68
ARC-AGI-2
最高
90.40
1 / 62
HLE
最高
56.30
12 / 181
HLE
最高工具
64.70
1 / 181
30.20
1 / 9

科学与综合推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
87.88
62 / 226
93.88
9 / 226

编程与软件工程

共 8 项评测
评测名称 / 模式
得分
排名/总数
1668.82
3 / 35
1711.88
1 / 35
SWE-bench Verified
最高工具
96
1 / 114
WeirdML v2
常规模式工具
86.34
4 / 52
WeirdML v2
工具
91.59
1 / 52
89.50
1 / 25
79.20
2 / 57
DeepSWE
最高工具
68.80
4 / 27

AI Agent - 信息收集

共 1 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
最高工具联网
90.80
2 / 54

AI Agent - 工具使用

共 3 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
极高工具
85.80
2 / 38
OSWorld 2.0
最高工具
70.57
1 / 4
AutomationBench
最高工具
26
6 / 8

生产力知识

共 2 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
最高工具
1861
1 / 13
AA-Briefcase
最高工具
1720
1 / 6

数学推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
85.61
5 / 34
73.17
4 / 34

和其他模型对比

Claude Opus 5

发布机构

Claude Opus 5

模型解读

Claude Opus 5 的定位与发布

Claude Opus 5 是 Anthropic 于 2026 年 7 月 24 日正式发布的 Opus 系列旗舰模型,官方 API 模型 ID 为 claude-opus-5(同时也是别名),AWS Bedrock ID 为 anthropic.claude-opus-5,Google Cloud ID 为 claude-opus-5。官方将其定位为“面向复杂智能体编码与企业工作”的模型,是 Claude Opus 4.8 的下一代产品:价格与延迟维持在 Opus 档位,但智能水平已接近 Anthropic 当前最强模型 Claude Fable 5。

上下文、输出长度与知识截止时间

Claude Opus 5 提供 1M token 上下文窗口,同步 Messages API 的最大输出长度为 128K tokens;通过 Message Batches API 并附加 output-300k-2026-03-24 beta header,输出上限可扩展至 300K tokens。官方文档给出的可靠知识截止时间为 2026 年 5 月,训练数据截止时间同为 2026 年 5 月。

模态能力与思考机制

Claude Opus 5 支持文本与图像输入、文本输出。思考机制与 Opus 4.8 一致:仅支持自适应思考(thinking: {type: 'adaptive'}),不支持手动设置固定 token 预算的旧式 extended thinking;未显式设置 thinking 字段时请求默认以非思考方式运行。推理深度由 effort 参数(low / medium / high / xhigh / max)控制,在 Claude API 与 Claude Code 上默认值均为 high。

相比 Opus 4.8 的能力变化

根据 Anthropic 官方 System Card(2026-07-24)公布的评测结果,Claude Opus 5 在多项基准上较 Opus 4.8 有明显提升(除特别注明外,默认评测配置为自适应思考 + max 强度,5 次试验取平均):SWE-bench Verified 从 88.6% 提升到 96.0%;SWE-bench Pro(Public)从 69.2% 提升到 79.2%;SWE-bench Multilingual 达到 89.5%;BrowseComp 从 84.3% 提升到 90.8%;Humanity's Last Exam 无工具场景从 49.8% 提升到 56.3%,有工具场景从 57.9% 提升到 64.7%;ARC-AGI-2 从 72.1% 提升到 90.4%;ARC-AGI-1(xhigh 强度)达到 97.5%;GDPval-AA v2 从 1593 分提升到 1861 分;在新版 OSWorld 2.0 基准(与此前的 OSWorld-Verified 不可直接比较)上得分 70.57%。System Card 同时说明,Opus 5 在自动化行为审计中的不当行为倾向与误导用户倾向进一步下降,对协助高风险网络安全或生物相关请求的抵御能力也有提升。

访问方式、价格与开放性

Claude Opus 5 可通过 Claude API、Claude.ai(Max 计划默认模型,Pro 计划中最强模型)、Claude Code、Claude Cowork、Amazon Bedrock、Claude Platform on AWS、Google Cloud 与 Microsoft Foundry 访问。标准档 API 价格维持输入 5 美元/百万 tokens、输出 25 美元/百万 tokens,与 Opus 4.8 相同;官方另外提供 Fast Mode(在 Claude Platform 与 Claude Code 上可用),速度约为标准模式的 2.5 倍,价格为标准档的 2 倍(约输入 10 美元/百万 tokens、输出 50 美元/百万 tokens)。Claude Opus 5 未开源代码或权重,许可与商用条款按闭源专有模型处理。

Claude Opus 5

常见问题

Claude Opus 5 相比 Opus 4.8 提升在哪里?价格涨了吗?

价格没涨。标准 API 价格维持在输入 $5、输出 $25 每百万 tokens,与前代 Opus 4.8 相同,延迟也保持在 Opus 档位。官方说法是智能水平已接近 Anthropic 当前最强的 Claude Fable 5,但价格与延迟没有跟着上移——这是这次升级最实际的一点。

Claude Opus 5 的上下文和最大输出是多少?

上下文窗口 1M tokens,同步 Messages API 的最大输出为 128K tokens。如果通过 Message Batches API 并附加 output-300k-2026-03-24 beta header,输出上限可扩展到 300K tokens。官方文档给出的可靠知识截止时间与训练数据截止时间都是 2026 年 5 月。

Claude Opus 5 到底有多强?拿过几个第一?

在 DataLearner 已收录的成绩里它拿了 8 个第一:SWE-bench Verified 96.0(114 个模型)、SWE-bench Multilingual 89.50(25 个)、ARC-AGI 97.50(68 个)、ARC-AGI-2 90.40(62 个)、ARC-AGI-3 30.20(9 个)、HLE 64.70 带工具(181 个)、WeirdML v2 91.59(52 个)、Text Arena Coding 1711.88(35 个),外加 OSWorld 2.0 70.57、GDPval-AA v2 1861 和 AA-Briefcase 1720 三项第一。SWE-Bench Pro(Public)79.20 排第 2,BrowseComp 90.80 排第 2。

Claude Opus 5 有短板吗?

有,而且集中在自动化流程上。AutomationBench 26 分在 8 个模型中排第 6,是它少见的中下游成绩。另外思考档位对结果影响很大:GPQA Diamond 在最高档能拿 93.88(226 个模型中第 9),切到 Low 档就掉到 87.88、第 62 位;Text Arena Coding 从最高档的 1711.88(第 1)掉到 High 档的 1668.82(第 3)。对精度敏感的任务不要下调 effort。

Claude Opus 5 的思考模式怎么配置?

与 Opus 4.8 一致,仅支持自适应思考,通过 effort 参数控制,默认 high。不像部分模型那样提供显式的思考开关,实际控制手段是调整 effort 档位。

Claude Opus 5 在各家云上的模型 ID 是什么?

Anthropic 官方 API 是 claude-opus-5(同时也是别名),AWS Bedrock 是 anthropic.claude-opus-5,Google Cloud 是 claude-opus-5。支持文本与图像输入、文本输出,具备函数调用、工具使用、电脑操作和长上下文能力。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码