DataLearner 标志
CL

Claude Opus 4

已下架 · 2026-06-15推理大模型OpusClaude 4

Claude Opus 4

发布时间: 2025-05-23更新于: 2026-09-04退役: 2026-06-15浏览量: 1,799
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
200K
多语言支持
支持
推理能力
4/5

Claude Opus 4 是由 Anthropic 发布的 AI 模型,发布时间为 2025-05-23,定位为 推理大模型,上下文长度为 200K,采用 不开源 许可,在 Creative Writing 上取得 1576.80 分。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Claude Opus 4

模型基本信息

推理过程
支持
思考模式
不支持思考模式
上下文长度
200K tokens
最大输出长度
32K tokens
模型类型
推理大模型
输入/输出模态
文本、图像 → 文本
发布时间
2025-05-23
模型文件大小
暂无数据
MoE架构
总参数 / 激活参数
暂无数据 / 不适用
知识截止
暂无数据
Claude Opus 4

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
Claude Opus 4

官方介绍与博客

Claude Opus 4

API接口信息

接口速度
3/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$15.00/ 1M tokens$75.00/ 1M tokens
图像-$15.00/ 1M tokens
批量模式
类型适用条件输入输出
文本-$7.50/ 1M tokens$37.50/ 1M tokens
图像-$7.50/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-$18.75/ 1M tokens$1.50/ 1M tokens
文本-$18.75/ 1M tokens
缓存状态 = write
文本-$1.50/ 1M tokens
缓存状态 = hit
图像-$18.75/ 1M tokens
缓存状态 = write
图像-$1.50/ 1M tokens
缓存状态 = hit

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Claude Opus 4

评测结果

Claude Opus 4 当前已收录的代表性评测结果包括 MATH-500(3 / 45,得分 98.20)、MMLU Pro(28 / 176,得分 85)、Aider-Polyglot(13 / 59,得分 72)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

综合评估

共 7 项评测
评测名称 / 模式
得分
排名/总数
MMLU Pro
常规模式
85
28 / 176
ARC-AGI-1
常规模式
35.67
119 / 147
HLE
常规模式
10.70
383 / 563
HLE
常规模式
6.20
457 / 563
HLE
思考模式
12.30
363 / 563
HLE
思考模式
10.72
382 / 563
ARC-AGI-2
常规模式
8.61
96 / 136

科学与综合推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
79.60
241 / 462
GPQA Diamond
思考模式
79.60
241 / 462

编程与软件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式
72.50
53 / 116
LiveCodeBench
常规模式
56.60
143 / 250
LiveCodeBench
思考模式
63.60
121 / 250

数学推理

共 11 项评测
评测名称 / 模式
得分
排名/总数
MATH-500
常规模式
98.20
3 / 45
AIME 2024
常规模式
76
35 / 62
AIME2025
常规模式
75.50
106 / 215
AIME2025
思考模式
73.30
112 / 215
FrontierMath
常规模式
4.50
39 / 60
FrontierMath
思考模式
4.10
41 / 60
0
72 / 80
4.20
40 / 80
4.20
40 / 80
IMO-ProofBench
思考模式
2.90
16 / 16
2.90
24 / 24

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1576.80
41 / 106

多模态理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
MMMU
unknown
76.50
28 / 74

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
思考模式
58.80
36 / 93

Agent能力评测

共 5 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
思考模式工具
73.40
129 / 264
τ²-Bench
思考模式工具
72.50
24 / 44
Aider-Polyglot
常规模式
70.70
16 / 59
72
13 / 59
Terminal Bench Hard
思考模式工具
31.10
105 / 244

指令跟随

共 2 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
43.30
191 / 282
IF Bench
思考模式
53.70
142 / 282
Claude Opus 4

发布机构

Claude Opus 4

模型解读

Anthropic 近日推出了 Claude Opus 4,这是其迄今为止最智能的模型,旨在推动编码、代理搜索和创意写作领域的界限。作为 Claude 模型家族中的旗舰产品,Opus 4 代表了人工智能在复杂推理和自主工作方面的显著进步。

核心能力与应用场景

Claude Opus 4 被设计为一种混合推理模型,能够提供即时响应,也能进行分步思考,并通过用户友好的摘要展示其推理过程。对于 API 用户,该模型提供了对思考预算的精细控制,以优化成本和性能。其主要应用场景包括:

关键特性与性能

Claude Opus 4 在多项基准测试中取得了业界领先的成果,包括编码方面的 SWE-bench,以及 MMLU、GPQA 和 Aider Polyglot。它还以卓越的写作能力超越了之前的 Claude 模型,为自然、类人散文设定了新标准。该模型拥有一个 200K 的上下文窗口。Anthropic 还特别提到,Opus 4 使得在后台运行 Claude Code 成为可能,允许开发者分配长时间运行的编码任务,由 Opus 独立处理。

可用性与定价

Claude Opus 4 面向需要与 Anthropic 最强大模型协作处理复杂任务的商业用户和消费者,可通过 Claude for Pro、Max、Team 和 Enterprise 用户获得。对于有兴趣构建需要前沿智能的 AI 解决方案的开发者,Claude Opus 4 可通过 Anthropic API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 访问。定价方面,Claude Opus 4 的输入 token 价格为每百万美元 15 美元,输出 token 价格为每百万美元 75 美元,通过即时缓存可节省高达 90% 的成本,通过批量处理可节省 50% 的成本。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码