DataLearner 标志

GPT-5vsClaude Opus 4

在 12 个共同 benchmark 中,GPT-5 整体领先:GPT-5 领先 11 项,Claude Opus 4 领先 1 项,持平 0 项,平均分差 +16.28。

OpenAI
GPT-5

OpenAI · 2025-08-07 · 基础大模型

Anthropic
Claude Opus 4

Anthropic · 2025-05-23 · 推理大模型

GPT-511 (92%)(8%)1 Claude Opus 4

评测分数

按能力类目分组,每组内按分差大小排列;共 12 项。

General Knowledge

GPT-5 领先 4/4
评测项GPT-5Claude Opus 4分差
ARC-AGI65.7033 / 6835.7051 / 68+30
HLE35.2073 / 17210.70144 / 172+24.50
GPQA Diamond87.3040 / 18779.6085 / 187+7.70
ARC-AGI-29.9040 / 628.6042 / 62+1.30

Math and Reasoning

GPT-5 领先 4/4
评测项GPT-5Claude Opus 4分差
IMO-ProofBench592 / 162.9016 / 16+56.10
AIME202599.609 / 10775.5066 / 107+24.10
FrontierMath24.8015 / 604.5039 / 60+20.30
FrontierMath - Tier 412.5029 / 80Thinking High (No Tools)4.2040 / 80+8.30

Agent Level Benchmark

GPT-5 领先 2/2
评测项GPT-5Claude Opus 4分差
Aider-Polyglot881 / 59Thinking High (No Tools)70.7016 / 59Normal (No Tools)+17.30
τ²-Bench8015 / 4372.5023 / 43+7.50

Coding and Software Engineer

GPT-5 领先 1/1
评测项GPT-5Claude Opus 4分差
SWE-bench Verified72.8050 / 11272.5052 / 112+0.30

常识推理

Claude Opus 4 领先 1/1
评测项GPT-5Claude Opus 4分差
Simple Bench56.7020 / 63Thinking High (No Tools)58.8017 / 63Thinking (No Tools)-2.10

规格对比

字段GPT-5Claude Opus 4
发布机构OpenAIAnthropic
发布时间2025-08-072025-05-23
模型类型基础大模型推理大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度400K200K
最大输出128K32K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项GPT-5Claude Opus 4
文本输入$1.25 / 1M tokens$15 / 1M tokens
文本输出$10 / 1M tokens$75 / 1M tokens
缓存读取$0.125 / 1M tokens$1.5 / 1M tokens
缓存写入$0 / 1M tokens$18.75 / 1M tokens

小结

  • GPT-5在以下类目领先:General Knowledge (4/4)、Math and Reasoning (4/4)、Agent Level Benchmark (2/2)、Coding and Software Engineer (1/1)
  • Claude Opus 4在以下类目领先:常识推理 (1/1)

12 个共同 benchmark 上,GPT-5 平均高出 16.28 分。

单项差距最大的 benchmark:IMO-ProofBench — GPT-5 59,Claude Opus 4 2.90(分差 +56.10)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。