DataLearner 标志

GPT-5.3 CodexvsGPT-5.2-Codex

在 8 个共同 benchmark 中,GPT-5.3 Codex 整体领先:GPT-5.3 Codex 领先 6 项,GPT-5.2-Codex 领先 2 项,持平 0 项,平均分差 +3.43。

OpenAI
GPT-5.3 Codex

OpenAI · 2026-02-05 · 编程大模型

OpenAI
GPT-5.2-Codex

OpenAI · 2025-12-18 · 编程大模型

GPT-5.3 Codex6 (75%)(25%)2 GPT-5.2-Codex

评测分数

按能力类目分组,每组内按分差大小排列;共 8 项。

Agent Level Benchmark

胶着 2/2
评测项GPT-5.3 CodexGPT-5.2-Codex分差
Terminal Bench Hard5317 / 244Extra-High (With Tools)37.1065 / 244Extra-High (With Tools)+15.90
τ²-Bench - Telecom8685 / 264Extra-High (With Tools)92.1054 / 264Extra-High (With Tools)-6.10

General Knowledge

GPT-5.3 Codex 领先 2/2
评测项GPT-5.3 CodexGPT-5.2-Codex分差
CritPt16.9047 / 200Extra-High (No Tools)8.7078 / 200Extra-High (No Tools)+8.20
HLE42.50109 / 563Extra-High (No Tools) · Text only35.70164 / 563Extra-High (No Tools) · Text only+6.80

Instruction Following

GPT-5.2-Codex 领先 1/1
评测项GPT-5.3 CodexGPT-5.2-Codex分差
IF Bench75.4034 / 282Extra-High (No Tools)77.6016 / 282Extra-High (No Tools)-2.20

Long Context

GPT-5.3 Codex 领先 1/1
评测项GPT-5.3 CodexGPT-5.2-Codex分差
AA-LCR83.3011 / 170Extra-High (No Tools)82.3020 / 170Extra-High (No Tools)+1

Multimodal Understanding

GPT-5.3 Codex 领先 1/1
评测项GPT-5.3 CodexGPT-5.2-Codex分差
MMMU-Pro78.5059 / 227Extra-High (No Tools)76.3074 / 226Extra-High (No Tools)+2.20

科学与综合推理

GPT-5.3 Codex 领先 1/1
评测项GPT-5.3 CodexGPT-5.2-Codex分差
GPQA Diamond91.5061 / 462Extra-High (No Tools)89.9086 / 462Extra-High (No Tools)+1.60

规格对比

字段GPT-5.3 CodexGPT-5.2-Codex
发布机构OpenAIOpenAI
发布时间2026-02-052025-12-18
模型类型编程大模型编程大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度400K暂无数据
最大输出125K暂无数据

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项GPT-5.3 CodexGPT-5.2-Codex
文本输入$1.75 / 1M tokens$1.25 / 1M tokens
文本输出$14 / 1M tokens$10 / 1M tokens
缓存读取$0.175 / 1M tokens$0.125 / 1M tokens
缓存写入暂无公开价格$0 / 1M tokens

小结

  • GPT-5.3 Codex在以下类目领先:General Knowledge (2/2)、Long Context (1/1)、Multimodal Understanding (1/1)、科学与综合推理 (1/1)
  • GPT-5.2-Codex在以下类目领先:Instruction Following (1/1)
  • 胶着类目:Agent Level Benchmark

8 个共同 benchmark 上,GPT-5.3 Codex 平均高出 3.43 分。

单项差距最大的 benchmark:Terminal Bench Hard — GPT-5.3 Codex 53,GPT-5.2-Codex 37.10(分差 +15.90)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。