GPT-5.3 CodexvsGPT-5.2-Codex
在 8 个共同 benchmark 中,GPT-5.3 Codex 整体领先:GPT-5.3 Codex 领先 6 项,GPT-5.2-Codex 领先 2 项,持平 0 项,平均分差 +3.43。
GPT-5.3 Codex
OpenAI · 2026-02-05 · 编程大模型
GPT-5.2-Codex
OpenAI · 2025-12-18 · 编程大模型
GPT-5.3 Codex6 项(75%)(25%)2 项GPT-5.2-Codex
评测分数
按能力类目分组,每组内按分差大小排列;共 8 项。
Agent Level Benchmark
胶着 2/2| 评测项 | GPT-5.3 Codex | GPT-5.2-Codex | 分差 |
|---|---|---|---|
| Terminal Bench Hard | 5317 / 244Extra-High (With Tools) | 37.1065 / 244Extra-High (With Tools) | +15.90 |
| τ²-Bench - Telecom | 8685 / 264Extra-High (With Tools) | 92.1054 / 264Extra-High (With Tools) | -6.10 |
General Knowledge
GPT-5.3 Codex 领先 2/2| 评测项 | GPT-5.3 Codex | GPT-5.2-Codex | 分差 |
|---|---|---|---|
| CritPt | 16.9047 / 200Extra-High (No Tools) | 8.7078 / 200Extra-High (No Tools) | +8.20 |
| HLE | 42.50109 / 563Extra-High (No Tools) · Text only | 35.70164 / 563Extra-High (No Tools) · Text only | +6.80 |
Instruction Following
GPT-5.2-Codex 领先 1/1| 评测项 | GPT-5.3 Codex | GPT-5.2-Codex | 分差 |
|---|---|---|---|
| IF Bench | 75.4034 / 282Extra-High (No Tools) | 77.6016 / 282Extra-High (No Tools) | -2.20 |
Long Context
GPT-5.3 Codex 领先 1/1| 评测项 | GPT-5.3 Codex | GPT-5.2-Codex | 分差 |
|---|---|---|---|
| AA-LCR | 83.3011 / 170Extra-High (No Tools) | 82.3020 / 170Extra-High (No Tools) | +1 |
Multimodal Understanding
GPT-5.3 Codex 领先 1/1| 评测项 | GPT-5.3 Codex | GPT-5.2-Codex | 分差 |
|---|---|---|---|
| MMMU-Pro | 78.5059 / 227Extra-High (No Tools) | 76.3074 / 226Extra-High (No Tools) | +2.20 |
科学与综合推理
GPT-5.3 Codex 领先 1/1| 评测项 | GPT-5.3 Codex | GPT-5.2-Codex | 分差 |
|---|---|---|---|
| GPQA Diamond | 91.5061 / 462Extra-High (No Tools) | 89.9086 / 462Extra-High (No Tools) | +1.60 |
规格对比
| 字段 | GPT-5.3 Codex | GPT-5.2-Codex |
|---|---|---|
| 发布机构 | OpenAI | OpenAI |
| 发布时间 | 2026-02-05 | 2025-12-18 |
| 模型类型 | 编程大模型 | 编程大模型 |
| 架构 | 稠密模型 | 稠密模型 |
| 参数规模 | 暂无数据 | 暂无数据 |
| 上下文长度 | 400K | 暂无数据 |
| 最大输出 | 125K | 暂无数据 |
API 调用价格
价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。
| 价格项 | GPT-5.3 Codex | GPT-5.2-Codex |
|---|---|---|
| 文本输入 | $1.75 / 1M tokens | $1.25 / 1M tokens |
| 文本输出 | $14 / 1M tokens | $10 / 1M tokens |
| 缓存读取 | $0.175 / 1M tokens | $0.125 / 1M tokens |
| 缓存写入 | 暂无公开价格 | $0 / 1M tokens |
小结
- GPT-5.3 Codex在以下类目领先:General Knowledge (2/2)、Long Context (1/1)、Multimodal Understanding (1/1)、科学与综合推理 (1/1)
- GPT-5.2-Codex在以下类目领先:Instruction Following (1/1)
- 胶着类目:Agent Level Benchmark
8 个共同 benchmark 上,GPT-5.3 Codex 平均高出 3.43 分。
单项差距最大的 benchmark:Terminal Bench Hard — GPT-5.3 Codex 53,GPT-5.2-Codex 37.10(分差 +15.90)。
本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。