DataLearner 标志
GP

GPT-5.2

聊天大模型GPTGPT-5.2

OpenAI GPT-5.2

发布时间: 2025-12-11更新于: 2026-07-17浏览量: 2,817
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
400K
多语言支持
支持
推理能力
4/5

GPT-5.2 是OpenAI于 2025-12-11 发布的聊天大模型。支持文本、图像输入和文本输出,上下文窗口为 400K,主要能力包括推理大模型、多语言。页面已收录官方资料、API 定价、公开评测,便于核对规格和使用成本。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

GPT-5.2

模型基本信息

推理过程
支持
思考模式
思考水平 · 极高 (Extra-High) (默认)思考水平 · 低 (Low)思考水平 · 中 (Medium)思考水平 · 高 (High)
上下文长度
400K tokens
最大输出长度
暂无数据
模型类型
聊天大模型
输入/输出模态
文本、图像 → 文本
发布时间
2025-12-11
模型文件大小
暂无数据
MoE架构
总参数 / 激活参数
暂无数据 / 不适用
知识截止
暂无数据
GPT-5.2

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
GPT-5.2

官方介绍与博客

DataLearnerAI博客
暂无
GPT-5.2

API接口信息

接口速度
3/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$1.75/ 1M tokens$14.00/ 1M tokens
批量模式
类型适用条件输入输出
文本-$0.875/ 1M tokens$7.00/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本5m$1.75/ 1M tokens$0.175/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

GPT-5.2

评测结果

GPT-5.2 当前已收录的代表性评测结果包括 AIME2025(1 / 216,得分 100)、MMMU(1 / 74,得分 85.90)、LiveCodeBench(14 / 251,得分 89.40)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力
并行模式

综合评估

共 24 项评测
评测名称 / 模式
得分
排名/总数
55.67
105 / 147
72.67
84 / 147
78.67
75 / 147
ARC-AGI-1
极高
86.17
64 / 147
ARC-AGI-1
深度
90.50
49 / 147
MMLU
极高
89.60
12 / 124
LiveBench
常规模式
48.91
96 / 117
65.33
53 / 117
71.84
30 / 117
74.63
16 / 117
9.72
95 / 136
26.67
83 / 136
43.33
69 / 136
ARC-AGI-2
极高
52.91
63 / 136
ARC-AGI-2
深度
54.20
60 / 136
HLE
常规模式
8
421 / 565
HLE
26.70
236 / 565
HLE
unknown
27.80
229 / 565
HLE
极高
37.70
147 / 565
HLE
极高
34.50
177 / 565
HLE
极高工具联网
45.50
82 / 565
CritPt
常规模式
0.60
169 / 201
7.90
85 / 201
CritPt
极高
11.60
66 / 201

科学与综合推理

共 6 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
73.23
299 / 463
82.70
199 / 463
87.88
121 / 463
88.19
117 / 463
90.30
82 / 463
93.20
33 / 463

编程与软件工程

共 13 项评测
评测名称 / 模式
得分
排名/总数
1394
30 / 35
1480
19 / 35
LiveCodeBench
常规模式
66.90
104 / 251
89.40
14 / 251
88.90
16 / 251
SWE-bench Verified
极高工具
80
17 / 116
74.60
2 / 8
WeirdML v2
常规模式工具
49.60
37 / 52
WeirdML v2
工具
49.60
37 / 52
WeirdML v2
工具
63.40
25 / 52
WeirdML v2
极高工具
72.20
16 / 52
55.60
30 / 62
GSO
工具
27.40
7 / 21

数学推理

共 16 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
常规模式
51
154 / 216
96.70
21 / 216
AIME2025
极高
100
1 / 216
AIME2025
极高工具
100
1 / 216
AIME 2026
工具
98.33
5 / 30
HMMT Feb 2026
工具
96.97
3 / 10
67.40
17 / 58
FrontierMath
极高工具
40.30
8 / 60
31.70
19 / 42
6.30
35 / 80
16.70
20 / 80
18.80
16 / 80
18.80
16 / 80
14.60
23 / 80
13.54
13 / 17

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1699.80
26 / 106

多模态理解

共 7 项评测
评测名称 / 模式
得分
排名/总数
MMMU
极高
85.90
1 / 74
MMMU
极高工具
80.40
18 / 74
VPCT
67
4 / 24
VPCT
极高
84
2 / 24
MMMU-Pro
常规模式
65.80
150 / 229
74.60
93 / 229
MMMU-Pro
思考模式
80.40
39 / 229

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
45.80
58 / 93

Agent能力评测

共 11 项评测
评测名称 / 模式
得分
排名/总数
352.25
3 / 22
τ²-Bench - Telecom
常规模式工具
46.50
178 / 264
74.30
127 / 264
89.69
67 / 264
84.80
90 / 264
τ²-Bench
极高工具
82
12 / 44
Terminal Bench Hard
常规模式工具
31.80
100 / 244
43.20
41 / 244
47
26 / 244
τ³-Banking
常规模式工具
11.10
130 / 167
τ³-Banking
工具
32.22
53 / 167

指令跟随

共 3 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
47.40
168 / 282
65.20
100 / 282
IF Bench
极高
75.40
34 / 282

AI Agent - 信息收集

共 2 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
极高工具联网
65.80
34 / 58
BrowseComp
极高工具
65.80
34 / 58

生产力知识

共 2 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA
工具
70.90
3 / 15
GDPval-AA
极高工具
61
4 / 15

长上下文能力

共 3 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
常规模式
45.70
145 / 171
70.30
101 / 171
AA-LCR
极高
82.70
20 / 171

AI Agent - 工具使用

共 1 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
极高工具
67.60
34 / 44

和其他模型对比

GPT-5.2

发布机构

OpenAI GPT-5.2

模型解读

OpenAI 于 2025 年 12 月发布 GPT-5.2,并同步在 ChatGPT 与 API 中上线该模型系列。GPT-5.2 属于 GPT-5 系列的最新迭代版本,延续了 Instant / Thinking / Pro 的多形态设计,并在上下文规模、推理配置与多项基准评测中给出了新的官方数据。


一、模型形态与接口命名

GPT-5.2 在 ChatGPT 与 API 中采用统一但区分形态的命名方式。

在 API 层面,GPT-5.2 提供以下主要模型标识:

  • gpt-5.2-chat-latest
  • gpt-5.2
  • gpt-5.2-pro

其中,gpt-5.2 与 gpt-5.2-pro 支持显式配置推理强度(reasoning effort),并包含比前一代更高的推理档位。OpenAI 未公开该推理档位对应的具体计算步数或内部参数。

截至发布时,OpenAI 未披露 GPT-5.2 的模型参数量、网络层数、宽度、MoE 结构或训练 token 数规模。


二、上下文窗口、输出上限与知识截止

根据 OpenAI API 官方规格页面,GPT-5.2 的核心输入输出限制如下:

GPT-5.2 支持 400,000 tokens 的上下文窗口,最大单次输出为 128,000 tokens

模型的知识截止时间为 2025 年 8 月 31 日

该规格适用于 gpt-5.2 与 gpt-5.2-pro。Instant / chat 版本在 ChatGPT 中使用相同的上下文上限,但具体输出长度受产品侧限制。


三、价格信息(与 GPT-5.1 对比)

在标准计费档位下,GPT-5.2 的 API 定价如下:

  • 输入:$1.75 / 1M tokens
  • 输出:$14.00 / 1M tokens
  • Cached input:约 $0.175 / 1M tokens

作为对比,GPT-5.1 的标准档位输入与输出单价均低于 GPT-5.2。GPT-5.2 是 GPT-5 系列中首次在官方价格表中体现出明确的代际单价变化。

GPT-5.2 同时提供 Flex 与 Priority 等计费档位,价格与吞吐、延迟配置相关,OpenAI 未在发布说明中给出统一数值。


四、专业知识工作评测(GDPval)

OpenAI 在发布材料中公布了 GPT-5.2 在其内部 GDPval(General Domain Professional Validation)评测上的结果。

该评测覆盖 44 类职业知识工作任务,包括分析、建模、跨文档推理与多约束决策。

在该评测中:

  • GPT-5.2 Thinking:70.9%(wins or ties)

这是 OpenAI 首次在该评测中给出“wins or ties”形式的汇总指标。


五、软件工程相关评测

在软件工程领域,OpenAI 公布了 GPT-5.2 在 SWE-Bench 系列评测中的结果:

  • SWE-Bench Pro:55.6%(GPT-5.2 Thinking)
  • SWE-Bench Verified:80.0%(GPT-5.2 Thinking)

SWE-Bench Pro 与 Verified 均要求模型在真实代码仓库中完成修改,并通过完整测试套件。


六、长上下文与多检索推理(MRCRv2)

在长上下文推理评测 MRCRv2 中,OpenAI 给出了 GPT-5.2 Thinking 的多段结果。

在 8-needle 设置下,不同上下文长度区间的官方数据包括:

  • 128K–256K tokens 区间:77.0%(GPT-5.2 Thinking)
  • 同一区间下,GPT-5.1 Thinking 为 29.6%

OpenAI 同时披露,在 4-needle、最高 256K tokens 的设置中,GPT-5.2 Thinking 的得分接近满分。


七、数学与科学类评测

在数学与科学推理评测中,OpenAI 公布了多项 GPT-5.2 的成绩:

在 AIME 2025(不使用工具)评测中:

  • GPT-5.2 Thinking:100%
  • GPT-5.2 Pro:100%

在 GPQA Diamond(博士级科学问答,不使用工具)中:

  • GPT-5.2 Thinking:92.4%
  • GPT-5.2 Pro:93.2%

在 FrontierMath Tier 1–3(允许 Python 工具)中:

  • GPT-5.2 Thinking:40.3%
  • GPT-5.1 Thinking:31.0%

八、抽象与通用推理评测(ARC-AGI-2)

在 ARC-AGI-2 Verified 评测中,OpenAI 公布的数据为:

  • GPT-5.2 Thinking:52.9%
  • GPT-5.2 Pro:54.2%
  • GPT-5.1 Thinking(high):17.6%

该评测强调跨规则迁移与抽象推理能力。


九、工具与多步任务评测

在工具使用与多步规划相关评测中,OpenAI 公布了以下 GPT-5.2 Thinking 成绩:

  • Tau2-bench(Telecom):98.7%
  • BrowseComp:65.8%
  • Scale MCP-Atlas:60.6%
  • Toolathlon:46.3%

对应的 GPT-5.1 Thinking 在上述评测中的得分均低于 GPT-5.2。


十、补充说明

截至发布时:

  • OpenAI 未公布 GPT-5.2 的训练数据规模、参数量或模型结构细节
  • 未给出 GPT-5.2 与 GPT-5.1 在相同推理强度下的完整逐项消融对比
  • 所有评测数据均来自 OpenAI 官方发布或其公开基准页面同步信息
GPT-5.2

常见问题

GPT-5.2 是什么模型?

GPT-5.2 是OpenAI于 2025-12-11 发布的聊天大模型。支持文本、图像输入和文本输出,上下文窗口为 400K,主要能力包括推理大模型、多语言。页面已收录官方资料、API 定价、公开评测,便于核对规格和使用成本。

GPT-5.2 支持哪些输入和输出模态?

当前官方资料记录其支持文本、图像输入,并生成文本输出。

GPT-5.2 的上下文窗口和最大输出是多少?

上下文窗口为 400K。未公开或无法确认的规格不做推测。

GPT-5.2 适合哪些任务?

根据已收录的官方能力标签,它适合推理大模型、多语言相关任务;实际效果应结合具体工作流验证。

GPT-5.2 是否提供 API,价格如何查看?

页面已收录 Facebook AI研究实验室 的 6 条定价规则。价格可能随地域、上下文档位、缓存和时间变化,应以页面价格表及官方计费页为准。

GPT-5.2 是否开源?

代码与模型权重按 不开源 记录;使用前仍应核对官方许可原文。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码