DataLearner 标志
GP

GPT-5.1

推理大模型GPTGPT-5.1

GPT-5.1

发布时间: 2025-11-12更新于: 2026-06-15浏览量: 1,043
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
400K
多语言支持
支持
推理能力
4/5

GPT-5.1 是由 OpenAI 发布的 AI 模型,发布时间为 2025-11-12,定位为 推理大模型,上下文长度为 400K,采用 不开源 许可,在 Text Arena (Coding) 上取得 1387.00 分。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

GPT-5.1

模型基本信息

推理过程
支持
思考模式
常规模式 (默认)思考模式
上下文长度
400K tokens
最大输出长度
128K tokens
模型类型
推理大模型
输入/输出模态
文本、图像 → 文本
发布时间
2025-11-12
模型文件大小
暂无数据
MoE架构
总参数 / 激活参数
暂无数据 / 不适用
知识截止
暂无数据
GPT-5.1

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
GPT-5.1

官方介绍与博客

GPT-5.1

API接口信息

接口速度
3/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$1.25/ 1M tokens$10.00/ 1M tokens
图像-$1.25/ 1M tokens
批量模式
类型适用条件输入输出
文本-$0.625/ 1M tokens$5.00/ 1M tokens
图像-$0.625/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-$0.0000/ 1M tokens
缓存状态 = write
文本-$0.0000/ 1M tokens$0.125/ 1M tokens
文本-$0.125/ 1M tokens
缓存状态 = hit
图像-$0.0000/ 1M tokens
缓存状态 = write
图像-$0.125/ 1M tokens
缓存状态 = hit

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

GPT-5.1

评测结果

GPT-5.1 当前已收录的代表性评测结果包括 MMMU(2 / 74,得分 85.40)、LiveCodeBench(24 / 251,得分 86.80)、Terminal Bench Hard(33 / 244,得分 45.50)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

综合评估

共 16 项评测
评测名称 / 模式
得分
排名/总数
33.20
122 / 147
57.70
99 / 147
72.83
83 / 147
LiveBench
常规模式
42.65
108 / 117
59.95
73 / 117
69.17
40 / 117
72.04
29 / 117
HLE
常规模式
5.30
473 / 565
HLE
思考模式
26.50
239 / 565
HLE
28.50
220 / 565
HLE
25.70
243 / 565
HLE
工具联网
42.70
107 / 565
1.90
121 / 136
6.50
99 / 136
17.64
87 / 136
4.90
99 / 201

科学与综合推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
64.30
362 / 463
GPQA Diamond
思考模式
88.10
118 / 463
87.30
129 / 463

编程与软件工程

共 10 项评测
评测名称 / 模式
得分
排名/总数
1359
34 / 35
1387
32 / 35
LiveCodeBench
常规模式
49.40
168 / 251
86.80
24 / 251
76.30
34 / 116
76.30
34 / 116
WeirdML v2
工具
60.77
28 / 52
50.80
46 / 62
GSO
工具
13.70
13 / 21

数学推理

共 9 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
常规模式
38
171 / 216
94
38 / 216
AIME2025
工具
94.17
37 / 216
FrontierMath
工具
26.70
13 / 60
4.20
40 / 80
12.50
29 / 80
12.50
29 / 80
7.10
16 / 24
1.04
14 / 17

多模态理解

共 8 项评测
评测名称 / 模式
得分
排名/总数
MMMU
85.40
2 / 74
MMMU
unknown
85.40
2 / 74
MMMU-Pro
常规模式
62.40
165 / 229
MMMU-Pro
思考模式
79
51 / 229
75.50
83 / 229
MMMU-Pro
unknown
76
78 / 229
VPCT
53.30
9 / 24
VPCT
58.70
7 / 24

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
53.20
45 / 93

Agent能力评测

共 5 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
常规模式工具
46.50
178 / 264
81.90
107 / 264
Terminal Bench Hard
常规模式工具
22.70
143 / 244
45.50
33 / 244
τ³-Banking
工具
15.90
105 / 167

指令跟随

共 2 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
43.20
192 / 282
72.90
48 / 282

AI Agent - 信息收集

共 1 项评测
评测名称 / 模式
得分
排名/总数
50.80
46 / 58

AI Agent - 工具使用

共 3 项评测
评测名称 / 模式
得分
排名/总数
52.40
128 / 194
MCP-Atlas
工具
50.10
42 / 44
47.60
39 / 48

长上下文能力

共 2 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
常规模式
45
148 / 171
80
44 / 171

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
工具
930
94 / 106

和其他模型对比

GPT-5.1

发布机构

GPT-5.1

模型解读

2025年11月12日,OpenAI正式发布了GPT-5.1模型,其中GPT-5.1 Thinking是推理版本的模型,在官方的介绍中,是用于替换GPT-5的,对简单问题比 GPT-5 Thinking 更快,但对难任务会刻意拉长推理时间换准确率;典型「慢工出细活」。目前,付费用户已经可以在ChatGPT网站使用,但是模型的API和更多信息并没有在当天披露。

-------------------以下为此前暴露信息----------------

在 GPT-5.1 相关泄露信息中,GPT-5.1 Reasoning 被多次提及为该家族中的推理强化版本,与基础的 GPT-5.1 和面向企业场景的 GPT-5.1 Pro 共同构成三成员模型系列。

根据 TestingCatalog 的整理以及社交媒体上对前端代码的截图,OpenAI 内部配置中出现了以 GPT-5.1 Reasoning 命名的条目,与 GPT-5.1 Pro 一同被描述为针对企业与高强度推理工作负载的变体。与此同时,GPT-5.1 Thinking 这一内部标识在 ChatGPT 的后端代码中被发现,并被多家科技媒体解读为优化多步推理与更为审慎回答过程的配置,用于处理复杂问题求解与长链条规划任务。

在开源报道中,GPT-5.1 Reasoning 通常被视为承接 GPT-5 Pro 系列“扩展推理能力”定位的后续版本:通过更长的思考过程、更高的计算预算以及更精细的推理策略来提升在复杂推理任务、研究级问题以及多步骤工具调用场景中的稳定性。然而,目前尚无公开的系统卡或技术报告详细说明该版本的参数规模、上下文窗口、思考预算配置或在标准基准(如 MMLU、GPQA 等)上的具体得分。

因此,从公开可验证的信息出发,可以将 GPT-5.1 Reasoning 谨慎地归类为 GPT-5.1 家族中面向深度推理与多步骤问题求解的强化版本,其核心特点在于对推理路径与答案可靠性的优化,而非仅仅提升生成速度或通用对话体验。关于其具体硬件需求、性能边界以及与基础版 GPT-5.1 的量化差异,目前仍缺乏来自 OpenAI 官方的详细数据说明。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码