DataLearner 标志

GPT-5.6 Luna 评测详情

GPT-5.6 Luna 当前已收录的代表性评测结果包括 AA-LCR(10 / 171,得分 83.70)、PinchBench v2(4 / 45,得分 88.67)、GPQA Diamond(61 / 463,得分 91.60)。本页还提供与 2 个竞品模型及 2 个前代或同系列模型的对比,在有数据时会展示性能和价格视图。

评测结果

GPT-5.6 Luna

评测结果

思考模式
工具使用

综合评估

共 29 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
工具
34.17
121 / 147
ARC-AGI-1
工具
56.50
102 / 147
ARC-AGI-1
工具
76.50
77 / 147
ARC-AGI-1
思考水平·Max
88
53 / 147
ARC-AGI-1
思考水平·极高工具
87.67
55 / 147
ARC-AGI-2
工具
5.14
104 / 136
ARC-AGI-2
工具
7.36
98 / 136
ARC-AGI-2
工具
29.31
80 / 136
ARC-AGI-2
思考水平·Max
59.54
56 / 136
ARC-AGI-2
思考水平·极高工具
47.64
67 / 136
HLE
常规模式
7.20
438 / 565
HLE
19.80
289 / 565
HLE
25.80
242 / 565
HLE
33.40
185 / 565
HLE
思考水平·Max
39.50
137 / 565
HLE
思考水平·极高
37
158 / 565
AA Intelligence Index v4.3
思考水平·Max工具
37.50
22 / 26
CritPt
常规模式
0.30
183 / 201
2.60
122 / 201
4.90
99 / 201
16.60
51 / 201
CritPt
思考水平·Max
20.60
36 / 201
CritPt
思考水平·极高
20.60
36 / 201
0.20
20 / 32
ARC-AGI-3 (Standard harness)
思考水平·极高
0.02
25 / 32

科学与综合推理

共 6 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
63.64
365 / 463
82.32
203 / 463
85.90
150 / 463
89.20
100 / 463
GPQA Diamond
思考水平·Max
91.60
61 / 463
GPQA Diamond
思考水平·极高
89.50
95 / 463

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1825.80
17 / 106

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
思考水平·极高
46.80
54 / 93

文本向量检索

共 1 项评测
评测名称 / 模式
得分
排名/总数
Context Arena
思考水平·Max
81.80
34 / 126

长上下文能力

共 6 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
常规模式
42.70
154 / 171
70
104 / 171
75
85 / 171
80.30
40 / 171
AA-LCR
思考水平·Max
83.70
10 / 171
AA-LCR
思考水平·极高
81.70
29 / 171

AI Agent - 工具使用

共 12 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
常规模式工具
39
149 / 194
43.40
144 / 194
53.20
127 / 194
69.70
90 / 194
Terminal-Bench 2.1
思考水平·Max
84.70
37 / 194
Terminal-Bench 2.1
思考水平·Max工具
75.70
76 / 194
Terminal-Bench 2.1
思考水平·极高工具
77.90
70 / 194
0.50
83 / 88
2.50
65 / 88
Terminal-Bench 4.0
思考水平·Max工具
17.27
34 / 88
Terminal-Bench 4.0
思考水平·极高工具
3.50
61 / 88
Terminal-Bench-Science 0.1
思考水平·Max工具
3.30
11 / 11

编程与软件工程

共 18 项评测
评测名称 / 模式
得分
排名/总数
Text Arena (Coding)
思考水平·极高
1522.94
15 / 35
74.60
3 / 3
DeepSWE
工具
1.55
86 / 86
DeepSWE
工具
11.28
85 / 86
DeepSWE
工具
44.25
67 / 86
DeepSWE
思考水平·Max工具
67.19
29 / 86
DeepSWE
思考水平·极高工具
67.20
28 / 86
WeirdML v2
工具
60.86
27 / 52
46.10
85 / 131
46.80
82 / 131
51.60
59 / 131
SciCode
思考水平·Max
53.60
48 / 131
SciCode
思考水平·极高
50.50
67 / 131
16
43 / 43
22.20
42 / 43
29.40
33 / 43
CursorBench 4.0
思考水平·Max工具
35.90
21 / 43
CursorBench 4.0
思考水平·极高工具
33
27 / 43

Agent能力评测

共 7 项评测
评测名称 / 模式
得分
排名/总数
Agents' Last Exam
思考水平·极高工具
50.30
5 / 20
τ³-Banking
常规模式工具
9.70
134 / 167
τ³-Banking
工具
12.80
122 / 167
τ³-Banking
工具
17.70
99 / 167
τ³-Banking
工具
25.20
77 / 167
τ³-Banking
思考水平·Max工具
31.10
57 / 167
τ³-Banking
思考水平·极高工具
28.70
67 / 167

生产力知识

共 13 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
常规模式工具
1007
91 / 106
GDPval-AA v2
工具
1075
86 / 106
GDPval-AA v2
工具
1190
73 / 106
GDPval-AA v2
工具
1375
52 / 106
GDPval-AA v2
思考水平·Max工具
1489
31 / 106
GDPval-AA v2
思考水平·极高工具
1428
43 / 106
AA-Briefcase
常规模式工具
704
79 / 84
AA-Briefcase
工具
744
77 / 84
AA-Briefcase
工具
934
67 / 84
AA-Briefcase
工具
1173
49 / 84
AA-Briefcase
思考水平·Max工具
1339
31 / 84
AA-Briefcase
思考水平·极高工具
1268
39 / 84
Harvey Lab-AA
思考水平·Max工具
87.90
16 / 43

多模态理解

共 11 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
60.30
175 / 229
74
99 / 229
75.80
80 / 229
77.60
66 / 229
MMMU-Pro
思考水平·Max
78.60
55 / 229
MMMU-Pro
思考水平·极高
78.60
55 / 229
14.20
61 / 119
15.20
58 / 119
22.20
27 / 119
GDP.pdf
思考水平·Max
24
19 / 119
GDP.pdf
思考水平·极高
23.80
22 / 119

数学推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
FrontierMath v2
常规模式
39.65
36 / 58
41.40
35 / 58
FrontierMath v2
思考水平·Max
82.11
8 / 58
FrontierMath Tier 4 v2
思考水平·Max
60.98
9 / 42

OpenClaw智能体能力综合测评

共 1 项评测
评测名称 / 模式
得分
排名/总数
88.67
4 / 45

竞品对比

GPT-5.6 Luna 与同类主流模型的评测得分对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。

评测项GPT-5.6 Luna当前Gemini 3.5 FlashDeepSeek-V4-Flash
ARC-AGI-1
Score (%)
综合评估
88.00思考水平·高
92.50思考水平·高 | 工具
--
ARC-AGI-2
Score (% solved); cost per task (USD)
综合评估
59.54思考水平·高
72.08思考水平·高 | 工具
--
CritPt
Score
综合评估
20.60思考水平·极高
13.10思考水平·高
7.10思考水平·高
HLE
Accuracy
综合评估
39.50思考水平·高
42.70思考水平·高
51.50思考水平·高 | 工具
GPQA Diamond
Accuracy
科学与综合推理
91.60思考水平·高
92.80思考水平·高
89.40思考水平·高
Creative Writing
Elo、大模型评判两两对战
写作和创作
1825.80常规模式
--
1555.70常规模式
SimpleBench
Score (AVG@5)
常识推理
46.80思考水平·极高
76.70常规模式
61.10常规模式
Context Arena
Accuracy (8 needles, 4K-128K context)
文本向量检索
81.80思考水平·高
77.19思考水平·高
69.42开启思考
AA-LCR
Accuracy
长上下文能力
83.70思考水平·高
74.30思考水平·中
74.30思考水平·高
Terminal-Bench 2.1
Accuracy
AI Agent - 工具使用
84.70思考水平·高
78.70思考水平·高 | 工具
61.80思考水平·高 | 工具
Terminal-Bench 4.0
Resolution rate (%)
AI Agent - 工具使用
17.27思考水平·高 | 工具
6.60思考水平·高 | 工具
3.00思考水平·高 | 工具
DeepSWE
Pass@1 (DeepSWE v1.1)
编程与软件工程
67.20思考水平·极高 | 工具
37.00思考水平·中 | 工具
53.32思考水平·高 | 工具
其余 13 个 benchmark 仍可在上方图表中查看。

GPT-5.6 Luna 与同类模型的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

模型供应商标准输入标准输出标准价适用于
GPT-5.6 Luna
OpenAI$0.2 / 1M tokens$1.2 / 1M tokens
Gemini 3.5 Flash
Google DeepMind$1.5 / 1M tokens$9 / 1M tokens
DeepSeek-V4-Flash
DeepSeek-AI$0.14 / 1M tokens$0.28 / 1M tokens

历代版本对比

GPT-5.6 Luna 系列各版本的评测成绩纵向对比

GPT-5.6 LunaGPT-5.5GPT-5.4
评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。· 点击任意行可切换下方趋势图。

评测项GPT-5.6 Luna当前GPT-5.5GPT-5.4
AA Intelligence Index v4.3
Index (0-100)
综合评估
37.50常规模式 | 工具
38.60思考水平·极高 | 工具
--
ARC-AGI-1
Score (%)
综合评估
88.00思考水平·高
95.00思考水平·极高
93.67思考水平·极高
ARC-AGI-2
Score (% solved); cost per task (USD)
综合评估
59.54思考水平·高
85.00思考水平·极高
77.10常规模式
CritPt
Score
综合评估
20.60思考水平·极高
27.10思考水平·极高
23.40思考水平·极高
HLE
Accuracy
综合评估
39.50思考水平·高
52.20思考水平·高 | 工具
52.10思考水平·极高 | 工具
GPQA Diamond
Accuracy
科学与综合推理
91.60思考水平·高
94.00思考水平·极高
92.00思考水平·极高
Creative Writing
Elo、大模型评判两两对战
写作和创作
1825.80常规模式
1843.50常规模式
1835.60常规模式
SimpleBench
Score (AVG@5)
常识推理
46.80思考水平·极高
69.00常规模式
--
Context Arena
Accuracy (8 needles, 4K-128K context)
文本向量检索
81.80思考水平·高
94.18思考水平·极高
86.15思考水平·极高
AA-LCR
Accuracy
长上下文能力
83.70思考水平·高
84.30思考水平·极高
82.00思考水平·极高
Terminal-Bench 2.1
Accuracy
AI Agent - 工具使用
84.70思考水平·高
83.10思考水平·极高 | 工具
78.30思考水平·极高 | 工具
Terminal-Bench 4.0
Resolution rate (%)
AI Agent - 工具使用
17.27思考水平·高 | 工具
14.60思考水平·极高 | 工具
--
其余 13 个 benchmark 仍可在上方图表中查看。

单评测历史趋势图

当前查看:AA Intelligence Index v4.3 · 综合评估

选择评测
常规常规 + 工具推理推理 + 工具深度推理深度推理 + 工具

横轴为模型与发布时间,纵轴为分数;同一模式会用实线串起版本变化,同代不同模式继续用虚线辅助对齐。

GPT-5.6 Luna 所在系列的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

模型供应商标准输入标准输出标准价适用于
GPT-5.6 Luna
OpenAI$0.2 / 1M tokens$1.2 / 1M tokens
GPT-5.5
OpenAI$5 / 1M tokens$30 / 1M tokens
GPT-5.4
OpenAI$2.5 / 1M tokens$15 / 1M tokens