DataLearner 标志

GPT-6 Luna 评测详情

GPT-6 Luna 当前已收录的代表性评测结果包括 AA-LCR(15 / 174,得分 83)、Agents' Last Exam(5 / 24,得分 50.90)、CritPt(43 / 204,得分 19)。本页还提供与 3 个竞品模型及 2 个前代或同系列模型的对比,在有数据时会展示性能和价格视图。

评测结果

GPT-6 Luna

评测结果

思考模式
工具使用

综合评估

共 7 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
最高
86.70
67 / 153
ARC-AGI-2
最高
59.30
62 / 142
Vals Index
最高工具
58.45
5 / 5
HLE
最高
39
143 / 569
37
25 / 29
CritPt
最高
19
43 / 204

长上下文能力

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
最高
83
15 / 174

AI Agent - 工具使用

共 5 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
最高工具
73.03
89 / 199
BioMysteryBench
最高工具
61.48
4 / 4
AutomationBench-AA
最高工具
53
16 / 17
OSWorld 2.0
最高工具
52.70
11 / 13
Terminal-Bench 4.0
最高工具
13
48 / 95

编程与软件工程

共 7 项评测
评测名称 / 模式
得分
排名/总数
81.65
3 / 3
DeepSWE
最高工具
66.60
37 / 91
IOI (Vals)
最高工具
55.56
3 / 3
SciCode
最高
55
39 / 134
Code Migration
最高工具
42.55
2 / 2
42.40
9 / 9
Program Bench
最高工具
0.50
15 / 15

Agent能力评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
Agents' Last Exam
最高工具
50.90
5 / 24

生产力知识

共 12 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
最高工具
1367
58 / 110
AA-Briefcase
最高工具
1299
38 / 88
MedScribe
最高工具
83.71
2 / 3
68.52
3 / 3
Tax Agent Bench
最高工具
58.86
2 / 3
57.65
2 / 3
Finance Agent v2
最高工具
49.87
4 / 5
SAGE
最高工具
48.09
1 / 3
MedCode
最高工具
44.69
3 / 3
30.29
3 / 4
AutomationBench
最高工具
20.70
22 / 23
2.92
2 / 3

多模态理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
最高
20
40 / 122

科学与综合推理

共 5 项评测
评测名称 / 模式
得分
排名/总数

真实性评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
1
43 / 47

数学推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
64
3 / 3

竞品对比

GPT-6 Luna 与同类主流模型的评测得分对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。

评测项GPT-6 Luna当前DeepSeek-V4.1-FlashGLM-5.3-FlashClaude Sonnet 5
AA Intelligence Index v4.3
Index (0-100)
综合评估
37.00常规模式 | 工具
39.50常规模式 | 工具
41.90思考水平·高
38.40常规模式 | 工具
CritPt
Score
综合评估
19.00思考水平·高
14.30思考水平·高
15.40开启思考
16.90思考水平·高
HLE
Accuracy
综合评估
39.00思考水平·高
63.90思考水平·高 | 工具
55.30思考水平·高 | 工具
57.40思考水平·极高 | 工具
AA-LCR
Accuracy
长上下文能力
83.00思考水平·高
84.00思考水平·高
--
82.00思考水平·高
AutomationBench-AA
Guardrail-safe objective completion rate (%)
AI Agent - 工具使用
53.00思考水平·高 | 工具
68.90思考水平·高
60.40思考水平·高
--
Terminal-Bench 2.1
Accuracy
AI Agent - 工具使用
73.03思考水平·高 | 工具
90.60思考水平·高 | 工具
84.30思考水平·高 | 工具
80.50思考水平·高 | 工具
Terminal-Bench 4.0
Resolution rate (%)
AI Agent - 工具使用
13.00思考水平·高 | 工具
26.80思考水平·高 | 工具
32.80开启思考 | 工具
12.42思考水平·高 | 工具
DeepSWE
Pass@1 (DeepSWE v1.1)
编程与软件工程
66.60思考水平·高 | 工具
74.20思考水平·高 | 工具
63.39思考水平·高 | 工具
54.00深度思考模式 | 工具
Program Bench
Score
编程与软件工程
0.50思考水平·高 | 工具
20.30思考水平·高 | 工具
--
--
SciCode
Score
编程与软件工程
55.00思考水平·高
51.90思考水平·高
51.60开启思考
54.30思考水平·高
Agents' Last Exam
Score
Agent能力评测
50.90思考水平·高 | 工具
31.80思考水平·高 | 工具
26.30思考水平·高 | 工具
--
AA-Briefcase
AA-Briefcase Elo; Rubric Pass Rate; Analytical Quality Elo; Presentation Elo
生产力知识
1299.00思考水平·高 | 工具
1424.00思考水平·高 | 工具
--
1355.00思考水平·高 | 工具
其余 4 个 benchmark 仍可在上方图表中查看。

GPT-6 Luna 与同类模型的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

若存在上下文阈值,图中标准价仅适用于以下范围:

GPT-6 Luna: 标准价适用于 <= 272000
模型供应商标准输入标准输出标准价适用于
GPT-6 Luna
OpenAI$0.1 / 1M tokens$0.5 / 1M tokens<= 272000
GLM-5.3-Flash
智谱AI$0.075 / 1M tokens$0.25 / 1M tokens
Claude Sonnet 5
Anthropic$2 / 1M tokens$10 / 1M tokens

历代版本对比

GPT-6 Luna 系列各版本的评测成绩纵向对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。· 点击任意行可切换下方趋势图。

评测项GPT-6 Luna当前GPT-5.6 LunaGPT-5.4 mini
AA Intelligence Index v4.3
Index (0-100)
综合评估
37.00常规模式 | 工具
37.50常规模式 | 工具
--
ARC-AGI-1
Score (%)
综合评估
86.70思考水平·高
88.00思考水平·高
63.67思考水平·极高 | 工具
ARC-AGI-2
Score (% solved); cost per task (USD)
综合评估
59.30思考水平·高
59.54思考水平·高
18.90思考水平·极高 | 工具
ARC-AGI-3 (Standard harness)
Action efficiency score(以 ARC Prize Standard harness 口径为准)
综合评估
0.19思考水平·中
0.20思考水平·高
--
CritPt
Score
综合评估
19.00思考水平·高
20.60思考水平·极高
10.00思考水平·极高
HLE
Accuracy
综合评估
39.00思考水平·高
39.50思考水平·高
41.50思考水平·极高 | 工具
AA-LCR
Accuracy
长上下文能力
83.00思考水平·高
83.70思考水平·高
77.00思考水平·极高
Terminal-Bench 2.1
Accuracy
AI Agent - 工具使用
73.03思考水平·高 | 工具
84.70思考水平·高
59.20思考水平·极高 | 工具
Terminal-Bench 4.0
Resolution rate (%)
AI Agent - 工具使用
13.00思考水平·高 | 工具
17.27思考水平·高 | 工具
2.00思考水平·极高 | 工具
DeepSWE
Pass@1 (DeepSWE v1.1)
编程与软件工程
66.60思考水平·高 | 工具
67.20思考水平·极高 | 工具
--
SciCode
Score
编程与软件工程
55.00思考水平·高
53.60思考水平·高
52.10思考水平·极高
Agents' Last Exam
Score
Agent能力评测
50.90思考水平·高 | 工具
50.30思考水平·极高 | 工具
--
其余 3 个 benchmark 仍可在上方图表中查看。

单评测历史趋势图

当前查看:AA Intelligence Index v4.3 · 综合评估

选择评测
常规常规 + 工具推理推理 + 工具深度推理深度推理 + 工具

横轴为模型与发布时间,纵轴为分数;同一模式会用实线串起版本变化,同代不同模式继续用虚线辅助对齐。

GPT-6 Luna 所在系列的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

若存在上下文阈值,图中标准价仅适用于以下范围:

GPT-6 Luna: 标准价适用于 <= 272000
模型供应商标准输入标准输出标准价适用于
GPT-6 Luna
OpenAI$0.1 / 1M tokens$0.5 / 1M tokens<= 272000
GPT-5.6 Luna
OpenAI$0.2 / 1M tokens$1.2 / 1M tokens
GPT-5.4 mini
OpenAI$0.75 / 1M tokens$4.5 / 1M tokens