DataLearner logo

GPT-5.6 Luna Benchmark Details

GPT-5.6 Luna currently shows benchmark results led by TerminalBench 2.1 (6 / 27, score 84.70), ARC-AGI (19 / 68, score 88), DeepSWE (6 / 19, score 67.20).

Benchmark Results

GPT-5.6 Luna

Benchmark Results

Thinking
Tool usage

General Knowledge

4 evaluations
Benchmark / mode
Score
Rank/total
ARC-AGI
Thinking Level · Max
88
19 / 68
ARC-AGI-2
Thinking Level · Max
59.50
20 / 62
AA Intelligence Index
Thinking Level · Max
51
3 / 3
ARC-AGI-3
Thinking Level · Max
0.20
3 / 9

AI Agent - Tool Usage

2 evaluations
Benchmark / mode
Score
Rank/total
TerminalBench 2.1
Thinking Level · Max
84.70
6 / 27
Agents' Last Exam
Thinking Level · Extra HighTools
50.30
3 / 3

Coding and Software Engineer

2 evaluations
Benchmark / mode
Score
Rank/total
AA Coding Agent Index
Thinking Level · Extra HighTools
74.60
3 / 3
DeepSWE
Thinking Level · Extra HighTools
67.20
6 / 19