AI Model Leaderboards

Name: AI Model Performance Leaderboard
Creator: DataLearner
License: https://creativecommons.org/licenses/by/4.0/

Live rankings across ARC-AGI-2, HLE, AIME 2025, SWE-bench Verified, and more — browse composite scores or drill into math, coding, and agent categories.

View benchmark detailsUpdated on 2026-05-02 07:14:49

As of 2026-05, AA Intelligence Index leaders include GPT-5.5 (xhigh), GPT-5.5 (high), Opus 4.7 (max), based on 10 standardized capability benchmarks.

On the user-preference side, LMArena Text Generation currently ranks Opus 4.7 (thinking), Claude Opus 4.6 (thinking), Claude Opus 4.6 near the top via anonymous A/B voting.

Scroll down for per-benchmark breakdowns in math, coding, and agent categories. See Data Methodology for scoring details, or browse LLM Blogs for in-depth commentary.

Composite Rankings

There is no single, universally agreed-upon comprehensive AI model ranking, so we selected two representative leaderboards that approach the question from different angles. Artificial Analysis Intelligence Index aggregates scores from 10 standardized benchmarks (coding, math, reasoning, etc.) to measure objective capability. LMArena (formerly Chatbot Arena) ranks models by Elo ratings derived from anonymous crowd-sourced A/B voting, reflecting real-world user preference. Together they offer both an objective and a subjective perspective.

AA Intelligence Index

Full ranking

Composite of 10 standardized benchmarks across coding, math, science, reasoning, and agentic tasks.

Updated 2026-05-10

#ModelScore

GPT-5.5 (xhigh)OpenAI

GPT-5.5 (high)OpenAI

Opus 4.7 (max)Anthropic

Gemini 3.1 Pro PreviewGoogle Deep Mind

GPT-5.5 (medium)OpenAI

Kimi K2.6Moonshot AI

MiMo-V2.5-ProXiaomi

GPT-5.3 Codex (xhigh)OpenAI

Grok 4.3xAI

Muse SparkFacebook AI研究实验室

Source: Artificial Analysis

LMArena Text Generation

Full ranking

Elo ratings from anonymous crowdsourced A/B voting, reflecting real user preference for response quality.

Updated 2026-05-07

#ModelElo

Opus 4.7 (thinking)Anthropic

1503

Claude Opus 4.6 (thinking)Anthropic

1502

Claude Opus 4.6Anthropic

1498

Gemini 3.1 Pro PreviewGoogle Deep Mind

1492

Opus 4.7Anthropic

1491

Muse SparkFacebook AI研究实验室

1490

Gemini 3.0 Pro (Preview 11-2025)Google Deep Mind

1486

gpt-5.5-highOpenAI

1484

grok-4.20-beta1xAI

1480

gpt-5.2-chat-latest-20260210OpenAI

1477

Source: LMArena

Per-Benchmark Rankings

Filter by math, coding, agent, and more. Switch benchmarks below or jump into a category leaderboard for the full ranking. View all benchmarks.

Benchmark Tracks

Overall

ARC-AGI-2 HLE MMLU Pro Open Benchmark Directory

Math

AIME 2025 FrontierMath MATH-500 Open Math Leaderboard

Coding

SWE-bench Verified LiveCodeBench SWE-Bench Pro Open Coding Leaderboard

Agent

τ²-Bench Terminal Bench 2.0 Aider-Polyglot Open Agent Leaderboard

Model Size:All 3B and below 7B 13B 34B 65B 100B and above

Model Type:All Reasoning Models Foundation Models Instruction/Chat Models Coding Models

Source:All Open Source Closed Source

Origin:All China

LLM Performance Results

Data source: DataLearnerAI

Scores shown are the best result across all evaluation modes. Click a model name for the full breakdown.

Rank	Model						License
	GPT-5.5 Pro OpenAI	57.20	84.60	39.60	—	—	Proprietary
	GPT-5.5 OpenAI	52.20	85.00	35.40	—	—	Proprietary
	GPT-5.4 Pro OpenAI	58.70	83.30	38.00	—	—	Proprietary
4	GPT-5.4 OpenAI	52.10	77.10	27.10	—	—	Proprietary
5	Opus 4.7 Anthropic	54.70	75.80	22.90	87.60	—	Proprietary
6	Claude Opus 4.6 Anthropic	53.00	66.30	22.90	80.84	91.89	Proprietary
7	GPT-5.2 OpenAI	45.50	54.20	18.80	80.00	82.00	Proprietary
8	Muse Spark Facebook AI研究实验室	58.00	42.50	14.60	77.40	—	Proprietary
9	Gemini 3.0 Pro (Preview 11-2025) Google Deep Mind	45.80	45.10	18.80	76.20	85.40	Proprietary
10	Gemini 3.1 Pro Preview Google Deep Mind	51.40	77.10	16.70	80.60	90.80	Proprietary
11	Gemini 2.5 Deep Think Google Deep Mind	34.80	—	10.40	—	—	Proprietary
12	GPT-5.1 OpenAI	42.70	17.60	12.50	76.30	—	Proprietary
13	GPT-5 OpenAI	35.20	9.90	12.50	72.80	80.00	Proprietary
14	Opus 4.5 Anthropic	43.20	37.60	4.20	80.90	81.99	Proprietary
15	GPT-5-mini OpenAI	5.00	—	6.30	—	—	Proprietary
16	OpenAI o4 - mini OpenAI	17.70	—	6.30	68.10	56.90	Proprietary
17	Grok 4 xAI	38.60	15.90	2.10	58.60	—	Proprietary
18	Gemini 2.5-Pro Google Deep Mind	21.60	4.90	2.10	67.20	—	Proprietary
19	OpenAI o3-mini (high) OpenAI	—	—	4.20	49.30	—	Proprietary
20	Gemini-2.5-Pro-Preview-05-06 Google Deep Mind	21.60	—	2.10	63.20	—	Proprietary
21	OpenAI o3 OpenAI	20.32	6.50	2.10	69.10	—	Proprietary
22	OpenAI o1 OpenAI	9.10	—	—	48.90	—	Proprietary
23	GPT-5-Nano OpenAI	—	—	2.10	—	—	Proprietary
24	OpenAI o3-mini (medium) OpenAI	—	—	—	—	—	Proprietary
25	Opus 4.1 Anthropic	—	—	4.20	74.50	—	Proprietary
26	Grok 3 mini xAI	—	—	—	—	—	Proprietary
27	GPT-4.1 OpenAI	3.70	—	—	54.60	54.70	Proprietary
28	Claude Sonnet 4.5 Anthropic	33.60	13.60	4.20	82.00	84.70	Proprietary
29	Claude Opus 4 Anthropic	10.70	8.60	4.20	72.50	72.50	Proprietary
30	GPT-4.1 mini OpenAI	—	—	—	23.60	53.00	Proprietary
31	Haiku 4.5 Anthropic	9.70	4.50	2.10	73.30	33.00	Proprietary
32	Claude Sonnet 4 Anthropic	9.60	5.90	—	80.20	52.00	Proprietary
33	Claude Sonnet 3.7 Anthropic	10.30	—	—	70.30	61.80	Proprietary
34	Grok 3 xAI	—	—	—	—	—	Proprietary
35	Claude 3.5 Sonnet New Anthropic	—	—	—	49.00	—	Proprietary
36	OpenAI o1-mini OpenAI	—	—	—	—	—	Proprietary
37	Claude 3.5 Sonnet Anthropic	—	—	—	—	—	Proprietary
38	GPT-4.1 nano OpenAI	—	—	—	—	—	Proprietary
39	Qwen2.5-Max 阿里巴巴	—	—	—	—	—	Proprietary
40	GPT-4o OpenAI	5.30	—	—	31.00	—	Proprietary
41	Mistral Large MistralAI	—	—	—	—	—	Proprietary
42	GPT-4o(2024-11-20) OpenAI	—	—	—	31.00	—	Proprietary
43	Claude 3.5 Haiku Anthropic	—	—	—	—	—	Proprietary
44	Gemini 2.5 Flash Google Deep Mind	11.00	—	4.20	50.00	—	Proprietary
45	Claude Mythos Preview Anthropic	64.70	—	—	93.90	—	Proprietary
46	Gemini 2.5 Flash-Lite Google Deep Mind	6.90	—	—	27.60	—	Proprietary
47	Qwen 3.6 Plus Preview 阿里巴巴	50.60	—	—	78.80	—	Proprietary
48	GPT-5.2 Pro OpenAI	50.00	54.20	31.30	—	—	Proprietary
49	Gemini 2.0 Flash Experimental DeepMind	5.10	—	—	21.40	—	Proprietary
50	Qwen3-Max-Thinking 阿里巴巴	49.80	—	—	75.30	82.10	Proprietary

GPT-5.5 Pro

OpenAI

HLE57.20

ARC-AGI-284.60

FrontierMath - Tier 439.60

SWE-bench Verified—

τ²-Bench—

Proprietary

GPT-5.5

OpenAI

HLE52.20

ARC-AGI-285.00

FrontierMath - Tier 435.40

SWE-bench Verified—

τ²-Bench—

Proprietary

GPT-5.4 Pro

OpenAI

HLE58.70

ARC-AGI-283.30

FrontierMath - Tier 438.00

SWE-bench Verified—

τ²-Bench—

Proprietary

GPT-5.4

OpenAI

HLE52.10

ARC-AGI-277.10

FrontierMath - Tier 427.10

SWE-bench Verified—

τ²-Bench—

Proprietary

Opus 4.7

Anthropic

HLE54.70

ARC-AGI-275.80

FrontierMath - Tier 422.90

SWE-bench Verified87.60

τ²-Bench—

Proprietary

Claude Opus 4.6

Anthropic

HLE53.00

ARC-AGI-266.30

FrontierMath - Tier 422.90

SWE-bench Verified80.84

τ²-Bench91.89

Proprietary

GPT-5.2

OpenAI

HLE45.50

ARC-AGI-254.20

FrontierMath - Tier 418.80

SWE-bench Verified80.00

τ²-Bench82.00

Proprietary

Muse Spark

Facebook AI研究实验室

HLE58.00

ARC-AGI-242.50

FrontierMath - Tier 414.60

SWE-bench Verified77.40

τ²-Bench—

Proprietary

Gemini 3.0 Pro (Preview 11-2025)

Google Deep Mind

HLE45.80

ARC-AGI-245.10

FrontierMath - Tier 418.80

SWE-bench Verified76.20

τ²-Bench85.40

Proprietary

Gemini 3.1 Pro Preview

Google Deep Mind

HLE51.40

ARC-AGI-277.10

FrontierMath - Tier 416.70

SWE-bench Verified80.60

τ²-Bench90.80

Proprietary

Gemini 2.5 Deep Think

Google Deep Mind

HLE34.80

ARC-AGI-2—

FrontierMath - Tier 410.40

SWE-bench Verified—

τ²-Bench—

Proprietary

GPT-5.1

OpenAI

HLE42.70

ARC-AGI-217.60

FrontierMath - Tier 412.50

SWE-bench Verified76.30

τ²-Bench—

Proprietary

GPT-5

OpenAI

HLE35.20

ARC-AGI-29.90

FrontierMath - Tier 412.50

SWE-bench Verified72.80

τ²-Bench80.00

Proprietary

Opus 4.5

Anthropic

HLE43.20

ARC-AGI-237.60

FrontierMath - Tier 44.20

SWE-bench Verified80.90

τ²-Bench81.99

Proprietary

GPT-5-mini

OpenAI

HLE5.00

ARC-AGI-2—

FrontierMath - Tier 46.30

SWE-bench Verified—

τ²-Bench—

Proprietary

OpenAI o4 - mini

OpenAI

HLE17.70

ARC-AGI-2—

FrontierMath - Tier 46.30

SWE-bench Verified68.10

τ²-Bench56.90

Proprietary

Grok 4

xAI

HLE38.60

ARC-AGI-215.90

FrontierMath - Tier 42.10

SWE-bench Verified58.60

τ²-Bench—

Proprietary

Gemini 2.5-Pro

Google Deep Mind

HLE21.60

ARC-AGI-24.90

FrontierMath - Tier 42.10

SWE-bench Verified67.20

τ²-Bench—

Proprietary

OpenAI o3-mini (high)

OpenAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 44.20

SWE-bench Verified49.30

τ²-Bench—

Proprietary

Gemini-2.5-Pro-Preview-05-06

Google Deep Mind

HLE21.60

ARC-AGI-2—

FrontierMath - Tier 42.10

SWE-bench Verified63.20

τ²-Bench—

Proprietary

OpenAI o3

OpenAI

HLE20.32

ARC-AGI-26.50

FrontierMath - Tier 42.10

SWE-bench Verified69.10

τ²-Bench—

Proprietary

OpenAI o1

OpenAI

HLE9.10

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified48.90

τ²-Bench—

Proprietary

GPT-5-Nano

OpenAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 42.10

SWE-bench Verified—

τ²-Bench—

Proprietary

OpenAI o3-mini (medium)

OpenAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

Opus 4.1

Anthropic

HLE—

ARC-AGI-2—

FrontierMath - Tier 44.20

SWE-bench Verified74.50

τ²-Bench—

Proprietary

Grok 3 mini

xAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

GPT-4.1

OpenAI

HLE3.70

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified54.60

τ²-Bench54.70

Proprietary

Claude Sonnet 4.5

Anthropic

HLE33.60

ARC-AGI-213.60

FrontierMath - Tier 44.20

SWE-bench Verified82.00

τ²-Bench84.70

Proprietary

Claude Opus 4

Anthropic

HLE10.70

ARC-AGI-28.60

FrontierMath - Tier 44.20

SWE-bench Verified72.50

τ²-Bench72.50

Proprietary

GPT-4.1 mini

OpenAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified23.60

τ²-Bench53.00

Proprietary

Haiku 4.5

Anthropic

HLE9.70

ARC-AGI-24.50

FrontierMath - Tier 42.10

SWE-bench Verified73.30

τ²-Bench33.00

Proprietary

Claude Sonnet 4

Anthropic

HLE9.60

ARC-AGI-25.90

FrontierMath - Tier 4—

SWE-bench Verified80.20

τ²-Bench52.00

Proprietary

Claude Sonnet 3.7

Anthropic

HLE10.30

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified70.30

τ²-Bench61.80

Proprietary

Grok 3

xAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

Claude 3.5 Sonnet New

Anthropic

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified49.00

τ²-Bench—

Proprietary

OpenAI o1-mini

OpenAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

Claude 3.5 Sonnet

Anthropic

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

GPT-4.1 nano

OpenAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

Qwen2.5-Max

阿里巴巴

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

GPT-4o

OpenAI

HLE5.30

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified31.00

τ²-Bench—

Proprietary

Mistral Large

MistralAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

GPT-4o(2024-11-20)

OpenAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified31.00

τ²-Bench—

Proprietary

Claude 3.5 Haiku

Anthropic

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

Gemini 2.5 Flash

Google Deep Mind

HLE11.00

ARC-AGI-2—

FrontierMath - Tier 44.20

SWE-bench Verified50.00

τ²-Bench—

Proprietary

Claude Mythos Preview

Anthropic

HLE64.70

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified93.90

τ²-Bench—

Proprietary

Gemini 2.5 Flash-Lite

Google Deep Mind

HLE6.90

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified27.60

τ²-Bench—

Proprietary

Qwen 3.6 Plus Preview

阿里巴巴

HLE50.60

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified78.80

τ²-Bench—

Proprietary

GPT-5.2 Pro

OpenAI

HLE50.00

ARC-AGI-254.20

FrontierMath - Tier 431.30

SWE-bench Verified—

τ²-Bench—

Proprietary

Gemini 2.0 Flash Experimental

DeepMind

HLE5.10

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified21.40

τ²-Bench—

Proprietary

Qwen3-Max-Thinking

阿里巴巴

HLE49.80

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified75.30

τ²-Bench82.10

Proprietary

Sort by:

Showing 50 of 101 modelsView FrontierMath benchmark page

Leaderboard FAQ

Where does the leaderboard data come from?

Scores are aggregated from primary sources: official model cards, technical reports, papers, vendor blog posts, and reproducible third-party evaluations. Each row links back to the underlying model detail page where the source is cited.

Why do scores for the same model differ across benchmarks?

Each benchmark measures a different capability — reasoning (HLE, ARC-AGI-2), math (AIME, FrontierMath), coding (SWE-bench Verified), agent use (τ²-Bench), and so on. A model tuned for one capability may perform very differently on another, which is exactly why we surface per-benchmark scores rather than a single number.

How often is the leaderboard updated?

Data is revalidated every 5 minutes, and new models or evaluation results are added as soon as they are published. The "Updated on" indicator at the top of the page reflects the most recent data refresh.

How should I read the composite ranking?

The composite view aggregates a model's standing across multiple core benchmarks. It is a useful first filter, but for production decisions you should drill into the specific benchmark closest to your workload — for example, SWE-bench Verified for coding agents, or τ²-Bench for tool-use scenarios.

How do I compare an open-source model with a closed API model?

Use the license filter at the top to mix open and closed models in the same view, then look at the same benchmark column for both. Beyond raw scores, consider total cost of ownership: API pricing for closed models vs. self-hosting cost for open weights.

Composite Rankings

Per-Benchmark Rankings

Filter by math, coding, agent, and more. Switch benchmarks below or jump into a category leaderboard for the full ranking. View all benchmarks.

LLM Performance Results

Data source: DataLearnerAI

Scores shown are the best result across all evaluation modes. Click a model name for the full breakdown.

Rank	Model						License
	GPT-5.5 Pro OpenAI	57.20	84.60	39.60	—	—	Proprietary
	GPT-5.5 OpenAI	52.20	85.00	35.40	—	—	Proprietary
	GPT-5.4 Pro OpenAI	58.70	83.30	38.00	—	—	Proprietary
4	GPT-5.4 OpenAI	52.10	77.10	27.10	—	—	Proprietary
5	Opus 4.7 Anthropic	54.70	75.80	22.90	87.60	—	Proprietary
6	Claude Opus 4.6 Anthropic	53.00	66.30	22.90	80.84	91.89	Proprietary
7	GPT-5.2 OpenAI	45.50	54.20	18.80	80.00	82.00	Proprietary
8	Muse Spark Facebook AI研究实验室	58.00	42.50	14.60	77.40	—	Proprietary
9	Gemini 3.0 Pro (Preview 11-2025) Google Deep Mind	45.80	45.10	18.80	76.20	85.40	Proprietary
10	Gemini 3.1 Pro Preview Google Deep Mind	51.40	77.10	16.70	80.60	90.80	Proprietary
11	Gemini 2.5 Deep Think Google Deep Mind	34.80	—	10.40	—	—	Proprietary
12	GPT-5.1 OpenAI	42.70	17.60	12.50	76.30	—	Proprietary
13	GPT-5 OpenAI	35.20	9.90	12.50	72.80	80.00	Proprietary
14	Opus 4.5 Anthropic	43.20	37.60	4.20	80.90	81.99	Proprietary
15	GPT-5-mini OpenAI	5.00	—	6.30	—	—	Proprietary
16	OpenAI o4 - mini OpenAI	17.70	—	6.30	68.10	56.90	Proprietary
17	Grok 4 xAI	38.60	15.90	2.10	58.60	—	Proprietary
18	Gemini 2.5-Pro Google Deep Mind	21.60	4.90	2.10	67.20	—	Proprietary
19	OpenAI o3-mini (high) OpenAI	—	—	4.20	49.30	—	Proprietary
20	Gemini-2.5-Pro-Preview-05-06 Google Deep Mind	21.60	—	2.10	63.20	—	Proprietary
21	OpenAI o3 OpenAI	20.32	6.50	2.10	69.10	—	Proprietary
22	OpenAI o1 OpenAI	9.10	—	—	48.90	—	Proprietary
23	GPT-5-Nano OpenAI	—	—	2.10	—	—	Proprietary
24	OpenAI o3-mini (medium) OpenAI	—	—	—	—	—	Proprietary
25	Opus 4.1 Anthropic	—	—	4.20	74.50	—	Proprietary
26	Grok 3 mini xAI	—	—	—	—	—	Proprietary
27	GPT-4.1 OpenAI	3.70	—	—	54.60	54.70	Proprietary
28	Claude Sonnet 4.5 Anthropic	33.60	13.60	4.20	82.00	84.70	Proprietary
29	Claude Opus 4 Anthropic	10.70	8.60	4.20	72.50	72.50	Proprietary
30	GPT-4.1 mini OpenAI	—	—	—	23.60	53.00	Proprietary
31	Haiku 4.5 Anthropic	9.70	4.50	2.10	73.30	33.00	Proprietary
32	Claude Sonnet 4 Anthropic	9.60	5.90	—	80.20	52.00	Proprietary
33	Claude Sonnet 3.7 Anthropic	10.30	—	—	70.30	61.80	Proprietary
34	Grok 3 xAI	—	—	—	—	—	Proprietary
35	Claude 3.5 Sonnet New Anthropic	—	—	—	49.00	—	Proprietary
36	OpenAI o1-mini OpenAI	—	—	—	—	—	Proprietary
37	Claude 3.5 Sonnet Anthropic	—	—	—	—	—	Proprietary
38	GPT-4.1 nano OpenAI	—	—	—	—	—	Proprietary
39	Qwen2.5-Max 阿里巴巴	—	—	—	—	—	Proprietary
40	GPT-4o OpenAI	5.30	—	—	31.00	—	Proprietary
41	Mistral Large MistralAI	—	—	—	—	—	Proprietary
42	GPT-4o(2024-11-20) OpenAI	—	—	—	31.00	—	Proprietary
43	Claude 3.5 Haiku Anthropic	—	—	—	—	—	Proprietary
44	Gemini 2.5 Flash Google Deep Mind	11.00	—	4.20	50.00	—	Proprietary
45	Claude Mythos Preview Anthropic	64.70	—	—	93.90	—	Proprietary
46	Gemini 2.5 Flash-Lite Google Deep Mind	6.90	—	—	27.60	—	Proprietary
47	Qwen 3.6 Plus Preview 阿里巴巴	50.60	—	—	78.80	—	Proprietary
48	GPT-5.2 Pro OpenAI	50.00	54.20	31.30	—	—	Proprietary
49	Gemini 2.0 Flash Experimental DeepMind	5.10	—	—	21.40	—	Proprietary
50	Qwen3-Max-Thinking 阿里巴巴	49.80	—	—	75.30	82.10	Proprietary

GPT-5.5 Pro

OpenAI

HLE57.20

ARC-AGI-284.60

FrontierMath - Tier 439.60

SWE-bench Verified—

τ²-Bench—

Proprietary

GPT-5.5

OpenAI

HLE52.20

ARC-AGI-285.00

FrontierMath - Tier 435.40

SWE-bench Verified—

τ²-Bench—

Proprietary

GPT-5.4 Pro

OpenAI

HLE58.70

ARC-AGI-283.30

FrontierMath - Tier 438.00

SWE-bench Verified—

τ²-Bench—

Proprietary

GPT-5.4

OpenAI

HLE52.10

ARC-AGI-277.10

FrontierMath - Tier 427.10

SWE-bench Verified—

τ²-Bench—

Proprietary

Opus 4.7

Anthropic

HLE54.70

ARC-AGI-275.80

FrontierMath - Tier 422.90

SWE-bench Verified87.60

τ²-Bench—

Proprietary

Claude Opus 4.6

Anthropic

HLE53.00

ARC-AGI-266.30

FrontierMath - Tier 422.90

SWE-bench Verified80.84

τ²-Bench91.89

Proprietary

GPT-5.2

OpenAI

HLE45.50

ARC-AGI-254.20

FrontierMath - Tier 418.80

SWE-bench Verified80.00

τ²-Bench82.00

Proprietary

Muse Spark

Facebook AI研究实验室

HLE58.00

ARC-AGI-242.50

FrontierMath - Tier 414.60

SWE-bench Verified77.40

τ²-Bench—

Proprietary

Gemini 3.0 Pro (Preview 11-2025)

Google Deep Mind

HLE45.80

ARC-AGI-245.10

FrontierMath - Tier 418.80

SWE-bench Verified76.20

τ²-Bench85.40

Proprietary

Gemini 3.1 Pro Preview

Google Deep Mind

HLE51.40

ARC-AGI-277.10

FrontierMath - Tier 416.70

SWE-bench Verified80.60

τ²-Bench90.80

Proprietary

Gemini 2.5 Deep Think

Google Deep Mind

HLE34.80

ARC-AGI-2—

FrontierMath - Tier 410.40

SWE-bench Verified—

τ²-Bench—

Proprietary

GPT-5.1

OpenAI

HLE42.70

ARC-AGI-217.60

FrontierMath - Tier 412.50

SWE-bench Verified76.30

τ²-Bench—

Proprietary

GPT-5

OpenAI

HLE35.20

ARC-AGI-29.90

FrontierMath - Tier 412.50

SWE-bench Verified72.80

τ²-Bench80.00

Proprietary

Opus 4.5

Anthropic

HLE43.20

ARC-AGI-237.60

FrontierMath - Tier 44.20

SWE-bench Verified80.90

τ²-Bench81.99

Proprietary

GPT-5-mini

OpenAI

HLE5.00

ARC-AGI-2—

FrontierMath - Tier 46.30

SWE-bench Verified—

τ²-Bench—

Proprietary

OpenAI o4 - mini

OpenAI

HLE17.70

ARC-AGI-2—

FrontierMath - Tier 46.30

SWE-bench Verified68.10

τ²-Bench56.90

Proprietary

Grok 4

xAI

HLE38.60

ARC-AGI-215.90

FrontierMath - Tier 42.10

SWE-bench Verified58.60

τ²-Bench—

Proprietary

Gemini 2.5-Pro

Google Deep Mind

HLE21.60

ARC-AGI-24.90

FrontierMath - Tier 42.10

SWE-bench Verified67.20

τ²-Bench—

Proprietary

OpenAI o3-mini (high)

OpenAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 44.20

SWE-bench Verified49.30

τ²-Bench—

Proprietary

Gemini-2.5-Pro-Preview-05-06

Google Deep Mind

HLE21.60

ARC-AGI-2—

FrontierMath - Tier 42.10

SWE-bench Verified63.20

τ²-Bench—

Proprietary

OpenAI o3

OpenAI

HLE20.32

ARC-AGI-26.50

FrontierMath - Tier 42.10

SWE-bench Verified69.10

τ²-Bench—

Proprietary

OpenAI o1

OpenAI

HLE9.10

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified48.90

τ²-Bench—

Proprietary

GPT-5-Nano

OpenAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 42.10

SWE-bench Verified—

τ²-Bench—

Proprietary

OpenAI o3-mini (medium)

OpenAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

Opus 4.1

Anthropic

HLE—

ARC-AGI-2—

FrontierMath - Tier 44.20

SWE-bench Verified74.50

τ²-Bench—

Proprietary

Grok 3 mini

xAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

GPT-4.1

OpenAI

HLE3.70

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified54.60

τ²-Bench54.70

Proprietary

Claude Sonnet 4.5

Anthropic

HLE33.60

ARC-AGI-213.60

FrontierMath - Tier 44.20

SWE-bench Verified82.00

τ²-Bench84.70

Proprietary

Claude Opus 4

Anthropic

HLE10.70

ARC-AGI-28.60

FrontierMath - Tier 44.20

SWE-bench Verified72.50

τ²-Bench72.50

Proprietary

GPT-4.1 mini

OpenAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified23.60

τ²-Bench53.00

Proprietary

Haiku 4.5

Anthropic

HLE9.70

ARC-AGI-24.50

FrontierMath - Tier 42.10

SWE-bench Verified73.30

τ²-Bench33.00

Proprietary

Claude Sonnet 4

Anthropic

HLE9.60

ARC-AGI-25.90

FrontierMath - Tier 4—

SWE-bench Verified80.20

τ²-Bench52.00

Proprietary

Claude Sonnet 3.7

Anthropic

HLE10.30

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified70.30

τ²-Bench61.80

Proprietary

Grok 3

xAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

Claude 3.5 Sonnet New

Anthropic

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified49.00

τ²-Bench—

Proprietary

OpenAI o1-mini

OpenAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

Claude 3.5 Sonnet

Anthropic

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

GPT-4.1 nano

OpenAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

Qwen2.5-Max

阿里巴巴

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

GPT-4o

OpenAI

HLE5.30

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified31.00

τ²-Bench—

Proprietary

Mistral Large

MistralAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

GPT-4o(2024-11-20)

OpenAI

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified31.00

τ²-Bench—

Proprietary

Claude 3.5 Haiku

Anthropic

HLE—

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified—

τ²-Bench—

Proprietary

Gemini 2.5 Flash

Google Deep Mind

HLE11.00

ARC-AGI-2—

FrontierMath - Tier 44.20

SWE-bench Verified50.00

τ²-Bench—

Proprietary

Claude Mythos Preview

Anthropic

HLE64.70

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified93.90

τ²-Bench—

Proprietary

Gemini 2.5 Flash-Lite

Google Deep Mind

HLE6.90

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified27.60

τ²-Bench—

Proprietary

Qwen 3.6 Plus Preview

阿里巴巴

HLE50.60

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified78.80

τ²-Bench—

Proprietary

GPT-5.2 Pro

OpenAI

HLE50.00

ARC-AGI-254.20

FrontierMath - Tier 431.30

SWE-bench Verified—

τ²-Bench—

Proprietary

Gemini 2.0 Flash Experimental

DeepMind

HLE5.10

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified21.40

τ²-Bench—

Proprietary

Qwen3-Max-Thinking

阿里巴巴

HLE49.80

ARC-AGI-2—

FrontierMath - Tier 4—

SWE-bench Verified75.30

τ²-Bench82.10

Proprietary

Sort by:

Showing 50 of 101 modelsView FrontierMath benchmark page

Leaderboard FAQ

Where does the leaderboard data come from?

Why do scores for the same model differ across benchmarks?

How often is the leaderboard updated?

How should I read the composite ranking?

How do I compare an open-source model with a closed API model?