DataLearner logo
Back to Main Leaderboard

LLM Coding Benchmark Leaderboard

This page provides the LLM coding benchmark leaderboard, covering SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, and SWE-bench Multilingual datasets, comparing GPT, Claude, Qwen, and DeepSeek models.

Updated on 2026-09-09 21:31:23

As of 2026-09, this page covers SWE-bench Verified, LiveCodeBench, SWE-Bench Pro - Public, SWE-bench Multilingual and related benchmarks for LLM Coding Benchmark Leaderboard, making it straightforward to compare within the same task family.

Click any model name to check context length, licensing, and pricing on its detail page. See Data Methodology for scoring details.

Reference: Composite Coding Rankings

There is no single, universally accepted coding leaderboard. Static benchmarks like SWE-bench and HumanEval measure specific skills but can be gamed through targeted fine-tuning. We selected two complementary human-preference leaderboards: LMArena Coding Arena ranks models on general programming tasks (debugging, algorithms, code generation) via anonymous crowd-sourced voting; DesignArena Code Category focuses specifically on visual, front-end code generation (websites, UI components, games) using the same blind-voting methodology. Reading both together gives a fuller picture of coding capability.

LMArena Coding Arena

Full ranking

Elo ratings from anonymous A/B voting on real general coding tasks (debugging, algorithms, code generation) submitted by developers.

Updated 2026-09-02

#ModelElo
1
1552
3
1551
4
Anthropic
Opus 4.7
1547
5
1546
6
Moonshot
kimi-k3-max
1542
7
Google
gemini-3.8-flash-high
1537
9
Z.ai
glm-5.3-flash
1534
10
F
Muse Spark 1.2 (xhigh)
1533
Source: LMArena

DesignArena Code Category

Full ranking

Elo ratings from anonymous voting on visual front-end code tasks (websites, UI components, games, data viz) by Arcada Labs.

Updated 2026-09-08

#ModelElo
1
Moonshot AI
Kimi K3
1394
4
1346
5
Anthropic
Claude Opus 5
1341
7
GLM-5.3
1334
8
F
Muse Spark 1.2
1331
9
1328
10
Google Deep Mind
Gemini 3.7 Flash
1322
Source: DesignArena

Top picks

Ranked by SWE-bench Verified

LLM Performance Results

Data source: DataLearnerAI

Click any row to open the model page. Tick the checkboxes to compare up to 4 models side by side.

Claude Opus 5Anthropic
Thinking Level · HighTools
SWE-bench Verified96.00
LiveCodeBench
SWE-Bench Pro - Public79.20
SWE-bench Multilingual89.50
Proprietary
Claude Fable 5Anthropic
Thinking EnabledTools
SWE-bench Verified95.00
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
Claude Fable 5Anthropic
Deep Thinking ModeTools
SWE-bench Verified95.00
LiveCodeBench
SWE-Bench Pro - Public80.30
SWE-bench Multilingual
Proprietary
4
Claude Mythos PreviewAnthropic
Extended ThinkingTools
SWE-bench Verified93.90
LiveCodeBench
SWE-Bench Pro - Public77.80
SWE-bench Multilingual87.30
Proprietary
5
Claude Opus 4.8Anthropic
Extended ThinkingTools
SWE-bench Verified88.60
LiveCodeBench
SWE-Bench Pro - Public69.20
SWE-bench Multilingual
Proprietary
6
Opus 4.7Anthropic
Extended ThinkingTools
SWE-bench Verified87.60
LiveCodeBench
SWE-Bench Pro - Public64.30
SWE-bench Multilingual
Proprietary
7
Claude Sonnet 5Anthropic
Thinking Level · Extra HighTools
SWE-bench Verified85.20
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
8
Claude Sonnet 4.5Anthropic
Parallel · Thinking EnabledTools
SWE-bench Verified82.00
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
9
Opus 4.5Anthropic
Extended ThinkingTools
SWE-bench Verified80.90
LiveCodeBench87.00
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
10
Claude Opus 4.6Anthropic
Extended ThinkingTools
SWE-bench Verified80.84
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual72.00
Proprietary
SWE-bench Verified80.60
LiveCodeBench91.70
SWE-Bench Pro - Public54.20
SWE-bench Multilingual
Proprietary
12
DeepSeek-V4-ProDeepSeek-AI
Thinking Level · Extra HighTools
SWE-bench Verified80.60
LiveCodeBench
SWE-Bench Pro - Public55.40
SWE-bench Multilingual76.20
Free commercial
13
Qwen3.7 Max阿里巴巴
Thinking EnabledTools
SWE-bench Verified80.40
LiveCodeBench
SWE-Bench Pro - Public60.60
SWE-bench Multilingual78.30
Proprietary
14
Claude Sonnet 4Anthropic
Parallel · Thinking EnabledTools
SWE-bench Verified80.20
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
15
MiniMax M2.5MiniMaxAI
Thinking EnabledTools
SWE-bench Verified80.20
LiveCodeBench
SWE-Bench Pro - Public55.40
SWE-bench Multilingual
Free commercial
16
Kimi K2.6Moonshot AI
Thinking EnabledTools
SWE-bench Verified80.20
LiveCodeBench
SWE-Bench Pro - Public58.60
SWE-bench Multilingual76.70
Free commercial
17
GPT-5.2OpenAI
Thinking Level · Extra HighTools
SWE-bench Verified80.00
LiveCodeBench
SWE-Bench Pro - Public55.60
SWE-bench Multilingual
Proprietary
18
SWE-bench Verified79.60
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
19
DeepSeek-V4-ProDeepSeek-AI
Thinking EnabledTools
SWE-bench Verified79.40
LiveCodeBench
SWE-Bench Pro - Public54.40
SWE-bench Multilingual74.10
Free commercial
20
DeepSeek-V4-FlashDeepSeek-AI
Thinking Level · Extra HighTools
SWE-bench Verified79.00
LiveCodeBench
SWE-Bench Pro - Public52.60
SWE-bench Multilingual73.30
Free commercial
21
SWE-bench Verified78.80
LiveCodeBench
SWE-Bench Pro - Public56.60
SWE-bench Multilingual
Proprietary
22
Qwen3.6-Max-Preview阿里巴巴
Thinking EnabledTools
SWE-bench Verified78.80
LiveCodeBench
SWE-Bench Pro - Public56.60
SWE-bench Multilingual73.80
Proprietary
23
DeepSeek-V4-FlashDeepSeek-AI
Thinking EnabledTools
SWE-bench Verified78.60
LiveCodeBench
SWE-Bench Pro - Public52.30
SWE-bench Multilingual70.20
Free commercial
24
Hy3腾讯AI实验室
Thinking EnabledTools
SWE-bench Verified78.00
LiveCodeBench
SWE-Bench Pro - Public57.90
SWE-bench Multilingual75.80
Free commercial
25
GLM-5智谱AI
Thinking Enabled
SWE-bench Verified77.80
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
26
InklingThinking Machines Lab
Thinking EnabledTools
SWE-bench Verified77.60
LiveCodeBench
SWE-Bench Pro - Public54.30
SWE-bench Multilingual
Free commercial
SWE-bench Verified77.40
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
28
Claude Sonnet 4.5Anthropic
Thinking EnabledTools
SWE-bench Verified77.20
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
29
Qwen3.6-27B阿里巴巴
Thinking EnabledTools
SWE-bench Verified77.20
LiveCodeBench
SWE-Bench Pro - Public53.50
SWE-bench Multilingual71.30
Free commercial
30
GPT-5.1-Codex-MaxOpenAI
Thinking EnabledTools
SWE-bench Verified76.80
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
31
Kimi K2.5Moonshot AI
Thinking EnabledTools
SWE-bench Verified76.80
LiveCodeBench
SWE-Bench Pro - Public50.70
SWE-bench Multilingual
Free commercial
SWE-bench Verified76.50
LiveCodeBench
SWE-Bench Pro - Public46.90
SWE-bench Multilingual71.70
Proprietary
33
Qwen3.5-397B-A17B阿里巴巴
Thinking EnabledTools
SWE-bench Verified76.40
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
34
GPT-5.1OpenAI
Thinking Enabled
SWE-bench Verified76.30
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
35
GPT-5.1OpenAI
Thinking EnabledTools
SWE-bench Verified76.30
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
SWE-bench Verified76.20
LiveCodeBench92.00
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
SWE-bench Verified76.00
LiveCodeBench
SWE-Bench Pro - Public51.20
SWE-bench Multilingual
Free commercial
SWE-bench Verified75.30
LiveCodeBench85.90
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
39
o3-proOpenAI
Thinking Enabled
SWE-bench Verified75.00
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
40
M2.1MiniMaxAI
Thinking Enabled
SWE-bench Verified74.80
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
41
Opus 4.1Anthropic
Extended ThinkingTools
SWE-bench Verified74.50
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
42
GPT-5 CodexOpenAI
Thinking Enabled
SWE-bench Verified74.50
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
43
Step 3.5 FlashStepFunAI
Thinking Enabled
SWE-bench Verified74.40
LiveCodeBench86.40
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
44
GLM-4.7智谱AI
Thinking EnabledTools
SWE-bench Verified73.80
LiveCodeBench
SWE-Bench Pro - Public40.60
SWE-bench Multilingual
Free commercial
45
SWE-bench Verified73.70
LiveCodeBench
SWE-Bench Pro - Public49.10
SWE-bench Multilingual69.70
Free commercial
46
DeepSeek-V4-ProDeepSeek-AI
Standard ModeTools
SWE-bench Verified73.60
LiveCodeBench
SWE-Bench Pro - Public52.10
SWE-bench Multilingual69.80
Free commercial
47
Grok 4 HeavyxAI
Parallel · Thinking EnabledTools
SWE-bench Verified73.50
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
48
SWE-bench Verified73.40
LiveCodeBench80.40
SWE-Bench Pro - Public49.50
SWE-bench Multilingual67.20
Free commercial
49
Haiku 4.5Anthropic
Thinking EnabledTools
SWE-bench Verified73.30
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
50
DeepSeek V3.2DeepSeek-AI
Thinking EnabledTools
SWE-bench Verified73.10
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
Sort by:
Showing 50 of 238 modelsView SWE-bench Verified benchmark page