DataLearner logo
Back to Main Leaderboard

LLM Coding Benchmark Leaderboard

This page provides the LLM coding benchmark leaderboard, covering SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, and SWE-bench Multilingual datasets, comparing GPT, Claude, Qwen, and DeepSeek models.

Updated on 2026-09-09 21:31:23

As of 2026-09, this page covers SWE-bench Verified, LiveCodeBench, SWE-Bench Pro - Public, SWE-bench Multilingual and related benchmarks for LLM Coding Benchmark Leaderboard, making it straightforward to compare within the same task family.

Click any model name to check context length, licensing, and pricing on its detail page. See Data Methodology for scoring details.

Reference: Composite Coding Rankings

There is no single, universally accepted coding leaderboard. Static benchmarks like SWE-bench and HumanEval measure specific skills but can be gamed through targeted fine-tuning. We selected two complementary human-preference leaderboards: LMArena Coding Arena ranks models on general programming tasks (debugging, algorithms, code generation) via anonymous crowd-sourced voting; DesignArena Code Category focuses specifically on visual, front-end code generation (websites, UI components, games) using the same blind-voting methodology. Reading both together gives a fuller picture of coding capability.

LMArena Coding Arena

Full ranking

Elo ratings from anonymous A/B voting on real general coding tasks (debugging, algorithms, code generation) submitted by developers.

Updated 2026-09-02

#ModelElo
1
1552
3
1551
4
Anthropic
Opus 4.7
1547
5
1546
6
Moonshot
kimi-k3-max
1542
7
Google
gemini-3.8-flash-high
1537
9
Z.ai
glm-5.3-flash
1534
10
F
Muse Spark 1.2 (xhigh)
1533
Source: LMArena

DesignArena Code Category

Full ranking

Elo ratings from anonymous voting on visual front-end code tasks (websites, UI components, games, data viz) by Arcada Labs.

Updated 2026-09-08

#ModelElo
1
Moonshot AI
Kimi K3
1394
4
1346
5
Anthropic
Claude Opus 5
1341
7
GLM-5.3
1334
8
F
Muse Spark 1.2
1331
9
1328
10
Google Deep Mind
Gemini 3.7 Flash
1322
Source: DesignArena

Top picks

Ranked by SWE-Bench Pro - Public

LLM Performance Results

Data source: DataLearnerAI

Click any row to open the model page. Tick the checkboxes to compare up to 4 models side by side.

Claude Fable 5.1Anthropic
Thinking Level · HighTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public81.20
SWE-bench Multilingual89.10
Proprietary
Claude Fable 5Anthropic
Deep Thinking ModeTools
SWE-bench Verified95.00
LiveCodeBench
SWE-Bench Pro - Public80.30
SWE-bench Multilingual
Proprietary
Claude Opus 5Anthropic
Thinking Level · HighTools
SWE-bench Verified96.00
LiveCodeBench
SWE-Bench Pro - Public79.20
SWE-bench Multilingual89.50
Proprietary
4
Claude Mythos PreviewAnthropic
Extended ThinkingTools
SWE-bench Verified93.90
LiveCodeBench
SWE-Bench Pro - Public77.80
SWE-bench Multilingual87.30
Proprietary
5
Claude Opus 4.8Anthropic
Extended ThinkingTools
SWE-bench Verified88.60
LiveCodeBench
SWE-Bench Pro - Public69.20
SWE-bench Multilingual
Proprietary
6
Qwen3.8-Max阿里巴巴
Thinking Level · Extra HighTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public67.70
SWE-bench Multilingual
Conditional
7
Hy4 preview腾讯AI实验室
Thinking EnabledTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public65.70
SWE-bench Multilingual82.90
Free commercial
8
Grok 4.5xAI
Thinking EnabledTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public64.70
SWE-bench Multilingual
Proprietary
9
GPT-5.6 SolOpenAI
Thinking Level · Extra HighTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public64.60
SWE-bench Multilingual
Proprietary
10
Opus 4.7Anthropic
Extended ThinkingTools
SWE-bench Verified87.60
LiveCodeBench
SWE-Bench Pro - Public64.30
SWE-bench Multilingual
Proprietary
11
Qwen3.8-Flash-Next阿里巴巴
Thinking Level · Extra HighTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public62.50
SWE-bench Multilingual81.00
Conditional
12
GLM-5.2智谱AI
Thinking EnabledTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public62.10
SWE-bench Multilingual
Free commercial
13
Qwen3.8-27B阿里巴巴
Thinking EnabledTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public61.70
SWE-bench Multilingual
Free commercial
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public61.50
SWE-bench Multilingual
Proprietary
15
Qwen3.7 Max阿里巴巴
Thinking EnabledTools
SWE-bench Verified80.40
LiveCodeBench
SWE-Bench Pro - Public60.60
SWE-bench Multilingual78.30
Proprietary
16
MiniMax M3MiniMaxAI
Thinking EnabledTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public59.00
SWE-bench Multilingual
Non-commercial
17
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public58.70
SWE-bench Multilingual
Proprietary
18
Kimi K2.6Moonshot AI
Thinking EnabledTools
SWE-bench Verified80.20
LiveCodeBench
SWE-Bench Pro - Public58.60
SWE-bench Multilingual76.70
Free commercial
19
GPT-5.5OpenAI
Thinking EnabledTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public58.60
SWE-bench Multilingual
Proprietary
20
GLM 5.1智谱AI
Thinking EnabledTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public58.40
SWE-bench Multilingual
Free commercial
21
Hy3腾讯AI实验室
Thinking EnabledTools
SWE-bench Verified78.00
LiveCodeBench
SWE-Bench Pro - Public57.90
SWE-bench Multilingual75.80
Free commercial
22
GPT-5.4OpenAI
Thinking Level · Extra High
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public57.70
SWE-bench Multilingual
Proprietary
23
Qwen3.6-Max-Preview阿里巴巴
Deep Thinking ModeTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public57.30
SWE-bench Multilingual
Proprietary
24
GPT-5.3 CodexOpenAI
Thinking Level · Extra High
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public56.80
SWE-bench Multilingual
Proprietary
25
SWE-bench Verified78.80
LiveCodeBench
SWE-Bench Pro - Public56.60
SWE-bench Multilingual
Proprietary
26
Qwen3.6-Max-Preview阿里巴巴
Thinking EnabledTools
SWE-bench Verified78.80
LiveCodeBench
SWE-Bench Pro - Public56.60
SWE-bench Multilingual73.80
Proprietary
SWE-bench Verified
LiveCodeBench87.10
SWE-Bench Pro - Public56.60
SWE-bench Multilingual73.80
Proprietary
28
Step 3.7 FlashStepFunAI
Thinking EnabledTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public56.30
SWE-bench Multilingual
Free commercial
29
MiniMax-M2.7MiniMaxAI
Thinking EnabledTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public56.20
SWE-bench Multilingual
Non-commercial
30
GPT-5.2OpenAI
Thinking Level · Extra HighTools
SWE-bench Verified80.00
LiveCodeBench
SWE-Bench Pro - Public55.60
SWE-bench Multilingual
Proprietary
31
DeepSeek-V4-ProDeepSeek-AI
Thinking Level · Extra HighTools
SWE-bench Verified80.60
LiveCodeBench
SWE-Bench Pro - Public55.40
SWE-bench Multilingual76.20
Free commercial
32
MiniMax M2.5MiniMaxAI
Thinking EnabledTools
SWE-bench Verified80.20
LiveCodeBench
SWE-Bench Pro - Public55.40
SWE-bench Multilingual
Free commercial
33
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public55.10
SWE-bench Multilingual
Proprietary
34
DeepSeek-V4-ProDeepSeek-AI
Thinking EnabledTools
SWE-bench Verified79.40
LiveCodeBench
SWE-Bench Pro - Public54.40
SWE-bench Multilingual74.10
Free commercial
35
GPT-5.4 miniOpenAI
Thinking Level · Extra HighTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public54.40
SWE-bench Multilingual
Proprietary
36
InklingThinking Machines Lab
Thinking EnabledTools
SWE-bench Verified77.60
LiveCodeBench
SWE-Bench Pro - Public54.30
SWE-bench Multilingual
Free commercial
SWE-bench Verified80.60
LiveCodeBench91.70
SWE-Bench Pro - Public54.20
SWE-bench Multilingual
Proprietary
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public54.20
SWE-bench Multilingual
Proprietary
39
Qwen3.6-27B阿里巴巴
Thinking EnabledTools
SWE-bench Verified77.20
LiveCodeBench
SWE-Bench Pro - Public53.50
SWE-bench Multilingual71.30
Free commercial
40
DeepSeek-V4-FlashDeepSeek-AI
Thinking Level · Extra HighTools
SWE-bench Verified79.00
LiveCodeBench
SWE-Bench Pro - Public52.60
SWE-bench Multilingual73.30
Free commercial
41
GPT-5.4 nanoOpenAI
Thinking Level · Extra HighTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public52.40
SWE-bench Multilingual
Proprietary
42
DeepSeek-V4-FlashDeepSeek-AI
Thinking EnabledTools
SWE-bench Verified78.60
LiveCodeBench
SWE-Bench Pro - Public52.30
SWE-bench Multilingual70.20
Free commercial
43
DeepSeek-V4-ProDeepSeek-AI
Standard ModeTools
SWE-bench Verified73.60
LiveCodeBench
SWE-Bench Pro - Public52.10
SWE-bench Multilingual69.80
Free commercial
SWE-bench Verified76.00
LiveCodeBench
SWE-Bench Pro - Public51.20
SWE-bench Multilingual
Free commercial
SWE-bench Verified
LiveCodeBench83.60
SWE-Bench Pro - Public50.90
SWE-bench Multilingual69.30
Free commercial
46
GPT-5.1OpenAI
Thinking Enabled
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public50.80
SWE-bench Multilingual
Proprietary
47
Kimi K2.5Moonshot AI
Thinking EnabledTools
SWE-bench Verified76.80
LiveCodeBench
SWE-Bench Pro - Public50.70
SWE-bench Multilingual
Free commercial
48
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public49.60
SWE-bench Multilingual
Proprietary
49
SWE-bench Verified73.40
LiveCodeBench80.40
SWE-Bench Pro - Public49.50
SWE-bench Multilingual67.20
Free commercial
50
SWE-bench Verified73.70
LiveCodeBench
SWE-Bench Pro - Public49.10
SWE-bench Multilingual69.70
Free commercial
Sort by:
Showing 50 of 238 modelsView SWE-Bench Pro - Public benchmark page