DataLearner logo
Back to Main Leaderboard

LLM Coding Benchmark Leaderboard

This page provides the LLM coding benchmark leaderboard, covering SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, and SWE-bench Multilingual datasets, comparing GPT, Claude, Qwen, and DeepSeek models.

Updated on 2026-09-09 21:31:23

As of 2026-09, this page covers SWE-bench Verified, LiveCodeBench, SWE-Bench Pro - Public, SWE-bench Multilingual and related benchmarks for LLM Coding Benchmark Leaderboard, making it straightforward to compare within the same task family.

Click any model name to check context length, licensing, and pricing on its detail page. See Data Methodology for scoring details.

Reference: Composite Coding Rankings

There is no single, universally accepted coding leaderboard. Static benchmarks like SWE-bench and HumanEval measure specific skills but can be gamed through targeted fine-tuning. We selected two complementary human-preference leaderboards: LMArena Coding Arena ranks models on general programming tasks (debugging, algorithms, code generation) via anonymous crowd-sourced voting; DesignArena Code Category focuses specifically on visual, front-end code generation (websites, UI components, games) using the same blind-voting methodology. Reading both together gives a fuller picture of coding capability.

LMArena Coding Arena

Full ranking

Elo ratings from anonymous A/B voting on real general coding tasks (debugging, algorithms, code generation) submitted by developers.

Updated 2026-09-02

#ModelElo
1
1552
3
1551
4
Anthropic
Opus 4.7
1547
5
1546
6
Moonshot
kimi-k3-max
1542
7
Google
gemini-3.8-flash-high
1537
9
Z.ai
glm-5.3-flash
1534
10
F
Muse Spark 1.2 (xhigh)
1533
Source: LMArena

DesignArena Code Category

Full ranking

Elo ratings from anonymous voting on visual front-end code tasks (websites, UI components, games, data viz) by Arcada Labs.

Updated 2026-09-08

#ModelElo
1
Moonshot AI
Kimi K3
1394
4
1346
5
Anthropic
Claude Opus 5
1341
7
GLM-5.3
1334
8
F
Muse Spark 1.2
1331
9
1328
10
Google Deep Mind
Gemini 3.7 Flash
1322
Source: DesignArena

Top picks

Ranked by SWE-bench Multilingual

LLM Performance Results

Data source: DataLearnerAI

Click any row to open the model page. Tick the checkboxes to compare up to 4 models side by side.

Claude Opus 5Anthropic
Thinking Level · HighTools
SWE-bench Verified96.00
LiveCodeBench
SWE-Bench Pro - Public79.20
SWE-bench Multilingual89.50
Proprietary
Claude Fable 5.1Anthropic
Thinking Level · HighTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public81.20
SWE-bench Multilingual89.10
Proprietary
Claude Mythos PreviewAnthropic
Extended ThinkingTools
SWE-bench Verified93.90
LiveCodeBench
SWE-Bench Pro - Public77.80
SWE-bench Multilingual87.30
Proprietary
4
Hy4 preview腾讯AI实验室
Thinking EnabledTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public65.70
SWE-bench Multilingual82.90
Free commercial
5
Qwen3.8-Flash-Next阿里巴巴
Thinking Level · Extra HighTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public62.50
SWE-bench Multilingual81.00
Conditional
6
Composer 2.5Cursor
Thinking Enabled
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual79.80
Proprietary
7
Qwen3.7 Max阿里巴巴
Thinking EnabledTools
SWE-bench Verified80.40
LiveCodeBench
SWE-Bench Pro - Public60.60
SWE-bench Multilingual78.30
Proprietary
8
Kimi K2.6Moonshot AI
Thinking EnabledTools
SWE-bench Verified80.20
LiveCodeBench
SWE-Bench Pro - Public58.60
SWE-bench Multilingual76.70
Free commercial
9
MiniMax-M2.7MiniMaxAI
Thinking EnabledTools
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual76.50
Non-commercial
10
DeepSeek-V4-ProDeepSeek-AI
Thinking Level · Extra HighTools
SWE-bench Verified80.60
LiveCodeBench
SWE-Bench Pro - Public55.40
SWE-bench Multilingual76.20
Free commercial
11
Hy3腾讯AI实验室
Thinking EnabledTools
SWE-bench Verified78.00
LiveCodeBench
SWE-Bench Pro - Public57.90
SWE-bench Multilingual75.80
Free commercial
12
DeepSeek-V4-ProDeepSeek-AI
Thinking EnabledTools
SWE-bench Verified79.40
LiveCodeBench
SWE-Bench Pro - Public54.40
SWE-bench Multilingual74.10
Free commercial
13
Qwen3.6-Max-Preview阿里巴巴
Thinking EnabledTools
SWE-bench Verified78.80
LiveCodeBench
SWE-Bench Pro - Public56.60
SWE-bench Multilingual73.80
Proprietary
SWE-bench Verified
LiveCodeBench87.10
SWE-Bench Pro - Public56.60
SWE-bench Multilingual73.80
Proprietary
15
Composer 2Cursor
Thinking Enabled
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual73.70
Proprietary
16
DeepSeek-V4-FlashDeepSeek-AI
Thinking Level · Extra HighTools
SWE-bench Verified79.00
LiveCodeBench
SWE-Bench Pro - Public52.60
SWE-bench Multilingual73.30
Free commercial
17
Kimi K2.5Moonshot AI
Thinking Enabled
SWE-bench Verified
LiveCodeBench85.00
SWE-Bench Pro - Public
SWE-bench Multilingual73.00
Free commercial
18
Claude Opus 4.6Anthropic
Extended ThinkingTools
SWE-bench Verified80.84
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual72.00
Proprietary
SWE-bench Verified76.50
LiveCodeBench
SWE-Bench Pro - Public46.90
SWE-bench Multilingual71.70
Proprietary
20
Qwen3.6-27B阿里巴巴
Thinking EnabledTools
SWE-bench Verified77.20
LiveCodeBench
SWE-Bench Pro - Public53.50
SWE-bench Multilingual71.30
Free commercial
21
DeepSeek-V4-FlashDeepSeek-AI
Thinking EnabledTools
SWE-bench Verified78.60
LiveCodeBench
SWE-Bench Pro - Public52.30
SWE-bench Multilingual70.20
Free commercial
22
DeepSeek-V4-ProDeepSeek-AI
Standard ModeTools
SWE-bench Verified73.60
LiveCodeBench
SWE-Bench Pro - Public52.10
SWE-bench Multilingual69.80
Free commercial
23
SWE-bench Verified73.70
LiveCodeBench
SWE-Bench Pro - Public49.10
SWE-bench Multilingual69.70
Free commercial
SWE-bench Verified
LiveCodeBench83.60
SWE-Bench Pro - Public50.90
SWE-bench Multilingual69.30
Free commercial
25
Nemotron 3 UltraNVIDIA
Thinking EnabledTools
SWE-bench Verified70.70
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual67.70
Free commercial
26
SWE-bench Verified73.40
LiveCodeBench80.40
SWE-Bench Pro - Public49.50
SWE-bench Multilingual67.20
Free commercial
27
Composer 1.5Cursor
Thinking Enabled
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual65.90
Proprietary
28
Composer 1Cursor
Thinking Enabled
SWE-bench Verified
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual56.90
Proprietary
29
Spark-X2.5-4B科大讯飞
Thinking EnabledTools
SWE-bench Verified41.60
LiveCodeBench
SWE-Bench Pro - Public44.40
SWE-bench Multilingual53.30
Free commercial
30
Claude Fable 5Anthropic
Thinking EnabledTools
SWE-bench Verified95.00
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
31
Claude Fable 5Anthropic
Deep Thinking ModeTools
SWE-bench Verified95.00
LiveCodeBench
SWE-Bench Pro - Public80.30
SWE-bench Multilingual
Proprietary
32
Claude Opus 4.8Anthropic
Extended ThinkingTools
SWE-bench Verified88.60
LiveCodeBench
SWE-Bench Pro - Public69.20
SWE-bench Multilingual
Proprietary
33
Opus 4.7Anthropic
Extended ThinkingTools
SWE-bench Verified87.60
LiveCodeBench
SWE-Bench Pro - Public64.30
SWE-bench Multilingual
Proprietary
34
Claude Sonnet 5Anthropic
Thinking Level · Extra HighTools
SWE-bench Verified85.20
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
35
Claude Sonnet 4.5Anthropic
Parallel · Thinking EnabledTools
SWE-bench Verified82.00
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
36
Opus 4.5Anthropic
Extended ThinkingTools
SWE-bench Verified80.90
LiveCodeBench87.00
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
SWE-bench Verified80.60
LiveCodeBench91.70
SWE-Bench Pro - Public54.20
SWE-bench Multilingual
Proprietary
38
Claude Sonnet 4Anthropic
Parallel · Thinking EnabledTools
SWE-bench Verified80.20
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
39
MiniMax M2.5MiniMaxAI
Thinking EnabledTools
SWE-bench Verified80.20
LiveCodeBench
SWE-Bench Pro - Public55.40
SWE-bench Multilingual
Free commercial
40
GPT-5.2OpenAI
Thinking Level · Extra HighTools
SWE-bench Verified80.00
LiveCodeBench
SWE-Bench Pro - Public55.60
SWE-bench Multilingual
Proprietary
41
SWE-bench Verified79.60
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
42
SWE-bench Verified78.80
LiveCodeBench
SWE-Bench Pro - Public56.60
SWE-bench Multilingual
Proprietary
43
GLM-5智谱AI
Thinking Enabled
SWE-bench Verified77.80
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
44
InklingThinking Machines Lab
Thinking EnabledTools
SWE-bench Verified77.60
LiveCodeBench
SWE-Bench Pro - Public54.30
SWE-bench Multilingual
Free commercial
SWE-bench Verified77.40
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
46
Claude Sonnet 4.5Anthropic
Thinking EnabledTools
SWE-bench Verified77.20
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
47
GPT-5.1-Codex-MaxOpenAI
Thinking EnabledTools
SWE-bench Verified76.80
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
48
Kimi K2.5Moonshot AI
Thinking EnabledTools
SWE-bench Verified76.80
LiveCodeBench
SWE-Bench Pro - Public50.70
SWE-bench Multilingual
Free commercial
49
Qwen3.5-397B-A17B阿里巴巴
Thinking EnabledTools
SWE-bench Verified76.40
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
50
GPT-5.1OpenAI
Thinking Enabled
SWE-bench Verified76.30
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
Sort by:
Showing 50 of 238 modelsView SWE-bench Multilingual benchmark page