DataLearner logo
Back to Main Leaderboard

LLM Coding Benchmark Leaderboard

This page provides the LLM coding benchmark leaderboard, covering SWE-Bench Verified, SWE-Bench Pro, LiveCodeBench, and SWE-bench Multilingual datasets, comparing GPT, Claude, Qwen, and DeepSeek models.

Updated on 2026-09-09 21:31:23

As of 2026-09, this page covers SWE-bench Verified, LiveCodeBench, SWE-Bench Pro - Public, SWE-bench Multilingual and related benchmarks for LLM Coding Benchmark Leaderboard, making it straightforward to compare within the same task family.

Click any model name to check context length, licensing, and pricing on its detail page. See Data Methodology for scoring details.

Reference: Composite Coding Rankings

There is no single, universally accepted coding leaderboard. Static benchmarks like SWE-bench and HumanEval measure specific skills but can be gamed through targeted fine-tuning. We selected two complementary human-preference leaderboards: LMArena Coding Arena ranks models on general programming tasks (debugging, algorithms, code generation) via anonymous crowd-sourced voting; DesignArena Code Category focuses specifically on visual, front-end code generation (websites, UI components, games) using the same blind-voting methodology. Reading both together gives a fuller picture of coding capability.

LMArena Coding Arena

Full ranking

Elo ratings from anonymous A/B voting on real general coding tasks (debugging, algorithms, code generation) submitted by developers.

Updated 2026-09-02

#ModelElo
1
1552
3
1551
4
Anthropic
Opus 4.7
1547
5
1546
6
Moonshot
kimi-k3-max
1542
7
Google
gemini-3.8-flash-high
1537
9
Z.ai
glm-5.3-flash
1534
10
F
Muse Spark 1.2 (xhigh)
1533
Source: LMArena

DesignArena Code Category

Full ranking

Elo ratings from anonymous voting on visual front-end code tasks (websites, UI components, games, data viz) by Arcada Labs.

Updated 2026-09-08

#ModelElo
1
Moonshot AI
Kimi K3
1394
4
1346
5
Anthropic
Claude Opus 5
1341
7
GLM-5.3
1334
8
F
Muse Spark 1.2
1331
9
1328
10
Google Deep Mind
Gemini 3.7 Flash
1322
Source: DesignArena

Top picks

Ranked by LiveCodeBench

LLM Performance Results

Data source: DataLearnerAI

Click any row to open the model page. Tick the checkboxes to compare up to 4 models side by side.

DeepSeek-V4-ProDeepSeek-AI
Thinking Level · High
SWE-bench Verified
LiveCodeBench93.50
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
SWE-bench Verified76.20
LiveCodeBench92.00
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
Qwen3.8-Flash-Next阿里巴巴
Thinking Level · Extra High
SWE-bench Verified
LiveCodeBench91.90
SWE-Bench Pro - Public
SWE-bench Multilingual
Conditional
SWE-bench Verified80.60
LiveCodeBench91.70
SWE-Bench Pro - Public54.20
SWE-bench Multilingual
Proprietary
5
Qwen3.7 Max阿里巴巴
Thinking Level · High
SWE-bench Verified
LiveCodeBench91.60
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
6
DeepSeek-V4-FlashDeepSeek-AI
Thinking Level · High
SWE-bench Verified
LiveCodeBench91.60
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
7
Qwen3.8-27B阿里巴巴
Thinking Enabled
SWE-bench Verified
LiveCodeBench90.30
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
SWE-bench Verified
LiveCodeBench89.80
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
9
Kimi K2.6Moonshot AI
Thinking Enabled
SWE-bench Verified
LiveCodeBench89.60
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
10
Nemotron 3 UltraNVIDIA
Thinking Enabled
SWE-bench Verified
LiveCodeBench89.00
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
SWE-bench Verified
LiveCodeBench88.40
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
SWE-bench Verified
LiveCodeBench87.60
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
13
Qwen3.6-Max-Preview阿里巴巴
Thinking Level · High
SWE-bench Verified
LiveCodeBench87.10
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
SWE-bench Verified
LiveCodeBench87.10
SWE-Bench Pro - Public56.60
SWE-bench Multilingual73.80
Proprietary
15
Opus 4.5Anthropic
Extended ThinkingTools
SWE-bench Verified80.90
LiveCodeBench87.00
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
16
Step 3.5 FlashStepFunAI
Thinking Enabled
SWE-bench Verified74.40
LiveCodeBench86.40
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
SWE-bench Verified75.30
LiveCodeBench85.90
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
18
GPT-5.1 CodexOpenAI
Thinking EnabledTools
SWE-bench Verified70.40
LiveCodeBench85.50
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
19
Kimi K2.5Moonshot AI
Thinking Enabled
SWE-bench Verified
LiveCodeBench85.00
SWE-Bench Pro - Public
SWE-bench Multilingual73.00
Free commercial
20
GLM-4.7智谱AI
Thinking Enabled
SWE-bench Verified
LiveCodeBench84.90
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
21
GLM-4.6智谱AI
Thinking EnabledTools
SWE-bench Verified68.00
LiveCodeBench84.50
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
22
Qwen3.6-27B阿里巴巴
Thinking Enabled
SWE-bench Verified
LiveCodeBench83.90
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
SWE-bench Verified
LiveCodeBench83.60
SWE-Bench Pro - Public50.90
SWE-bench Multilingual69.30
Free commercial
24
DeepSeek V3.2DeepSeek-AI
Thinking Enabled
SWE-bench Verified70.20
LiveCodeBench83.30
SWE-Bench Pro - Public40.90
SWE-bench Multilingual
Free commercial
25
SWE-bench Verified
LiveCodeBench83.10
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
26
MiniMax M2MiniMaxAI
Thinking Enabled
SWE-bench Verified
LiveCodeBench83.00
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
27
GLM-4.6智谱AI
Thinking Enabled
SWE-bench Verified
LiveCodeBench82.80
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
28
Grok 4xAI
Thinking Enabled
SWE-bench Verified58.60
LiveCodeBench82.00
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
29
Grok 4.1 FastxAI
Thinking Enabled
SWE-bench Verified
LiveCodeBench82.00
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
30
Qwen3.5-27B阿里巴巴
Thinking EnabledTools
SWE-bench Verified
LiveCodeBench80.70
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
31
SWE-bench Verified73.40
LiveCodeBench80.40
SWE-Bench Pro - Public49.50
SWE-bench Multilingual67.20
Free commercial
SWE-bench Verified
LiveCodeBench80.40
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
33
Gemma 4 31BDeepMind
Thinking Enabled
SWE-bench Verified
LiveCodeBench80.00
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
SWE-bench Verified
LiveCodeBench80.00
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
35
Grok 4 FastxAI
Thinking Enabled
SWE-bench Verified
LiveCodeBench80.00
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
SWE-bench Verified
LiveCodeBench79.40
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
SWE-bench Verified63.20
LiveCodeBench77.10
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
38
Gemma 4 26B A4BDeepMind
Thinking Enabled
SWE-bench Verified
LiveCodeBench77.10
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
SWE-bench Verified
LiveCodeBench77.10
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
40
ERNIE 5.0百度
Thinking Enabled
SWE-bench Verified
LiveCodeBench76.21
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
41
Claude Opus 4.6Anthropic
Extended Thinking
SWE-bench Verified
LiveCodeBench76.00
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
SWE-bench Verified
LiveCodeBench75.80
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
SWE-bench Verified68.40
LiveCodeBench74.90
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
44
DeepSeek-V3.1DeepSeek-AI
Thinking Enabled
SWE-bench Verified
LiveCodeBench74.80
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
SWE-bench Verified
LiveCodeBench74.10
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
SWE-bench Verified
LiveCodeBench74.10
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
SWE-bench Verified
LiveCodeBench74.10
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
SWE-bench Verified
LiveCodeBench73.80
SWE-Bench Pro - Public
SWE-bench Multilingual
Proprietary
49
SWE-bench Verified57.60
LiveCodeBench73.30
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
50
GLM-4.5智谱AI
Thinking Enabled
SWE-bench Verified64.20
LiveCodeBench72.90
SWE-Bench Pro - Public
SWE-bench Multilingual
Free commercial
Sort by:
Showing 50 of 238 modelsView LiveCodeBench benchmark page