DataLearner 标志
返回总榜单

大模型代码编程能力评测排行榜

本页面提供大模型代码编程能力评测排行榜,涵盖 SWE-Bench Verified、SWE-Bench Pro、LiveCodeBench、SWE-bench Multilingual 等数据集,对 GPT、Claude、Qwen、DeepSeek 等模型进行对比。

数据更新于 2026-08-16 18:02:26

截至 2026年8月,本页覆盖 SWE-bench Verified, LiveCodeBench, SWE-Bench Pro - Public, SWE-bench Multilingual 等评测基准,聚焦 大模型代码编程能力评测排行榜 方向的模型对比。

点击模型名称可进入详情页查看上下文长度、许可方式与 API 价格。数据口径说明见 数据方法论

代码能力参考综合排名

目前没有一个被普遍认可的代码能力综合排行榜。SWE-bench、HumanEval 等静态基准可以衡量特定技能,但容易被针对性优化("刷榜")。为此我们选取了两个切入角度不同的人类偏好参考榜单并列展示:LMArena Coding Arena 通过匿名盲测评测通用编程能力(调试、算法实现、代码生成等);DesignArena Code Category 专注评测具有视觉呈现效果的前端代码生成(网站、UI 组件、游戏等),两者方法论相同但考察场景各异,结合参考效果最佳。

LMArena Coding Arena

完整排名

基于真实开发者提交的通用编程任务(调试、算法、代码生成)进行匿名 A/B 盲测投票,Elo 算法动态排名。

数据更新于 2026-08-12

#模型Elo
1
1554
2
Anthropic
claude-opus-4-7-high
1552
3
Anthropic
claude-opus-4-6-high
1551
4
Anthropic
Opus 4.7
1548
5
1547
6
Moonshot
kimi-k3-max
1544
7
Anthropic
claude-opus-4-8-high
1533
8
Meta
muse-spark-1.2 (xHigh)
1533
9
Anthropic
claude-opus-5-high
1531
10
F
Muse Spark 1.1
1531
来源:LMArena

DesignArena Code Category

完整排名

基于 Arcada Labs 平台,对视觉前端代码任务(网站、UI 组件、游戏、数据可视化等)进行匿名投票,Bradley-Terry 模型动态排名。

数据更新于 2026-08-16

#模型Elo
1
Moonshot AI
Kimi K3
1403
2
Anthropic
Claude Opus 5
1347
4
Meta
Muse Spark 1.2
1340
5
1334
6
GLM-5.2
1329
7
xAI
Grok 4.6
1327
8
Alibaba
Qwen3.8 Max
1322
9
Anthropic
Opus 4.7
1310
10
1309
来源:DesignArena

榜单亮点

按 SWE-bench Verified 排序

大模型性能评测结果

数据来源:DataLearnerAI

点击任意行查看模型详情;勾选左侧 可对比最多 4 个模型

Claude Opus 5Anthropic
思考水平 · 高工具
SWE-bench Verified96.00
LiveCodeBench
SWE-Bench Pro - Public79.20
SWE-bench Multilingual89.50
闭源
Claude Fable 5Anthropic
开启思考工具
SWE-bench Verified95.00
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
Claude Fable 5Anthropic
深度思考模式工具
SWE-bench Verified95.00
LiveCodeBench
SWE-Bench Pro - Public80.30
SWE-bench Multilingual
闭源
SWE-bench Verified93.90
LiveCodeBench
SWE-Bench Pro - Public77.80
SWE-bench Multilingual87.30
闭源
5
Claude Opus 4.8Anthropic
扩展思考工具
SWE-bench Verified88.60
LiveCodeBench
SWE-Bench Pro - Public69.20
SWE-bench Multilingual
闭源
6
Opus 4.7Anthropic
扩展思考工具
SWE-bench Verified87.60
LiveCodeBench
SWE-Bench Pro - Public64.30
SWE-bench Multilingual
闭源
7
Claude Sonnet 5Anthropic
思考水平 · 极高工具
SWE-bench Verified85.20
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
8
Claude Sonnet 4.5Anthropic
并行 · 开启思考工具
SWE-bench Verified82.00
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
9
Opus 4.5Anthropic
扩展思考工具
SWE-bench Verified80.90
LiveCodeBench87.00
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
10
Claude Opus 4.6Anthropic
扩展思考工具
SWE-bench Verified80.84
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual72.00
闭源
SWE-bench Verified80.60
LiveCodeBench91.70
SWE-Bench Pro - Public54.20
SWE-bench Multilingual
闭源
12
Qwen3.7 Max阿里巴巴
开启思考工具
SWE-bench Verified80.40
LiveCodeBench
SWE-Bench Pro - Public60.60
SWE-bench Multilingual78.30
闭源
13
Claude Sonnet 4Anthropic
并行 · 开启思考工具
SWE-bench Verified80.20
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
14
GPT-5.2OpenAI
思考水平 · 极高工具
SWE-bench Verified80.00
LiveCodeBench
SWE-Bench Pro - Public55.60
SWE-bench Multilingual
闭源
SWE-bench Verified79.60
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
SWE-bench Verified78.80
LiveCodeBench
SWE-Bench Pro - Public56.60
SWE-bench Multilingual
闭源
SWE-bench Verified78.80
LiveCodeBench
SWE-Bench Pro - Public56.60
SWE-bench Multilingual73.80
闭源
SWE-bench Verified77.40
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
19
Claude Sonnet 4.5Anthropic
开启思考工具
SWE-bench Verified77.20
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
20
GPT-5.1-Codex-MaxOpenAI
思考水平 · 高工具
SWE-bench Verified76.80
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
SWE-bench Verified76.50
LiveCodeBench
SWE-Bench Pro - Public46.90
SWE-bench Multilingual71.70
闭源
22
GPT-5.1OpenAI
思考水平 · 高
SWE-bench Verified76.30
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
23
GPT-5.1OpenAI
开启思考工具
SWE-bench Verified76.30
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
SWE-bench Verified76.20
LiveCodeBench92.00
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
SWE-bench Verified75.30
LiveCodeBench85.90
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
26
o3-proOpenAI
思考水平 · 高
SWE-bench Verified75.00
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
27
Opus 4.1Anthropic
扩展思考工具
SWE-bench Verified74.50
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
28
GPT-5 CodexOpenAI
思考水平 · 高
SWE-bench Verified74.50
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
29
Grok 4 HeavyxAI
并行 · 开启思考工具
SWE-bench Verified73.50
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
30
Haiku 4.5Anthropic
开启思考工具
SWE-bench Verified73.30
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
31
GPT-5OpenAI
思考水平 · 高
SWE-bench Verified72.80
LiveCodeBench
SWE-Bench Pro - Public36.30
SWE-bench Multilingual
闭源
32
Claude Sonnet 4Anthropic
开启思考工具
SWE-bench Verified72.70
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
SWE-bench Verified72.50
LiveCodeBench56.60
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
SWE-bench Verified72.00
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
35
SWE-bench Verified70.80
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
36
GPT-5.1 CodexOpenAI
思考水平 · 高工具
SWE-bench Verified70.40
LiveCodeBench85.50
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
37
Claude Sonnet 3.7Anthropic
开启思考工具
SWE-bench Verified70.30
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
SWE-bench Verified69.60
LiveCodeBench57.50
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
39
OpenAI o3OpenAI
开启思考
SWE-bench Verified69.10
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
SWE-bench Verified68.70
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
SWE-bench Verified68.10
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
SWE-bench Verified67.20
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
SWE-bench Verified63.80
LiveCodeBench70.40
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
SWE-bench Verified63.20
LiveCodeBench77.10
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
45
Claude Sonnet 3.7Anthropic
常规模式工具
SWE-bench Verified62.30
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
SWE-bench Verified61.60
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
47
Haiku 4.5Anthropic
常规模式工具
SWE-bench Verified60.60
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
48
Grok 4xAI
开启思考
SWE-bench Verified58.60
LiveCodeBench82.00
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
SWE-bench Verified54.60
LiveCodeBench40.50
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
SWE-bench Verified54.60
LiveCodeBench
SWE-Bench Pro - Public
SWE-bench Multilingual
闭源
排序:
已显示 50 / 113 个模型查看 SWE-bench Verified 基准测试完整页面