大模型代码编程能力评测排行榜
本页面提供大模型代码编程能力评测排行榜,涵盖 SWE-Bench Verified、SWE-Bench Pro、LiveCodeBench、SWE-bench Multilingual 等数据集,对 GPT、Claude、Qwen、DeepSeek 等模型进行对比。
数据更新于 2026-06-17 07:42:33
截至 2026年6月,本页覆盖 SWE-bench Verified, LiveCodeBench, SWE-Bench Pro - Public, SWE-bench Multilingual 等评测基准,聚焦 大模型代码编程能力评测排行榜 方向的模型对比。
点击模型名称可进入详情页查看上下文长度、许可方式与 API 价格。数据口径说明见 数据方法论。
代码能力参考综合排名
目前没有一个被普遍认可的代码能力综合排行榜。SWE-bench、HumanEval 等静态基准可以衡量特定技能,但容易被针对性优化("刷榜")。为此我们选取了两个切入角度不同的人类偏好参考榜单并列展示:LMArena Coding Arena 通过匿名盲测评测通用编程能力(调试、算法实现、代码生成等);DesignArena Code Category 专注评测具有视觉呈现效果的前端代码生成(网站、UI 组件、游戏等),两者方法论相同但考察场景各异,结合参考效果最佳。
#模型Elo
来源:LMArena
DesignArena Code Category
完整排名基于 Arcada Labs 平台,对视觉前端代码任务(网站、UI 组件、游戏、数据可视化等)进行匿名投票,Bradley-Terry 模型动态排名。
数据更新于 2026-06-19
#模型Elo
来源:DesignArena
榜单亮点
按 SWE-bench Verified 排序大模型性能评测结果
数据来源:DataLearnerAI点击任意行查看模型详情;勾选左侧 可对比最多 4 个模型。
SWE-bench Verified93.90
LiveCodeBench—
SWE-Bench Pro - Public77.80
SWE-bench Multilingual87.30
闭源
SWE-bench Verified88.60
LiveCodeBench—
SWE-Bench Pro - Public69.20
SWE-bench Multilingual—
闭源
SWE-bench Verified87.60
LiveCodeBench—
SWE-Bench Pro - Public64.30
SWE-bench Multilingual—
闭源
SWE-bench Verified82.00
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified82.00
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified80.90
LiveCodeBench87.00
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified80.84
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual72.00
闭源
SWE-bench Verified80.60
LiveCodeBench91.70
SWE-Bench Pro - Public54.20
SWE-bench Multilingual—
闭源
SWE-bench Verified80.60
LiveCodeBench—
SWE-Bench Pro - Public55.40
SWE-bench Multilingual76.20
免费商用
SWE-bench Verified80.40
LiveCodeBench—
SWE-Bench Pro - Public60.60
SWE-bench Multilingual78.30
闭源
SWE-bench Verified80.20
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified80.20
LiveCodeBench—
SWE-Bench Pro - Public55.40
SWE-bench Multilingual—
免费商用
SWE-bench Verified80.20
LiveCodeBench—
SWE-Bench Pro - Public58.60
SWE-bench Multilingual76.70
免费商用
SWE-bench Verified80.00
LiveCodeBench—
SWE-Bench Pro - Public55.60
SWE-bench Multilingual—
闭源
SWE-bench Verified79.60
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified79.40
LiveCodeBench—
SWE-Bench Pro - Public54.40
SWE-bench Multilingual74.10
免费商用
SWE-bench Verified79.00
LiveCodeBench—
SWE-Bench Pro - Public52.60
SWE-bench Multilingual73.30
免费商用
SWE-bench Verified78.80
LiveCodeBench—
SWE-Bench Pro - Public56.60
SWE-bench Multilingual—
闭源
SWE-bench Verified78.80
LiveCodeBench—
SWE-Bench Pro - Public56.60
SWE-bench Multilingual73.80
闭源
SWE-bench Verified78.60
LiveCodeBench—
SWE-Bench Pro - Public52.30
SWE-bench Multilingual70.20
免费商用
SWE-bench Verified77.80
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
SWE-bench Verified77.40
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified77.20
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified77.20
LiveCodeBench—
SWE-Bench Pro - Public53.50
SWE-bench Multilingual71.30
免费商用
SWE-bench Verified76.80
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified76.80
LiveCodeBench—
SWE-Bench Pro - Public50.70
SWE-bench Multilingual—
免费商用
SWE-bench Verified76.40
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
SWE-bench Verified76.30
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified76.30
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified76.20
LiveCodeBench92.00
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified75.30
LiveCodeBench85.90
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified75.00
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified74.80
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
SWE-bench Verified74.50
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified74.50
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified74.40
LiveCodeBench86.40
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
SWE-bench Verified73.80
LiveCodeBench—
SWE-Bench Pro - Public40.60
SWE-bench Multilingual—
免费商用
SWE-bench Verified73.70
LiveCodeBench—
SWE-Bench Pro - Public49.10
SWE-bench Multilingual69.70
免费商用
SWE-bench Verified73.60
LiveCodeBench—
SWE-Bench Pro - Public52.10
SWE-bench Multilingual69.80
免费商用
SWE-bench Verified73.50
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified73.40
LiveCodeBench80.40
SWE-Bench Pro - Public49.50
SWE-bench Multilingual67.20
免费商用
SWE-bench Verified73.30
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified73.10
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
SWE-bench Verified72.80
LiveCodeBench—
SWE-Bench Pro - Public36.30
SWE-bench Multilingual—
闭源
SWE-bench Verified72.70
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified72.50
LiveCodeBench56.60
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
SWE-bench Verified72.40
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
免费商用
SWE-bench Verified72.00
LiveCodeBench—
SWE-Bench Pro - Public—
SWE-bench Multilingual—
闭源
排序:
已显示 50 / 211 个模型查看 SWE-bench Verified 基准测试完整页面









