DataLearner 标志

Arcada Labs Code Categories Arena 代码能力排行榜

基于 Arcada Labs Code Categories Arena 用户匿名投票的最新AI大模型代码能力排行榜,通过 Bradley-Terry 模型对 Website、UI Component、Game Dev、Data Visualization 等代码子类别进行综合评分与排名。

榜首模型

Kimi K3

最高得分

1394.00

模型数量

163

数据版本

2026年09月08日

数据来源: Arcada Labs

榜单历史快照月份:

排名总表

排名模型名称得分95% CI投票数机构许可证
Moonshot AIKimi K3Moonshot AI1394.00+/-9.65,844Moonshot AIOpen Source
14AlibabaQwen3.8 MaxAlibaba1311.00+/-9.35,698AlibabaOpen Source
16GLM-5.3-FlashZhipu AI1308.00+/-5.815,817Zhipu AIOpen Source
25Moonshot AIKimi K2.6Moonshot AI1290.00+/-4.133,999Moonshot AIOpen Source
35Moonshot AIKimi K2.7 CodeMoonshot AI1273.00+/-5.517,077Moonshot AIOpen Source
38MiniMaxAIMiniMax M3MiniMaxAI1268.00+/-4.922,330MiniMaxAIOpen Source
42DeepSeek-AIDeepSeek-V4-ProDeepSeek-AI1259.00+/-4.526,466DeepSeek-AIOpen Source
44Moonshot AIKimi K2.5 (thinking)Moonshot AI1254.00+/-3.741,601Moonshot AIOpen Source
46MiniMaxAIMiniMax-M2.7MiniMaxAI1252.00+/-3.839,539MiniMaxAIOpen Source
49DeepSeek-AIDeepSeek-V4-FlashDeepSeek-AI1249.00+/-7.29,702DeepSeek-AIOpen Source
58MiniMaxAIMiniMax M2.5MiniMaxAI1225.00+/-6.711,506MiniMaxAIOpen Source
60DeepSeek-AIDeepSeek-V4-FlashDeepSeek-AI1223.00+/-4.428,074DeepSeek-AIOpen Source
62MiniMaxAIM2.1MiniMaxAI1208.00+/-520,805MiniMaxAIOpen Source
67StepFunAIStep 3.7 FlashStepFunAI1198.00+/-4.922,607StepFunAIOpen Source
74DeepSeek-AIDeepSeek-V3.1 (thinking)DeepSeek-AI1193.00+/-5.616,257DeepSeek-AIOpen Source
76DeepSeek-AIDeepSeek V3.2-ExpDeepSeek-AI1188.00+/-5.219,487DeepSeek-AIOpen Source
87DeepSeek-AIDeepSeek V3.2DeepSeek-AI1182.00+/-4.329,120DeepSeek-AIOpen Source
102DeepSeek-AIDeepSeek-R1-0528DeepSeek-AI1156.00+/-5.417,951DeepSeek-AIOpen Source
107MiniMaxAIMiniMax M2MiniMaxAI1153.00+/-6.810,828MiniMaxAIOpen Source
114DeepSeek-AIDeepSeek-V3.1DeepSeek-AI1129.00+/-5.120,334DeepSeek-AIOpen Source
116DeepSeek-AIDeepSeek-V3-0324DeepSeek-AI1126.00+/-5.219,271DeepSeek-AIOpen Source
120Moonshot AIKimi K2 0905Moonshot AI1115.00+/-17.91,504Moonshot AIOpen Source
125Moonshot AIKimi K2 Turbo PreviewMoonshot AI1101.00+/-15.22,094Moonshot AIOpen Source
136Moonshot AIKimi K2Moonshot AI1051.00+/-19.51,352Moonshot AIOpen Source
138AlibabaQwen3-235B-A22B-Thinking-2507Alibaba1050.00+/-9.16,175AlibabaOpen Source

数据仅供参考,以官方来源为准。模型名称旁的链接可跳转到 DataLearner 模型详情页。

关于本榜单

本榜单数据来源于Design Arena,由 Y Combinator 支持的 Arcada Labs 开发,是专注于评测 AI 设计代码生成能力的众包匿名对战平台。

与 LMArena 评测通用文本和编程能力不同,Design Arena 的代码榜专门考察模型生成具有视觉呈现效果的前端代码的能力。平台将代码任务细分为 Website、UI 组件、游戏开发、数据可视化、SVG、Web App、移动端等多个子类别,每个子类别均有独立排行。

本页展示的是 Code Categories 综合榜,即将所有子类别的用户投票混合汇总后,统一用 Bradley-Terry 模型(类 Elo 算法)计算出的综合排名。每票等权,不对各子类别做加权处理,因此投票量较大的子类别(如 Website)对综合分数的影响更大。得分越高,代表模型在设计代码生成场景下的综合人类偏好越强。

常见问题 (FAQ)

01

什么是 Arcada Labs Code Categories Arena?

Arcada Labs Code Categories Arena 是专注于设计代码生成能力的匿名评测平台,覆盖 Website、UI 组件、游戏开发、数据可视化等多个代码生成子类别,并将投票汇总为综合榜单。

02

Arcada Code Arena 与 LMArena Coding Arena 有什么区别?

LMArena Coding Arena 主要评测通用编程能力,例如代码生成、调试和算法实现;Arcada Code Arena 专注于具有视觉呈现效果的前端设计代码,例如 HTML 页面、交互 UI、图表、SVG 和原型。

03

排名方法论是什么?

Arcada Labs 将各代码子类别的原始投票混合后运行 Bradley-Terry 模型。每票等权,不按子类别单独加权,因此投票量较大的子类别会对综合分数产生更大影响。

04

哪类模型在设计代码场景表现更好?

具备强视觉理解和前端代码生成能力的大模型通常表现更好。针对 UI 和代码生成优化的专项模型,在布局、交互和视觉细节任务上也可能有突出表现。