Arcada Labs Code Categories Arena 代码能力排行榜
基于 Arcada Labs Code Categories Arena 用户匿名投票的最新AI大模型代码能力排行榜,通过 Bradley-Terry 模型对 Website、UI Component、Game Dev、Data Visualization 等代码子类别进行综合评分与排名。
榜首模型
Kimi K3
最高得分
1394.00
模型数量
163
数据版本
2026年09月08日
数据来源: Arcada Labs
排名总表
| 排名 | 模型名称 | 得分 | 95% CI | 投票数 | 机构 | 许可证 |
|---|---|---|---|---|---|---|
Kimi K3Moonshot AI | 1394.00 | +/-9.6 | 5,844 | Moonshot AI | Open Source | |
GPT-6 Astra (xhigh)OpenAI | 1372.00 | +/-18.2 | 1,521 | OpenAI | Proprietary | |
GPT-5.6 Sol (xhigh)OpenAI | 1354.00 | +/-8.9 | 6,448 | OpenAI | Proprietary | |
| 4 | Claude Fable 5.1Anthropic | 1346.00 | +/-9.5 | 5,645 | Anthropic | Proprietary |
| 5 | Claude Opus 5Anthropic | 1341.00 | +/-6.6 | 12,061 | Anthropic | Proprietary |
| 6 | GPT-5.6 Sol (medium)OpenAI | 1338.00 | +/-5.2 | 20,271 | OpenAI | Proprietary |
| 7 | GLM-5.3智谱AI | 1334.00 | +/-6.6 | 11,963 | 智谱AI | Open Source |
| 8 | Muse Spark 1.2Facebook AI研究实验室 | 1331.00 | +/-7.1 | 10,197 | Facebook AI研究实验室 | Proprietary |
| 9 | Claude Fable 5Anthropic | 1328.00 | +/-5.8 | 15,916 | Anthropic | Proprietary |
| 10 | Gemini 3.7 FlashGoogle Deep Mind | 1322.00 | +/-4.1 | 36,826 | Google Deep Mind | Proprietary |
| 11 | Gemini 3.8 FlashGoogle | 1322.00 | +/-8.8 | 6,592 | Proprietary | |
| 12 | GLM-5.2智谱AI | 1318.00 | +/-4.5 | 27,965 | 智谱AI | Open Source |
| 13 | 1313.00 | +/-4.5 | 28,686 | xAI | Proprietary | |
| 14 | Qwen3.8 MaxAlibaba | 1311.00 | +/-9.3 | 5,698 | Alibaba | Open Source |
| 15 | Gemini 3.6 FlashGoogle | 1308.00 | +/-4.8 | 24,106 | Proprietary | |
| 16 | GLM-5.3-FlashZhipu AI | 1308.00 | +/-5.8 | 15,817 | Zhipu AI | Open Source |
| 17 | Claude Opus 4.6Anthropic | 1307.00 | +/-4.5 | 27,379 | Anthropic | Proprietary |
| 18 | Claude Opus 4.6 (thinking)Anthropic | 1303.00 | +/-4.8 | 23,802 | Anthropic | Proprietary |
| 19 | Deca 2.6 UltraGenLabs | 1297.00 | +/-16.9 | 1,670 | GenLabs | Proprietary |
| 20 | 1296.00 | +/-4.4 | 29,559 | xAI | Proprietary | |
| 21 | Claude Sonnet 4.6Anthropic | 1294.00 | +/-4.6 | 26,295 | Anthropic | Proprietary |
| 22 | Claude Sonnet 5Anthropic | 1294.00 | +/-5.5 | 17,398 | Anthropic | Proprietary |
| 23 | Muse Spark 1.1Facebook AI研究实验室 | 1293.00 | +/-6.2 | 13,257 | Facebook AI研究实验室 | Proprietary |
| 24 | Qwen3.7 Max阿里巴巴 | 1293.00 | +/-4.4 | 29,069 | 阿里巴巴 | Proprietary |
| 25 | Kimi K2.6Moonshot AI | 1290.00 | +/-4.1 | 33,999 | Moonshot AI | Open Source |
| 26 | Deca 2.5 MiniGenLabs | 1289.00 | +/-10.8 | 4,196 | GenLabs | Proprietary |
| 27 | MiMo-V2.5-ProXiaomi | 1289.00 | +/-5.2 | 19,554 | Xiaomi | Open Source |
| 28 | GLM 5.1智谱AI | 1285.00 | +/-4.8 | 23,577 | 智谱AI | Open Source |
| 29 | GLM-5-Turbo智谱AI | 1284.00 | +/-4 | 36,099 | 智谱AI | Proprietary |
| 30 | Qwen3.7-Plus阿里巴巴 | 1282.00 | +/-6.7 | 11,303 | 阿里巴巴 | Proprietary |
| 31 | Deca 2.5 UltraGenLabs | 1281.00 | +/-11.1 | 3,917 | GenLabs | Proprietary |
| 32 | Gemini 3.5 FlashGoogle Deep Mind | 1280.00 | +/-4.4 | 29,039 | Google Deep Mind | Proprietary |
| 33 | MiMo-V2.5Xiaomi | 1278.00 | +/-3.9 | 38,899 | Xiaomi | Open Source |
| 34 | GPT-5.5OpenAI | 1276.00 | +/-4.5 | 26,698 | OpenAI | Proprietary |
| 35 | Kimi K2.7 CodeMoonshot AI | 1273.00 | +/-5.5 | 17,077 | Moonshot AI | Open Source |
| 36 | Muse SparkFacebook AI研究实验室 | 1269.00 | +/-10.9 | 4,249 | Facebook AI研究实验室 | Proprietary |
| 37 | Claude Opus 4.8Anthropic | 1268.00 | +/-4.6 | 25,362 | Anthropic | Proprietary |
| 38 | MiniMax M3MiniMaxAI | 1268.00 | +/-4.9 | 22,330 | MiniMaxAI | Open Source |
| 39 | GLM-5智谱AI | 1264.00 | +/-3.6 | 45,326 | 智谱AI | Open Source |
| 40 | Gemini 3.1 Pro PreviewGoogle Deep Mind | 1261.00 | +/-4.7 | 25,342 | Google Deep Mind | Proprietary |
| 41 | Opus 4.5Anthropic | 1260.00 | +/-4 | 35,203 | Anthropic | Proprietary |
| 42 | DeepSeek-V4-ProDeepSeek-AI | 1259.00 | +/-4.5 | 26,466 | DeepSeek-AI | Open Source |
| 43 | GPT-5.6 TerraOpenAI | 1258.00 | +/-3.3 | 67,113 | OpenAI | Proprietary |
| 44 | Kimi K2.5 (thinking)Moonshot AI | 1254.00 | +/-3.7 | 41,601 | Moonshot AI | Open Source |
| 45 | Qwen 3.6 Plus Preview阿里巴巴 | 1253.00 | +/-4.2 | 32,471 | 阿里巴巴 | Proprietary |
| 46 | MiniMax-M2.7MiniMaxAI | 1252.00 | +/-3.8 | 39,539 | MiniMaxAI | Open Source |
| 47 | GPT-5.6 LunaOpenAI | 1250.00 | +/-6.1 | 13,825 | OpenAI | Proprietary |
| 48 | Nex N2 ProNex AGI | 1250.00 | +/-6.3 | 13,001 | Nex AGI | Open Source |
| 49 | DeepSeek-V4-FlashDeepSeek-AI | 1249.00 | +/-7.2 | 9,702 | DeepSeek-AI | Open Source |
| 50 | Gemini 3.1 Pro PreviewGoogle Deep Mind | 1249.00 | +/-3.6 | 45,934 | Google Deep Mind | Proprietary |
| 51 | GLM-5V-Turbo智谱AI | 1247.00 | +/-3.8 | 40,526 | 智谱AI | Proprietary |
| 52 | Hy3腾讯AI实验室 | 1246.00 | +/-5 | 21,544 | 腾讯AI实验室 | Open Source |
| 53 | 1238.00 | +/-4 | 35,817 | xAI | Proprietary | |
| 54 | GLM-4.7智谱AI | 1234.00 | +/-3.5 | 46,822 | 智谱AI | Open Source |
| 55 | GPT-5.4 (Design Skill, Medium)OpenAI | 1229.00 | +/-7.2 | 9,607 | OpenAI | Proprietary |
| 56 | GPT-5.4 (medium)OpenAI | 1227.00 | +/-5.2 | 18,940 | OpenAI | Proprietary |
| 57 | InklingThinking Machines Lab | 1226.00 | +/-12.4 | 3,184 | Thinking Machines Lab | Open Source |
| 58 | MiniMax M2.5MiniMaxAI | 1225.00 | +/-6.7 | 11,506 | MiniMaxAI | Open Source |
| 59 | 1224.00 | +/-3.8 | 38,926 | xAI | Proprietary | |
| 60 | DeepSeek-V4-FlashDeepSeek-AI | 1223.00 | +/-4.4 | 28,074 | DeepSeek-AI | Open Source |
| 61 | InklingThinking Machines Lab | 1217.00 | +/-7.9 | 8,312 | Thinking Machines Lab | Open Source |
| 62 | M2.1MiniMaxAI | 1208.00 | +/-5 | 20,805 | MiniMaxAI | Open Source |
| 63 | Gemini 3.0 FlashGoogle Deep Mind | 1207.00 | +/-10.6 | 4,414 | Google Deep Mind | Proprietary |
| 64 | 1203.00 | +/-4.2 | 32,540 | xAI | Proprietary | |
| 65 | Claude Sonnet 4.5Anthropic | 1200.00 | +/-3.5 | 45,423 | Anthropic | Proprietary |
| 66 | Claude Sonnet 4.5 (thinking)Anthropic | 1200.00 | +/-3.6 | 44,182 | Anthropic | Proprietary |
| 67 | Step 3.7 FlashStepFunAI | 1198.00 | +/-4.9 | 22,607 | StepFunAI | Open Source |
| 68 | GPT-5.4 (low)OpenAI | 1197.00 | +/-5 | 21,133 | OpenAI | Proprietary |
| 69 | Qwen3.5-397B-A17B阿里巴巴 | 1197.00 | +/-7.8 | 8,129 | 阿里巴巴 | Open Source |
| 70 | GPT-5.4OpenAI | 1196.00 | +/-4.7 | 23,597 | OpenAI | Proprietary |
| 71 | GLM-4.7-Flash智谱AI | 1195.00 | +/-6.6 | 11,706 | 智谱AI | Open Source |
| 72 | Claude Sonnet 3.7Anthropic | 1194.00 | +/-5.8 | 15,259 | Anthropic | Proprietary |
| 73 | Hy3 (low)腾讯AI实验室 | 1194.00 | +/-11.1 | 4,063 | 腾讯AI实验室 | Open Source |
| 74 | DeepSeek-V3.1 (thinking)DeepSeek-AI | 1193.00 | +/-5.6 | 16,257 | DeepSeek-AI | Open Source |
| 75 | Opus 4.1 (thinking)Anthropic | 1188.00 | +/-5.7 | 15,715 | Anthropic | Proprietary |
| 76 | DeepSeek V3.2-ExpDeepSeek-AI | 1188.00 | +/-5.2 | 19,487 | DeepSeek-AI | Open Source |
| 77 | GPT-5.1 (high)OpenAI | 1188.00 | +/-5.6 | 16,116 | OpenAI | Proprietary |
| 78 | GPT-5.2 (medium)OpenAI | 1187.00 | +/-4.4 | 27,932 | OpenAI | Proprietary |
| 79 | GPT-5.2 (None)OpenAI | 1186.00 | +/-4.3 | 28,872 | OpenAI | Proprietary |
| 80 | GPT-5 (high)OpenAI | 1185.00 | +/-6.1 | 13,485 | OpenAI | Proprietary |
| 81 | Qwen3.5 Plus (0215)阿里巴巴 | 1184.00 | +/-5.3 | 18,498 | 阿里巴巴 | Proprietary |
| 82 | Opus 4.1Anthropic | 1183.00 | +/-3.7 | 39,733 | Anthropic | Proprietary |
| 83 | GLM-4.5智谱AI | 1183.00 | +/-5.1 | 19,653 | 智谱AI | Open Source |
| 84 | GLM-4.6智谱AI | 1183.00 | +/-5.5 | 17,086 | 智谱AI | Open Source |
| 85 | GPT-5 (minimal)OpenAI | 1183.00 | +/-4.1 | 32,965 | OpenAI | Proprietary |
| 86 | GPT-5.2 (low)OpenAI | 1183.00 | +/-4.6 | 25,456 | OpenAI | Proprietary |
| 87 | DeepSeek V3.2DeepSeek-AI | 1182.00 | +/-4.3 | 29,120 | DeepSeek-AI | Open Source |
| 88 | GPT-5.1 (medium)OpenAI | 1179.00 | +/-4.9 | 21,347 | OpenAI | Proprietary |
| 89 | Claude Opus 4Anthropic | 1178.00 | +/-5.6 | 16,668 | Anthropic | Proprietary |
| 90 | MiMo-V2-FlashXiaomi | 1174.00 | +/-4 | 35,226 | Xiaomi | Open Source |
| 91 | GPT-5.1 (low)OpenAI | 1173.00 | +/-4.9 | 22,192 | OpenAI | Proprietary |
| 92 | Solar Pro 4Upstage | 1171.00 | +/-13.9 | 2,692 | Upstage | Proprietary |
| 93 | Gemini 2.5 ProGoogle Deep Mind | 1170.00 | +/-8.4 | 7,220 | Google Deep Mind | Proprietary |
| 94 | GPT-5.1 CodexOpenAI | 1170.00 | +/-15.5 | 2,005 | OpenAI | Proprietary |
| 95 | GPT-5.1 (None)OpenAI | 1168.00 | +/-4.8 | 22,295 | OpenAI | Proprietary |
| 96 | GPT-5.2 (high)OpenAI | 1168.00 | +/-10.8 | 4,150 | OpenAI | Proprietary |
| 97 | GPT-5.3 CodexOpenAI | 1162.00 | +/-5.7 | 15,673 | OpenAI | Proprietary |
| 98 | v0-1.5-lgVercel | 1161.00 | +/-21.4 | 1,192 | Vercel | Proprietary |
| 99 | Mistral Large 3MistralAI | 1160.00 | +/-4.2 | 30,428 | MistralAI | Open Source |
| 100 | Qwen3-Coder-480B-A35B阿里巴巴 | 1160.00 | +/-16.3 | 1,955 | 阿里巴巴 | Open Source |
| 101 | Claude Sonnet 4Anthropic | 1159.00 | +/-5.4 | 17,542 | Anthropic | Proprietary |
| 102 | DeepSeek-R1-0528DeepSeek-AI | 1156.00 | +/-5.4 | 17,951 | DeepSeek-AI | Open Source |
| 103 | GLM-4.5-Air智谱AI | 1155.00 | +/-5.5 | 17,253 | 智谱AI | Open Source |
| 104 | AGI-01 SwiftLucidQuery | 1154.00 | +/-20.2 | 1,248 | LucidQuery | Proprietary |
| 105 | Claude Sonnet 4 (thinking)Anthropic | 1154.00 | +/-5.6 | 16,246 | Anthropic | Proprietary |
| 106 | Nemotron 3 UltraNVIDIA | 1154.00 | +/-5.5 | 18,552 | NVIDIA | Open Source |
| 107 | MiniMax M2MiniMaxAI | 1153.00 | +/-6.8 | 10,828 | MiniMaxAI | Open Source |
| 108 | AesCoder-4BDesignFlow | 1142.00 | +/-3.8 | 39,833 | DesignFlow | Open Source |
| 109 | Mistral Medium 3.5MistralAI | 1139.00 | +/-6.9 | 10,892 | MistralAI | Open Source |
| 110 | Mistral Medium 3.1 (2508)Mistral | 1138.00 | +/-4.4 | 27,823 | Mistral | Proprietary |
| 111 | Trinity Large ThinkingArcee AI | 1135.00 | +/-6.4 | 12,837 | Arcee AI | Open Source |
| 112 | Haiku 4.5Anthropic | 1132.00 | +/-4 | 35,537 | Anthropic | Proprietary |
| 113 | GPT-5-miniOpenAI | 1132.00 | +/-3.9 | 37,081 | OpenAI | Proprietary |
| 114 | DeepSeek-V3.1DeepSeek-AI | 1129.00 | +/-5.1 | 20,334 | DeepSeek-AI | Open Source |
| 115 | Qwen3-Max-Thinking阿里巴巴 | 1127.00 | +/-4.1 | 33,365 | 阿里巴巴 | Proprietary |
| 116 | DeepSeek-V3-0324DeepSeek-AI | 1126.00 | +/-5.2 | 19,271 | DeepSeek-AI | Open Source |
| 117 | Prime Intellect: INTELLECT-3Prime Intellect | 1124.00 | +/-4.2 | 31,341 | Prime Intellect | Open Source |
| 118 | Gemini 2.5 Flash-Preview-09-2025Google Deep Mind | 1122.00 | +/-5.2 | 19,295 | Google Deep Mind | Proprietary |
| 119 | 1118.00 | +/-3.9 | 36,645 | xAI | Proprietary | |
| 120 | Kimi K2 0905Moonshot AI | 1115.00 | +/-17.9 | 1,504 | Moonshot AI | Open Source |
| 121 | GPT-5.1 Codex MiniOpenAI | 1111.00 | +/-4.1 | 33,827 | OpenAI | Proprietary |
| 122 | 1110.00 | +/-4.1 | 33,597 | xAI | Proprietary | |
| 123 | 1104.00 | +/-4.2 | 31,131 | xAI | Proprietary | |
| 124 | GPT-5-NanoOpenAI | 1102.00 | +/-8.6 | 6,703 | OpenAI | Proprietary |
| 125 | Kimi K2 Turbo PreviewMoonshot AI | 1101.00 | +/-15.2 | 2,094 | Moonshot AI | Open Source |
| 126 | Gemini 2.5 Flash-Lite-Preview-09-2025Google Deep Mind | 1099.00 | +/-8.5 | 6,850 | Google Deep Mind | Proprietary |
| 127 | Gemini 3.1 Flash-LiteGoogle Deep Mind | 1090.00 | +/-4.9 | 23,527 | Google Deep Mind | Proprietary |
| 128 | Phi-3-medium 14B-previewMicrosoft Azure | 1086.00 | +/-8.9 | 6,390 | Microsoft Azure | Proprietary |
| 129 | Ministral 3 14BMistralAI | 1082.00 | +/-14.4 | 2,380 | MistralAI | Open Source |
| 130 | Gemini 2.5 FlashGoogle Deep Mind | 1077.00 | +/-8.5 | 6,971 | Google Deep Mind | Proprietary |
| 131 | v0-1.5-mdVercel | 1074.00 | +/-6.8 | 11,081 | Vercel | Proprietary |
| 132 | Ministral 3 8BMistralAI | 1071.00 | +/-14.3 | 2,427 | MistralAI | Open Source |
| 133 | 1070.00 | +/-4.5 | 26,865 | xAI | Proprietary | |
| 134 | 1068.00 | +/-4 | 37,369 | xAI | Proprietary | |
| 135 | Qwen3-235B-A22B-2507阿里巴巴 | 1056.00 | +/-8.6 | 6,939 | 阿里巴巴 | Open Source |
| 136 | Kimi K2Moonshot AI | 1051.00 | +/-19.5 | 1,352 | Moonshot AI | Open Source |
| 137 | Magistral Medium 1.2 (2509)Mistral | 1050.00 | +/-9.3 | 5,854 | Mistral | Proprietary |
| 138 | Qwen3-235B-A22B-Thinking-2507Alibaba | 1050.00 | +/-9.1 | 6,175 | Alibaba | Open Source |
| 139 | GPT-4.1OpenAI | 1043.00 | +/-17.3 | 1,747 | OpenAI | Proprietary |
| 140 | OpenAI o3OpenAI | 1037.00 | +/-19.5 | 1,365 | OpenAI | Proprietary |
| 141 | 1034.00 | +/-4.9 | 24,016 | xAI | Proprietary | |
| 142 | Devstral MediumMistralAI | 1030.00 | +/-8.5 | 7,153 | MistralAI | Proprietary |
| 143 | Ministral 3 3B (2512)Mistral | 1028.00 | +/-13.5 | 2,852 | Mistral | Open Source |
| 144 | Mercury 2Inception | 1026.00 | +/-6.6 | 17,309 | Inception | Proprietary |
| 145 | Codestral 2508Mistral | 1025.00 | +/-8.8 | 6,734 | Mistral | Proprietary |
| 146 | Qwen3-235B-A22B阿里巴巴 | 1019.00 | +/-10.1 | 5,158 | 阿里巴巴 | Open Source |
| 147 | 1016.00 | +/-11.1 | 4,299 | xAI | Proprietary | |
| 148 | GPT-4.1 miniOpenAI | 1011.00 | +/-18.3 | 1,566 | OpenAI | Proprietary |
| 149 | Magistral Small 1.2 (2509)Mistral | 1003.00 | +/-9.2 | 6,447 | Mistral | Open Source |
| 150 | OpenAI o4 - miniOpenAI | 993.00 | +/-16.2 | 2,011 | OpenAI | Proprietary |
| 151 | Olmo 3.1 32B ThinkAllen AI | 993.00 | +/-6.2 | 16,164 | Allen AI | Open Source |
| 152 | GPT-4.1 nanoOpenAI | 980.00 | +/-16.9 | 1,901 | OpenAI | Proprietary |
| 153 | GPT OSS 120BOpenAI | 980.00 | +/-10.3 | 5,272 | OpenAI | Open Source |
| 154 | Qwen3-30B-A3B阿里巴巴 | 959.00 | +/-14.6 | 2,568 | 阿里巴巴 | Open Source |
| 155 | 948.00 | +/-8.8 | 7,621 | xAI | Proprietary | |
| 156 | Llama 3.1 Nemotron Ultra 253BNVIDIA | 947.00 | +/-13.8 | 3,173 | NVIDIA | Open Source |
| 157 | Mistral-Small-3.2MistralAI | 924.00 | +/-20.8 | 1,243 | MistralAI | Open Source |
| 158 | Llama 4 MaverickFacebook AI研究实验室 | 897.00 | +/-18.4 | 1,678 | Facebook AI研究实验室 | Open Source |
| 159 | Mistral Large 2.1 (2411)Mistral | 881.00 | +/-21 | 1,317 | Mistral | Proprietary |
| 160 | GPT-4oOpenAI | 878.00 | +/-18.2 | 1,780 | OpenAI | Proprietary |
| 161 | Codestral 2 (2501)Mistral | 851.00 | +/-20.7 | 1,444 | Mistral | Open Source |
| 162 | Devstral Small 1.1MistralAI | 825.00 | +/-22.6 | 1,250 | MistralAI | Open Source |
| 163 | Llama 4 ScoutFacebook AI研究实验室 | 807.00 | +/-22.6 | 1,275 | Facebook AI研究实验室 | Open Source |
数据仅供参考,以官方来源为准。模型名称旁的链接可跳转到 DataLearner 模型详情页。
关于本榜单
本榜单数据来源于Design Arena,由 Y Combinator 支持的 Arcada Labs 开发,是专注于评测 AI 设计代码生成能力的众包匿名对战平台。
与 LMArena 评测通用文本和编程能力不同,Design Arena 的代码榜专门考察模型生成具有视觉呈现效果的前端代码的能力。平台将代码任务细分为 Website、UI 组件、游戏开发、数据可视化、SVG、Web App、移动端等多个子类别,每个子类别均有独立排行。
本页展示的是 Code Categories 综合榜,即将所有子类别的用户投票混合汇总后,统一用 Bradley-Terry 模型(类 Elo 算法)计算出的综合排名。每票等权,不对各子类别做加权处理,因此投票量较大的子类别(如 Website)对综合分数的影响更大。得分越高,代表模型在设计代码生成场景下的综合人类偏好越强。
常见问题 (FAQ)
什么是 Arcada Labs Code Categories Arena?
Arcada Labs Code Categories Arena 是专注于设计代码生成能力的匿名评测平台,覆盖 Website、UI 组件、游戏开发、数据可视化等多个代码生成子类别,并将投票汇总为综合榜单。
Arcada Code Arena 与 LMArena Coding Arena 有什么区别?
LMArena Coding Arena 主要评测通用编程能力,例如代码生成、调试和算法实现;Arcada Code Arena 专注于具有视觉呈现效果的前端设计代码,例如 HTML 页面、交互 UI、图表、SVG 和原型。
排名方法论是什么?
Arcada Labs 将各代码子类别的原始投票混合后运行 Bradley-Terry 模型。每票等权,不按子类别单独加权,因此投票量较大的子类别会对综合分数产生更大影响。
哪类模型在设计代码场景表现更好?
具备强视觉理解和前端代码生成能力的大模型通常表现更好。针对 UI 和代码生成优化的专项模型,在布局、交互和视觉细节任务上也可能有突出表现。













