Arcada Labs Code Categories Arena Leaderboard
The latest AI design-code model leaderboard based on Arcada Labs Code Categories Arena anonymous user voting. Focused on Website, UI components, game development, and data visualization code generation.
Top Model
Kimi K3
Top Score
1394.00
Model Count
163
Data version
2026年09月08日
Data source: Arcada Labs
Ranking Table
| Rank | Model | Score | 95% CI | Votes | Organization | License |
|---|---|---|---|---|---|---|
Kimi K3Moonshot AI | 1394.00 | +/-9.6 | 5,844 | Moonshot AI | Open Source | |
GPT-6 Astra (xhigh)OpenAI | 1372.00 | +/-18.2 | 1,521 | OpenAI | Proprietary | |
GPT-5.6 Sol (xhigh)OpenAI | 1354.00 | +/-8.9 | 6,448 | OpenAI | Proprietary | |
| 4 | Claude Fable 5.1Anthropic | 1346.00 | +/-9.5 | 5,645 | Anthropic | Proprietary |
| 5 | Claude Opus 5Anthropic | 1341.00 | +/-6.6 | 12,061 | Anthropic | Proprietary |
| 6 | GPT-5.6 Sol (medium)OpenAI | 1338.00 | +/-5.2 | 20,271 | OpenAI | Proprietary |
| 7 | GLM-5.3智谱AI | 1334.00 | +/-6.6 | 11,963 | 智谱AI | Open Source |
| 8 | Muse Spark 1.2Facebook AI研究实验室 | 1331.00 | +/-7.1 | 10,197 | Facebook AI研究实验室 | Proprietary |
| 9 | Claude Fable 5Anthropic | 1328.00 | +/-5.8 | 15,916 | Anthropic | Proprietary |
| 10 | Gemini 3.7 FlashGoogle Deep Mind | 1322.00 | +/-4.1 | 36,826 | Google Deep Mind | Proprietary |
| 11 | Gemini 3.8 FlashGoogle | 1322.00 | +/-8.8 | 6,592 | Proprietary | |
| 12 | GLM-5.2智谱AI | 1318.00 | +/-4.5 | 27,965 | 智谱AI | Open Source |
| 13 | 1313.00 | +/-4.5 | 28,686 | xAI | Proprietary | |
| 14 | Qwen3.8 MaxAlibaba | 1311.00 | +/-9.3 | 5,698 | Alibaba | Open Source |
| 15 | Gemini 3.6 FlashGoogle | 1308.00 | +/-4.8 | 24,106 | Proprietary | |
| 16 | GLM-5.3-FlashZhipu AI | 1308.00 | +/-5.8 | 15,817 | Zhipu AI | Open Source |
| 17 | Claude Opus 4.6Anthropic | 1307.00 | +/-4.5 | 27,379 | Anthropic | Proprietary |
| 18 | Claude Opus 4.6 (thinking)Anthropic | 1303.00 | +/-4.8 | 23,802 | Anthropic | Proprietary |
| 19 | Deca 2.6 UltraGenLabs | 1297.00 | +/-16.9 | 1,670 | GenLabs | Proprietary |
| 20 | 1296.00 | +/-4.4 | 29,559 | xAI | Proprietary | |
| 21 | Claude Sonnet 4.6Anthropic | 1294.00 | +/-4.6 | 26,295 | Anthropic | Proprietary |
| 22 | Claude Sonnet 5Anthropic | 1294.00 | +/-5.5 | 17,398 | Anthropic | Proprietary |
| 23 | Muse Spark 1.1Facebook AI研究实验室 | 1293.00 | +/-6.2 | 13,257 | Facebook AI研究实验室 | Proprietary |
| 24 | Qwen3.7 Max阿里巴巴 | 1293.00 | +/-4.4 | 29,069 | 阿里巴巴 | Proprietary |
| 25 | Kimi K2.6Moonshot AI | 1290.00 | +/-4.1 | 33,999 | Moonshot AI | Open Source |
| 26 | Deca 2.5 MiniGenLabs | 1289.00 | +/-10.8 | 4,196 | GenLabs | Proprietary |
| 27 | MiMo-V2.5-ProXiaomi | 1289.00 | +/-5.2 | 19,554 | Xiaomi | Open Source |
| 28 | GLM 5.1智谱AI | 1285.00 | +/-4.8 | 23,577 | 智谱AI | Open Source |
| 29 | GLM-5-Turbo智谱AI | 1284.00 | +/-4 | 36,099 | 智谱AI | Proprietary |
| 30 | Qwen3.7-Plus阿里巴巴 | 1282.00 | +/-6.7 | 11,303 | 阿里巴巴 | Proprietary |
| 31 | Deca 2.5 UltraGenLabs | 1281.00 | +/-11.1 | 3,917 | GenLabs | Proprietary |
| 32 | Gemini 3.5 FlashGoogle Deep Mind | 1280.00 | +/-4.4 | 29,039 | Google Deep Mind | Proprietary |
| 33 | MiMo-V2.5Xiaomi | 1278.00 | +/-3.9 | 38,899 | Xiaomi | Open Source |
| 34 | GPT-5.5OpenAI | 1276.00 | +/-4.5 | 26,698 | OpenAI | Proprietary |
| 35 | Kimi K2.7 CodeMoonshot AI | 1273.00 | +/-5.5 | 17,077 | Moonshot AI | Open Source |
| 36 | Muse SparkFacebook AI研究实验室 | 1269.00 | +/-10.9 | 4,249 | Facebook AI研究实验室 | Proprietary |
| 37 | Claude Opus 4.8Anthropic | 1268.00 | +/-4.6 | 25,362 | Anthropic | Proprietary |
| 38 | MiniMax M3MiniMaxAI | 1268.00 | +/-4.9 | 22,330 | MiniMaxAI | Open Source |
| 39 | GLM-5智谱AI | 1264.00 | +/-3.6 | 45,326 | 智谱AI | Open Source |
| 40 | Gemini 3.1 Pro PreviewGoogle Deep Mind | 1261.00 | +/-4.7 | 25,342 | Google Deep Mind | Proprietary |
| 41 | Opus 4.5Anthropic | 1260.00 | +/-4 | 35,203 | Anthropic | Proprietary |
| 42 | DeepSeek-V4-ProDeepSeek-AI | 1259.00 | +/-4.5 | 26,466 | DeepSeek-AI | Open Source |
| 43 | GPT-5.6 TerraOpenAI | 1258.00 | +/-3.3 | 67,113 | OpenAI | Proprietary |
| 44 | Kimi K2.5 (thinking)Moonshot AI | 1254.00 | +/-3.7 | 41,601 | Moonshot AI | Open Source |
| 45 | Qwen 3.6 Plus Preview阿里巴巴 | 1253.00 | +/-4.2 | 32,471 | 阿里巴巴 | Proprietary |
| 46 | MiniMax-M2.7MiniMaxAI | 1252.00 | +/-3.8 | 39,539 | MiniMaxAI | Open Source |
| 47 | GPT-5.6 LunaOpenAI | 1250.00 | +/-6.1 | 13,825 | OpenAI | Proprietary |
| 48 | Nex N2 ProNex AGI | 1250.00 | +/-6.3 | 13,001 | Nex AGI | Open Source |
| 49 | DeepSeek-V4-FlashDeepSeek-AI | 1249.00 | +/-7.2 | 9,702 | DeepSeek-AI | Open Source |
| 50 | Gemini 3.1 Pro PreviewGoogle Deep Mind | 1249.00 | +/-3.6 | 45,934 | Google Deep Mind | Proprietary |
| 51 | GLM-5V-Turbo智谱AI | 1247.00 | +/-3.8 | 40,526 | 智谱AI | Proprietary |
| 52 | Hy3腾讯AI实验室 | 1246.00 | +/-5 | 21,544 | 腾讯AI实验室 | Open Source |
| 53 | 1238.00 | +/-4 | 35,817 | xAI | Proprietary | |
| 54 | GLM-4.7智谱AI | 1234.00 | +/-3.5 | 46,822 | 智谱AI | Open Source |
| 55 | GPT-5.4 (Design Skill, Medium)OpenAI | 1229.00 | +/-7.2 | 9,607 | OpenAI | Proprietary |
| 56 | GPT-5.4 (medium)OpenAI | 1227.00 | +/-5.2 | 18,940 | OpenAI | Proprietary |
| 57 | InklingThinking Machines Lab | 1226.00 | +/-12.4 | 3,184 | Thinking Machines Lab | Open Source |
| 58 | MiniMax M2.5MiniMaxAI | 1225.00 | +/-6.7 | 11,506 | MiniMaxAI | Open Source |
| 59 | 1224.00 | +/-3.8 | 38,926 | xAI | Proprietary | |
| 60 | DeepSeek-V4-FlashDeepSeek-AI | 1223.00 | +/-4.4 | 28,074 | DeepSeek-AI | Open Source |
| 61 | InklingThinking Machines Lab | 1217.00 | +/-7.9 | 8,312 | Thinking Machines Lab | Open Source |
| 62 | M2.1MiniMaxAI | 1208.00 | +/-5 | 20,805 | MiniMaxAI | Open Source |
| 63 | Gemini 3.0 FlashGoogle Deep Mind | 1207.00 | +/-10.6 | 4,414 | Google Deep Mind | Proprietary |
| 64 | 1203.00 | +/-4.2 | 32,540 | xAI | Proprietary | |
| 65 | Claude Sonnet 4.5Anthropic | 1200.00 | +/-3.5 | 45,423 | Anthropic | Proprietary |
| 66 | Claude Sonnet 4.5 (thinking)Anthropic | 1200.00 | +/-3.6 | 44,182 | Anthropic | Proprietary |
| 67 | Step 3.7 FlashStepFunAI | 1198.00 | +/-4.9 | 22,607 | StepFunAI | Open Source |
| 68 | GPT-5.4 (low)OpenAI | 1197.00 | +/-5 | 21,133 | OpenAI | Proprietary |
| 69 | Qwen3.5-397B-A17B阿里巴巴 | 1197.00 | +/-7.8 | 8,129 | 阿里巴巴 | Open Source |
| 70 | GPT-5.4OpenAI | 1196.00 | +/-4.7 | 23,597 | OpenAI | Proprietary |
| 71 | GLM-4.7-Flash智谱AI | 1195.00 | +/-6.6 | 11,706 | 智谱AI | Open Source |
| 72 | Claude Sonnet 3.7Anthropic | 1194.00 | +/-5.8 | 15,259 | Anthropic | Proprietary |
| 73 | Hy3 (low)腾讯AI实验室 | 1194.00 | +/-11.1 | 4,063 | 腾讯AI实验室 | Open Source |
| 74 | DeepSeek-V3.1 (thinking)DeepSeek-AI | 1193.00 | +/-5.6 | 16,257 | DeepSeek-AI | Open Source |
| 75 | Opus 4.1 (thinking)Anthropic | 1188.00 | +/-5.7 | 15,715 | Anthropic | Proprietary |
| 76 | DeepSeek V3.2-ExpDeepSeek-AI | 1188.00 | +/-5.2 | 19,487 | DeepSeek-AI | Open Source |
| 77 | GPT-5.1 (high)OpenAI | 1188.00 | +/-5.6 | 16,116 | OpenAI | Proprietary |
| 78 | GPT-5.2 (medium)OpenAI | 1187.00 | +/-4.4 | 27,932 | OpenAI | Proprietary |
| 79 | GPT-5.2 (None)OpenAI | 1186.00 | +/-4.3 | 28,872 | OpenAI | Proprietary |
| 80 | GPT-5 (high)OpenAI | 1185.00 | +/-6.1 | 13,485 | OpenAI | Proprietary |
| 81 | Qwen3.5 Plus (0215)阿里巴巴 | 1184.00 | +/-5.3 | 18,498 | 阿里巴巴 | Proprietary |
| 82 | Opus 4.1Anthropic | 1183.00 | +/-3.7 | 39,733 | Anthropic | Proprietary |
| 83 | GLM-4.5智谱AI | 1183.00 | +/-5.1 | 19,653 | 智谱AI | Open Source |
| 84 | GLM-4.6智谱AI | 1183.00 | +/-5.5 | 17,086 | 智谱AI | Open Source |
| 85 | GPT-5 (minimal)OpenAI | 1183.00 | +/-4.1 | 32,965 | OpenAI | Proprietary |
| 86 | GPT-5.2 (low)OpenAI | 1183.00 | +/-4.6 | 25,456 | OpenAI | Proprietary |
| 87 | DeepSeek V3.2DeepSeek-AI | 1182.00 | +/-4.3 | 29,120 | DeepSeek-AI | Open Source |
| 88 | GPT-5.1 (medium)OpenAI | 1179.00 | +/-4.9 | 21,347 | OpenAI | Proprietary |
| 89 | Claude Opus 4Anthropic | 1178.00 | +/-5.6 | 16,668 | Anthropic | Proprietary |
| 90 | MiMo-V2-FlashXiaomi | 1174.00 | +/-4 | 35,226 | Xiaomi | Open Source |
| 91 | GPT-5.1 (low)OpenAI | 1173.00 | +/-4.9 | 22,192 | OpenAI | Proprietary |
| 92 | Solar Pro 4Upstage | 1171.00 | +/-13.9 | 2,692 | Upstage | Proprietary |
| 93 | Gemini 2.5 ProGoogle Deep Mind | 1170.00 | +/-8.4 | 7,220 | Google Deep Mind | Proprietary |
| 94 | GPT-5.1 CodexOpenAI | 1170.00 | +/-15.5 | 2,005 | OpenAI | Proprietary |
| 95 | GPT-5.1 (None)OpenAI | 1168.00 | +/-4.8 | 22,295 | OpenAI | Proprietary |
| 96 | GPT-5.2 (high)OpenAI | 1168.00 | +/-10.8 | 4,150 | OpenAI | Proprietary |
| 97 | GPT-5.3 CodexOpenAI | 1162.00 | +/-5.7 | 15,673 | OpenAI | Proprietary |
| 98 | v0-1.5-lgVercel | 1161.00 | +/-21.4 | 1,192 | Vercel | Proprietary |
| 99 | Mistral Large 3MistralAI | 1160.00 | +/-4.2 | 30,428 | MistralAI | Open Source |
| 100 | Qwen3-Coder-480B-A35B阿里巴巴 | 1160.00 | +/-16.3 | 1,955 | 阿里巴巴 | Open Source |
| 101 | Claude Sonnet 4Anthropic | 1159.00 | +/-5.4 | 17,542 | Anthropic | Proprietary |
| 102 | DeepSeek-R1-0528DeepSeek-AI | 1156.00 | +/-5.4 | 17,951 | DeepSeek-AI | Open Source |
| 103 | GLM-4.5-Air智谱AI | 1155.00 | +/-5.5 | 17,253 | 智谱AI | Open Source |
| 104 | AGI-01 SwiftLucidQuery | 1154.00 | +/-20.2 | 1,248 | LucidQuery | Proprietary |
| 105 | Claude Sonnet 4 (thinking)Anthropic | 1154.00 | +/-5.6 | 16,246 | Anthropic | Proprietary |
| 106 | Nemotron 3 UltraNVIDIA | 1154.00 | +/-5.5 | 18,552 | NVIDIA | Open Source |
| 107 | MiniMax M2MiniMaxAI | 1153.00 | +/-6.8 | 10,828 | MiniMaxAI | Open Source |
| 108 | AesCoder-4BDesignFlow | 1142.00 | +/-3.8 | 39,833 | DesignFlow | Open Source |
| 109 | Mistral Medium 3.5MistralAI | 1139.00 | +/-6.9 | 10,892 | MistralAI | Open Source |
| 110 | Mistral Medium 3.1 (2508)Mistral | 1138.00 | +/-4.4 | 27,823 | Mistral | Proprietary |
| 111 | Trinity Large ThinkingArcee AI | 1135.00 | +/-6.4 | 12,837 | Arcee AI | Open Source |
| 112 | Haiku 4.5Anthropic | 1132.00 | +/-4 | 35,537 | Anthropic | Proprietary |
| 113 | GPT-5-miniOpenAI | 1132.00 | +/-3.9 | 37,081 | OpenAI | Proprietary |
| 114 | DeepSeek-V3.1DeepSeek-AI | 1129.00 | +/-5.1 | 20,334 | DeepSeek-AI | Open Source |
| 115 | Qwen3-Max-Thinking阿里巴巴 | 1127.00 | +/-4.1 | 33,365 | 阿里巴巴 | Proprietary |
| 116 | DeepSeek-V3-0324DeepSeek-AI | 1126.00 | +/-5.2 | 19,271 | DeepSeek-AI | Open Source |
| 117 | Prime Intellect: INTELLECT-3Prime Intellect | 1124.00 | +/-4.2 | 31,341 | Prime Intellect | Open Source |
| 118 | Gemini 2.5 Flash-Preview-09-2025Google Deep Mind | 1122.00 | +/-5.2 | 19,295 | Google Deep Mind | Proprietary |
| 119 | 1118.00 | +/-3.9 | 36,645 | xAI | Proprietary | |
| 120 | Kimi K2 0905Moonshot AI | 1115.00 | +/-17.9 | 1,504 | Moonshot AI | Open Source |
| 121 | GPT-5.1 Codex MiniOpenAI | 1111.00 | +/-4.1 | 33,827 | OpenAI | Proprietary |
| 122 | 1110.00 | +/-4.1 | 33,597 | xAI | Proprietary | |
| 123 | 1104.00 | +/-4.2 | 31,131 | xAI | Proprietary | |
| 124 | GPT-5-NanoOpenAI | 1102.00 | +/-8.6 | 6,703 | OpenAI | Proprietary |
| 125 | Kimi K2 Turbo PreviewMoonshot AI | 1101.00 | +/-15.2 | 2,094 | Moonshot AI | Open Source |
| 126 | Gemini 2.5 Flash-Lite-Preview-09-2025Google Deep Mind | 1099.00 | +/-8.5 | 6,850 | Google Deep Mind | Proprietary |
| 127 | Gemini 3.1 Flash-LiteGoogle Deep Mind | 1090.00 | +/-4.9 | 23,527 | Google Deep Mind | Proprietary |
| 128 | Phi-3-medium 14B-previewMicrosoft Azure | 1086.00 | +/-8.9 | 6,390 | Microsoft Azure | Proprietary |
| 129 | Ministral 3 14BMistralAI | 1082.00 | +/-14.4 | 2,380 | MistralAI | Open Source |
| 130 | Gemini 2.5 FlashGoogle Deep Mind | 1077.00 | +/-8.5 | 6,971 | Google Deep Mind | Proprietary |
| 131 | v0-1.5-mdVercel | 1074.00 | +/-6.8 | 11,081 | Vercel | Proprietary |
| 132 | Ministral 3 8BMistralAI | 1071.00 | +/-14.3 | 2,427 | MistralAI | Open Source |
| 133 | 1070.00 | +/-4.5 | 26,865 | xAI | Proprietary | |
| 134 | 1068.00 | +/-4 | 37,369 | xAI | Proprietary | |
| 135 | Qwen3-235B-A22B-2507阿里巴巴 | 1056.00 | +/-8.6 | 6,939 | 阿里巴巴 | Open Source |
| 136 | Kimi K2Moonshot AI | 1051.00 | +/-19.5 | 1,352 | Moonshot AI | Open Source |
| 137 | Magistral Medium 1.2 (2509)Mistral | 1050.00 | +/-9.3 | 5,854 | Mistral | Proprietary |
| 138 | Qwen3-235B-A22B-Thinking-2507Alibaba | 1050.00 | +/-9.1 | 6,175 | Alibaba | Open Source |
| 139 | GPT-4.1OpenAI | 1043.00 | +/-17.3 | 1,747 | OpenAI | Proprietary |
| 140 | OpenAI o3OpenAI | 1037.00 | +/-19.5 | 1,365 | OpenAI | Proprietary |
| 141 | 1034.00 | +/-4.9 | 24,016 | xAI | Proprietary | |
| 142 | Devstral MediumMistralAI | 1030.00 | +/-8.5 | 7,153 | MistralAI | Proprietary |
| 143 | Ministral 3 3B (2512)Mistral | 1028.00 | +/-13.5 | 2,852 | Mistral | Open Source |
| 144 | Mercury 2Inception | 1026.00 | +/-6.6 | 17,309 | Inception | Proprietary |
| 145 | Codestral 2508Mistral | 1025.00 | +/-8.8 | 6,734 | Mistral | Proprietary |
| 146 | Qwen3-235B-A22B阿里巴巴 | 1019.00 | +/-10.1 | 5,158 | 阿里巴巴 | Open Source |
| 147 | 1016.00 | +/-11.1 | 4,299 | xAI | Proprietary | |
| 148 | GPT-4.1 miniOpenAI | 1011.00 | +/-18.3 | 1,566 | OpenAI | Proprietary |
| 149 | Magistral Small 1.2 (2509)Mistral | 1003.00 | +/-9.2 | 6,447 | Mistral | Open Source |
| 150 | OpenAI o4 - miniOpenAI | 993.00 | +/-16.2 | 2,011 | OpenAI | Proprietary |
| 151 | Olmo 3.1 32B ThinkAllen AI | 993.00 | +/-6.2 | 16,164 | Allen AI | Open Source |
| 152 | GPT-4.1 nanoOpenAI | 980.00 | +/-16.9 | 1,901 | OpenAI | Proprietary |
| 153 | GPT OSS 120BOpenAI | 980.00 | +/-10.3 | 5,272 | OpenAI | Open Source |
| 154 | Qwen3-30B-A3B阿里巴巴 | 959.00 | +/-14.6 | 2,568 | 阿里巴巴 | Open Source |
| 155 | 948.00 | +/-8.8 | 7,621 | xAI | Proprietary | |
| 156 | Llama 3.1 Nemotron Ultra 253BNVIDIA | 947.00 | +/-13.8 | 3,173 | NVIDIA | Open Source |
| 157 | Mistral-Small-3.2MistralAI | 924.00 | +/-20.8 | 1,243 | MistralAI | Open Source |
| 158 | Llama 4 MaverickFacebook AI研究实验室 | 897.00 | +/-18.4 | 1,678 | Facebook AI研究实验室 | Open Source |
| 159 | Mistral Large 2.1 (2411)Mistral | 881.00 | +/-21 | 1,317 | Mistral | Proprietary |
| 160 | GPT-4oOpenAI | 878.00 | +/-18.2 | 1,780 | OpenAI | Proprietary |
| 161 | Codestral 2 (2501)Mistral | 851.00 | +/-20.7 | 1,444 | Mistral | Open Source |
| 162 | Devstral Small 1.1MistralAI | 825.00 | +/-22.6 | 1,250 | MistralAI | Open Source |
| 163 | Llama 4 ScoutFacebook AI研究实验室 | 807.00 | +/-22.6 | 1,275 | Facebook AI研究实验室 | Open Source |
Data is for reference only. Official sources are authoritative. Click model names to view DataLearner model profiles.
About This Leaderboard
This leaderboard uses data from Design Arena developed by Arcada Labs, a Y Combinator-backed platform for anonymous head-to-head evaluation of AI design-code generation.
Unlike LMArena's general text and coding evaluations, Design Arena's code leaderboard focuses on the ability to generate front-end code with visual output. Tasks include Website, UI components, game development, data visualization, SVG, web apps, mobile, and related subcategories.
This page shows the Code Categories aggregate ranking. Votes across subcategories are pooled and scored with a Bradley-Terry model. Votes are counted equally rather than category-weighted, so categories with more votes can influence the aggregate more.
FAQ
What is Arcada Labs Code Categories Arena?
Arcada Labs Code Categories Arena is an anonymous evaluation platform focused on AI design-code generation. It covers categories such as websites, UI components, game development, and data visualization, then aggregates votes into an overall ranking.
How is Arcada Code Arena different from LMArena Coding Arena?
LMArena Coding Arena focuses on general programming tasks such as code generation, debugging, and algorithms. Arcada Code Arena focuses on visual front-end outputs such as HTML pages, interactive UI components, charts, SVG, and prototypes.
What is the ranking methodology?
Arcada Labs pools raw votes from code subcategories and fits a Bradley-Terry model. Votes are equal rather than category-weighted, so higher-volume categories can influence the aggregate more.
Which model types perform best for design-code tasks?
Large models with strong visual reasoning and front-end coding ability tend to do well. Specialized UI and code-generation models can also perform strongly when tasks emphasize layout, interaction, and visual polish.













