Text Generation Arena 文本生成模型排行榜
基于 Text Generation Arena 用户匿名投票的最新AI文本生成模型排行榜,涵盖各模型的 Elo 得分、95% 置信区间、投票量、机构与许可证。
榜首模型
Claude Fable 5
最高得分
1,507
模型数量
400
数据版本
2026年09月02日
数据来源: LM Arena
关于本排行榜
本排行榜展示了当前最强 AI 大模型在文本生成任务中的综合实力排名。数据来源于 LMArena(前身为 LMSYS Chatbot Arena),这是目前全球最大的 AI 模型众包评测平台。用户在平台上与两个匿名模型同时对话,并投票选出更好的回答——排名完全由真实用户的偏好决定,而非实验室基准测试。
评测方法概要
匿名盲测:用户同时与两个"隐藏身份"的模型对话,根据回答质量投票,排除品牌偏见。
Elo 评分:基于国际象棋领域的 Elo Rating 体系(Bradley-Terry 模型),通过对战结果计算每个模型的实力分数。分数越高,说明模型在真实对话中被用户选中的概率越大。
场景覆盖广泛:涵盖编程、创意写作、数学推理、知识问答、角色扮演等高频真实场景。
DataLearner 在原始数据基础上提供中文解读与深度分析,并将排行榜模型关联至 DataLearner 模型库,方便您一键查看模型详情、API 定价、评测得分等完整信息。
排名总表
| 排名 | 模型名称 | 得分 | 95% CI | 投票数 | 机构 | 许可证 |
|---|---|---|---|---|---|---|
Claude Fable 5Anthropic | 1,507 | +/-5 | 27,189 | Anthropic | Proprietary | |
Claude Opus 4.6 (high)Anthropic | 1,505 | +/-4 | 72,099 | Anthropic | Proprietary | |
Claude Fable 5.1 (max)Anthropic | 1,504 | +/-11 | 2,906 | Anthropic | Proprietary | |
| 4 | Opus 4.7 (high)Anthropic | 1,502 | +/-4 | 60,103 | Anthropic | Proprietary |
| 5 | Muse Spark 1.2 (xhigh)Facebook AI研究实验室 | 1,499 | +/-10 | 3,240 | Facebook AI研究实验室 | Proprietary |
| 6 | Claude Opus 4.6Anthropic | 1,498 | +/-3 | 76,015 | Anthropic | Proprietary |
| 7 | Opus 4.7Anthropic | 1,494 | +/-4 | 61,238 | Anthropic | Proprietary |
| 8 | gemini-3.8-flash-highGoogle | 1,494 | +/-9 | 5,125 | Proprietary | |
| 9 | Claude Opus 5 (high)Anthropic | 1,493 | +/-5 | 35,174 | Anthropic | Proprietary |
| 10 | Muse Spark 1.1Facebook AI研究实验室 | 1,492 | +/-5 | 24,064 | Facebook AI研究实验室 | Proprietary |
| 11 | gemini-3.7-flash-highGoogle | 1,491 | +/-8 | 5,682 | Proprietary | |
| 12 | Kimi K3 (max)Moonshot AI | 1,489 | +/-5 | 18,090 | Moonshot AI | Kimi K3 license |
| 13 | Muse SparkFacebook AI研究实验室 | 1,488 | +/-6 | 13,572 | Facebook AI研究实验室 | Proprietary |
| 14 | Claude Opus 5 (max)Anthropic | 1,488 | +/-6 | 17,119 | Anthropic | Proprietary |
| 15 | Gemini 3.1 Pro PreviewGoogle Deep Mind | 1,487 | +/-3 | 102,999 | Google Deep Mind | Proprietary |
| 16 | Gemini 3 ProGoogle Deep Mind | 1,486 | +/-4 | 40,668 | Google Deep Mind | Proprietary |
| 17 | GPT-5.6 Sol (xhigh)OpenAI | 1,483 | +/-5 | 23,413 | OpenAI | Proprietary |
| 18 | Claude Opus 4.8 (high)Anthropic | 1,482 | +/-4 | 48,727 | Anthropic | Proprietary |
| 19 | GPT-5.5 (high)OpenAI | 1,482 | +/-4 | 63,547 | OpenAI | Proprietary |
| 20 | glm-5.3-maxZ.ai | 1,482 | +/-7 | 7,668 | Z.ai | MIT |
| 21 | gemini-3.6-flash-highGoogle | 1,480 | +/-5 | 22,286 | Proprietary | |
| 22 | Qwen3.8-Max阿里巴巴 | 1,480 | +/-6 | 13,346 | 阿里巴巴 | Proprietary |
| 23 | gemini-3.5-flash-highGoogle | 1,479 | +/-4 | 34,180 | Proprietary | |
| 24 | GPT-5.5OpenAI | 1,477 | +/-4 | 64,977 | OpenAI | Proprietary |
| 25 | GPT-5.4 (high)OpenAI | 1,477 | +/-4 | 60,624 | OpenAI | Proprietary |
| 26 | GPT-5.2 Chat (0210)OpenAI | 1,476 | +/-4 | 34,217 | OpenAI | Proprietary |
| 27 | gemini-3.5-flash-mediumGoogle | 1,476 | +/-5 | 32,573 | Proprietary | |
| 28 | 1,475 | +/-5 | 26,630 | xAI | Proprietary | |
| 29 | glm-5.3-flashZ.ai | 1,474 | +/-9 | 4,672 | Z.ai | MIT |
| 30 | Gemini 3.0 FlashGoogle Deep Mind | 1,474 | +/-4 | 30,244 | Google Deep Mind | Proprietary |
| 31 | GPT-5.5 InstantOpenAI | 1,474 | +/-5 | 25,860 | OpenAI | Proprietary |
| 32 | Qwen3.7-Max-Preview阿里巴巴 | 1,474 | +/-10 | 3,710 | 阿里巴巴 | Proprietary |
| 33 | Claude Opus 4.8Anthropic | 1,473 | +/-4 | 49,404 | Anthropic | Proprietary |
| 34 | Opus 4.5Anthropic | 1,473 | +/-4 | 36,269 | Anthropic | Proprietary |
| 35 | Claude Sonnet 4.6Anthropic | 1,472 | +/-4 | 66,316 | Anthropic | Proprietary |
| 36 | 1,472 | +/-4 | 62,251 | xAI | Proprietary | |
| 37 | glm-5.2-maxZ.ai | 1,472 | +/-5 | 33,966 | Z.ai | MIT |
| 38 | 1,471 | +/-5 | 26,158 | xAI | Proprietary | |
| 39 | 1,470 | +/-4 | 60,820 | xAI | Proprietary | |
| 40 | Claude Opus 4Anthropic | 1,469 | +/-3 | 70,052 | Anthropic | Proprietary |
| 41 | mimo-v2.5-proXiaomi | 1,468 | +/-4 | 57,649 | Xiaomi | MIT |
| 42 | ERNIE-5.1-Preview百度 | 1,468 | +/-5 | 37,129 | 百度 | Proprietary |
| 43 | GPT-5.6 Terra (xhigh)OpenAI | 1,466 | +/-5 | 24,200 | OpenAI | Proprietary |
| 44 | GLM 5.1智谱AI | 1,466 | +/-4 | 45,650 | 智谱AI | MIT |
| 45 | Qwen3.5 Max Preview阿里巴巴 | 1,466 | +/-5 | 21,485 | 阿里巴巴 | Proprietary |
| 46 | GPT-5.4OpenAI | 1,466 | +/-4 | 63,588 | OpenAI | Proprietary |
| 47 | 1,465 | +/-3 | 64,198 | xAI | Proprietary | |
| 48 | Claude Sonnet 4.5 (high)Anthropic | 1,462 | +/-5 | 31,387 | Anthropic | Proprietary |
| 49 | 1,461 | +/-10 | 3,453 | SpaceXAI | Proprietary | |
| 50 | Kimi K2.6Moonshot AI | 1,461 | +/-5 | 37,568 | Moonshot AI | Modified MIT |
| 51 | Qwen3.6-Max-Preview阿里巴巴 | 1,460 | +/-8 | 5,196 | 阿里巴巴 | Proprietary |
| 52 | deepseek-v4-pro-high-20260813DeepSeek | 1,460 | +/-8 | 5,557 | DeepSeek | MIT |
| 53 | 1,459 | +/-3 | 66,382 | xAI | Proprietary | |
| 54 | Gemini 3.0 Flash (minimal)Google Deep Mind | 1,458 | +/-3 | 85,921 | Google Deep Mind | Proprietary |
| 55 | DeepSeek-V4-ProDeepSeek-AI | 1,458 | +/-4 | 54,225 | DeepSeek-AI | MIT |
| 56 | GLM-5智谱AI | 1,458 | +/-4 | 27,647 | 智谱AI | MIT |
| 57 | Gemini 3.5 Flash-LiteGoogle Deep Mind | 1,457 | +/-5 | 22,122 | Google Deep Mind | Proprietary |
| 58 | Claude Sonnet 4.5Anthropic | 1,456 | +/-3 | 81,033 | Anthropic | Proprietary |
| 59 | DOLA Seed 2.0 Pro字节跳动Seed团队 | 1,456 | +/-3 | 74,277 | 字节跳动Seed团队 | Proprietary |
| 60 | Hy3腾讯AI实验室 | 1,455 | +/-8 | 6,958 | 腾讯AI实验室 | Apache 2.0 |
| 61 | Qwen3.7-Plus阿里巴巴 | 1,455 | +/-4 | 38,121 | 阿里巴巴 | Proprietary |
| 62 | Claude Sonnet 4.5Anthropic | 1,455 | +/-3 | 79,668 | Anthropic | Proprietary |
| 63 | deepseek-v4-pro-high-previewDeepSeek | 1,455 | +/-4 | 51,569 | DeepSeek | MIT |
| 64 | GPT-5.1 Pro (high)OpenAI | 1,455 | +/-4 | 40,293 | OpenAI | Proprietary |
| 65 | GPT-5.6 Luna (xhigh)OpenAI | 1,453 | +/-5 | 24,740 | OpenAI | Proprietary |
| 66 | Gemma 4 31BDeepMind | 1,451 | +/-8 | 5,898 | DeepMind | Apache 2.0 |
| 67 | Kimi K2 ThinkingMoonshot AI | 1,451 | +/-3 | 70,586 | Moonshot AI | Modified MIT |
| 68 | Opus 4.1 (thinking-16k)Anthropic | 1,450 | +/-3 | 48,828 | Anthropic | Proprietary |
| 69 | GPT-5.3 ChatOpenAI | 1,449 | +/-4 | 32,743 | OpenAI | Proprietary |
| 70 | ERNIE 5.0 Preview (1203)百度 | 1,449 | +/-7 | 9,556 | 百度 | Proprietary |
| 71 | mimo-v2-proXiaomi | 1,448 | +/-5 | 24,384 | Xiaomi | Proprietary |
| 72 | GPT-5.4 mini (high)OpenAI | 1,448 | +/-4 | 59,455 | OpenAI | Proprietary |
| 73 | Opus 4.1Anthropic | 1,448 | +/-3 | 75,935 | Anthropic | Proprietary |
| 74 | ERNIE 5.0 (0110)百度 | 1,446 | +/-4 | 34,899 | 百度 | Proprietary |
| 75 | Gemini 2.5 ProGoogle Deep Mind | 1,446 | +/-2 | 122,612 | Google Deep Mind | Proprietary |
| 76 | GPT-4.5OpenAI | 1,445 | +/-6 | 14,547 | OpenAI | Proprietary |
| 77 | Qwen 3.6 Plus Preview阿里巴巴 | 1,444 | +/-4 | 45,357 | 阿里巴巴 | Proprietary |
| 78 | GPT-4o(2025-03-27)OpenAI | 1,443 | +/-3 | 80,696 | OpenAI | Proprietary |
| 79 | 1,443 | +/-4 | 65,316 | xAI | Proprietary | |
| 80 | MiniMax M3MiniMaxAI | 1,443 | +/-4 | 44,829 | MiniMaxAI | MiniMax Community License |
| 81 | GLM-4.7智谱AI | 1,442 | +/-6 | 11,889 | 智谱AI | MIT |
| 82 | Qwen3.5-397B-A17B阿里巴巴 | 1,441 | +/-3 | 73,640 | 阿里巴巴 | Apache 2.0 |
| 83 | InklingThinking Machines Lab | 1,439 | +/-5 | 22,229 | Thinking Machines Lab | Apache 2.0 |
| 84 | GPT-5.1OpenAI | 1,439 | +/-4 | 43,008 | OpenAI | Proprietary |
| 85 | deepseek-v4-flash-high-previewDeepSeek | 1,438 | +/-4 | 48,691 | DeepSeek | MIT |
| 86 | Gemma 4 26B A4BDeepMind | 1,438 | +/-8 | 5,813 | DeepMind | Apache 2.0 |
| 87 | GPT-5.2 Pro (high)OpenAI | 1,438 | +/-4 | 47,560 | OpenAI | Proprietary |
| 88 | GPT-5.2OpenAI | 1,436 | +/-3 | 79,070 | OpenAI | Proprietary |
| 89 | qwen3.8-27bAlibaba | 1,436 | +/-8 | 6,913 | Alibaba | Apache 2.0 |
| 90 | longcat-flash-chat-2602-expMeituan | 1,436 | +/-5 | 27,983 | Meituan | Proprietary |
| 91 | DeepSeek-V4-FlashDeepSeek-AI | 1,436 | +/-4 | 48,950 | DeepSeek-AI | MIT |
| 92 | Qwen3 Max (Preview)阿里巴巴 | 1,435 | +/-5 | 27,194 | 阿里巴巴 | Proprietary |
| 93 | GPT-5-Pro (high)OpenAI | 1,434 | +/-5 | 31,433 | OpenAI | Proprietary |
| 94 | mimo-v2.5Xiaomi | 1,434 | +/-4 | 44,530 | Xiaomi | MIT |
| 95 | GLM-5V-Turbo智谱AI | 1,433 | +/-7 | 9,361 | 智谱AI | Proprietary |
| 96 | Gemini 3.1 Flash-LiteGoogle Deep Mind | 1,432 | +/-4 | 60,474 | Google Deep Mind | Proprietary |
| 97 | OpenAI o3OpenAI | 1,431 | +/-4 | 58,583 | OpenAI | Proprietary |
| 98 | Kimi K2.5 InstantMoonshot AI | 1,431 | +/-7 | 7,998 | Moonshot AI | Modified MIT |
| 99 | 1,430 | +/-3 | 55,408 | xAI | Proprietary | |
| 100 | Kimi K2 Thinking (thinking-turbo)Moonshot AI | 1,430 | +/-3 | 61,122 | Moonshot AI | Modified MIT |
| 101 | mimo-v2-omniXiaomi | 1,430 | +/-6 | 19,442 | Xiaomi | Proprietary |
| 102 | Muse Glimmer-30BFacebook AI研究实验室 | 1,427 | +/-10 | 3,693 | Facebook AI研究实验室 | Apache-2.0 |
| 103 | Mistral Medium 3.5MistralAI | 1,427 | +/-7 | 11,017 | MistralAI | Modified MIT |
| 104 | GPT-5.2 Chat (0210)OpenAI | 1,427 | +/-4 | 30,974 | OpenAI | Proprietary |
| 105 | Nemotron 3 UltraNVIDIA | 1,426 | +/-7 | 10,700 | NVIDIA | OpenMDW-1.1 |
| 106 | amazon-nova-experimental-chat-26-02-10Amazon | 1,426 | +/-10 | 3,371 | Amazon | Proprietary |
| 107 | Claude Opus 4 (thinking-16k)Anthropic | 1,426 | +/-4 | 35,743 | Anthropic | Proprietary |
| 108 | DeepSeek V3.2DeepSeek-AI | 1,425 | +/-4 | 46,493 | DeepSeek-AI | MIT |
| 109 | DeepSeek V3.2-Exp (thinking)DeepSeek-AI | 1,425 | +/-7 | 8,910 | DeepSeek-AI | MIT |
| 110 | GLM-4.6智谱AI | 1,425 | +/-4 | 35,068 | 智谱AI | MIT |
| 111 | qwen3-max-2025-09-23Alibaba | 1,424 | +/-7 | 8,942 | Alibaba | Proprietary |
| 112 | Qwen3-235B-A22B-2507阿里巴巴 | 1,423 | +/-3 | 95,700 | 阿里巴巴 | Apache 2.0 |
| 113 | DeepSeek V3.2-Exp (thinking)DeepSeek-AI | 1,423 | +/-4 | 40,520 | DeepSeek-AI | MIT |
| 114 | DeepSeek V3.2-ExpDeepSeek-AI | 1,422 | +/-6 | 11,756 | DeepSeek-AI | MIT |
| 115 | DeepSeek-R1-0528DeepSeek-AI | 1,421 | +/-6 | 18,092 | DeepSeek-AI | MIT |
| 116 | ERNIE 5.0百度 | 1,419 | +/-9 | 4,663 | 百度 | Proprietary |
| 117 | 1,418 | +/-8 | 6,336 | xAI | Proprietary | |
| 118 | Kimi K2 0905Moonshot AI | 1,418 | +/-7 | 11,569 | Moonshot AI | Modified MIT |
| 119 | Kimi K2Moonshot AI | 1,418 | +/-5 | 27,033 | Moonshot AI | Modified MIT |
| 120 | DeepSeek-V3.1 Terminus (thinking)DeepSeek-AI | 1,418 | +/-10 | 3,372 | DeepSeek-AI | MIT |
| 121 | DeepSeek-V3.1DeepSeek-AI | 1,417 | +/-6 | 14,609 | DeepSeek-AI | MIT |
| 122 | Qwen3.5-122B-A10B阿里巴巴 | 1,417 | +/-4 | 28,376 | 阿里巴巴 | Apache 2.0 |
| 123 | DeepSeek-V3.1 (thinking)DeepSeek-AI | 1,416 | +/-7 | 11,463 | DeepSeek-AI | MIT |
| 124 | MiniMax-M2.7MiniMaxAI | 1,415 | +/-4 | 65,655 | MiniMaxAI | Modified MIT |
| 125 | amazon-nova-experimental-chat-26-01-10Amazon | 1,415 | +/-10 | 3,352 | Amazon | Proprietary |
| 126 | DeepSeek-V3.1 TerminusDeepSeek-AI | 1,415 | +/-10 | 3,613 | DeepSeek-AI | MIT |
| 127 | GPT-4.1OpenAI | 1,414 | +/-4 | 49,930 | OpenAI | Proprietary |
| 128 | Qwen3-VL-235B-A22B-Instruct阿里巴巴 | 1,414 | +/-7 | 11,222 | 阿里巴巴 | Apache 2.0 |
| 129 | Claude Opus 4Anthropic | 1,414 | +/-4 | 42,848 | Anthropic | Proprietary |
| 130 | Mistral Large 3MistralAI | 1,414 | +/-3 | 65,587 | MistralAI | Apache 2.0 |
| 131 | Haiku 4.5Anthropic | 1,413 | +/-3 | 125,243 | Anthropic | Proprietary |
| 132 | hunyuan-hy3-previewTencent | 1,413 | +/-8 | 6,611 | Tencent | tencent-hunyuan-community |
| 133 | 1,411 | +/-4 | 32,415 | xAI | Proprietary | |
| 134 | GLM-4.5智谱AI | 1,411 | +/-5 | 23,715 | 智谱AI | MIT |
| 135 | 1,411 | +/-4 | 39,300 | xAI | Proprietary | |
| 136 | Gemini 2.5 FlashGoogle Deep Mind | 1,410 | +/-2 | 122,781 | Google Deep Mind | Proprietary |
| 137 | Magistral-Medium-2506MistralAI | 1,409 | +/-3 | 92,749 | MistralAI | Proprietary |
| 138 | Qwen3.5-27B阿里巴巴 | 1,408 | +/-4 | 27,238 | 阿里巴巴 | Apache 2.0 |
| 139 | Inkling SmallThinky | 1,407 | +/-6 | 15,183 | Thinky | Apache 2.0 |
| 140 | 1,404 | +/-5 | 17,971 | xAI | Proprietary | |
| 141 | Gemini 2.5 Flash-Preview-09-2025Google Deep Mind | 1,404 | +/-4 | 32,359 | Google Deep Mind | Proprietary |
| 142 | qwen3-235b-a22b-no-thinkingAlibaba | 1,402 | +/-5 | 37,389 | Alibaba | Apache 2.0 |
| 143 | GPT-5.4 nano (high)OpenAI | 1,402 | +/-4 | 58,540 | OpenAI | Proprietary |
| 144 | OpenAI o1OpenAI | 1,402 | +/-4 | 27,807 | OpenAI | Proprietary |
| 145 | longcat-flash-chatMeituan | 1,401 | +/-6 | 11,161 | Meituan | MIT |
| 146 | Claude Sonnet 4 (thinking-32k)Anthropic | 1,401 | +/-4 | 33,952 | Anthropic | Proprietary |
| 147 | qwen3-235b-a22b-thinking-2507Alibaba | 1,400 | +/-7 | 8,800 | Alibaba | Apache 2.0 |
| 148 | Qwen3-Next阿里巴巴 | 1,399 | +/-5 | 22,532 | 阿里巴巴 | Apache 2.0 |
| 149 | DeepSeek-R1DeepSeek-AI | 1,398 | +/-5 | 18,524 | DeepSeek-AI | MIT |
| 150 | Step 3.5 FlashStepFunAI | 1,397 | +/-4 | 58,280 | StepFunAI | Proprietary |
| 151 | DeepSeek-V3-0324DeepSeek-AI | 1,396 | +/-4 | 44,795 | DeepSeek-AI | MIT |
| 152 | hunyuan-vision-1.5-thinkingTencent | 1,395 | +/-12 | 2,170 | Tencent | Proprietary |
| 153 | Qwen3.5-35B-A3B阿里巴巴 | 1,395 | +/-4 | 29,065 | 阿里巴巴 | Apache 2.0 |
| 154 | Qwen3-VL-235B-A22B-Instruct (thinking)阿里巴巴 | 1,395 | +/-7 | 7,785 | 阿里巴巴 | Apache 2.0 |
| 155 | amazon-nova-experimental-chat-12-10Amazon | 1,394 | +/-10 | 3,635 | Amazon | Proprietary |
| 156 | Step 3.5 FlashStepFunAI | 1,394 | +/-4 | 57,212 | StepFunAI | Apache 2.0 |
| 157 | mimo-v2-flash (non-thinking)Xiaomi | 1,392 | +/-4 | 46,158 | Xiaomi | MIT |
| 158 | OpenAI o4 - miniOpenAI | 1,391 | +/-4 | 44,632 | OpenAI | Proprietary |
| 159 | MiniMax M2.5MiniMaxAI | 1,391 | +/-4 | 40,884 | MiniMaxAI | Modified MIT |
| 160 | Claude Sonnet 4Anthropic | 1,390 | +/-4 | 38,959 | Anthropic | Proprietary |
| 161 | GPT-5-mini (high)OpenAI | 1,389 | +/-5 | 26,569 | OpenAI | Proprietary |
| 162 | OpenAI o1OpenAI | 1,388 | +/-5 | 31,122 | OpenAI | Proprietary |
| 163 | Claude3-Sonnet (thinking-32k)Anthropic | 1,388 | +/-4 | 38,090 | Anthropic | Proprietary |
| 164 | Hunyuan-T1腾讯AI实验室 | 1,387 | +/-9 | 4,581 | 腾讯AI实验室 | Proprietary |
| 165 | mistral-medium-2505Mistral | 1,387 | +/-5 | 32,665 | Mistral | Proprietary |
| 166 | Qwen3-Coder-480B-A35B阿里巴巴 | 1,387 | +/-5 | 25,092 | 阿里巴巴 | Apache 2.0 |
| 167 | mimo-v2-flash (thinking)Xiaomi | 1,386 | +/-6 | 10,749 | Xiaomi | MIT |
| 168 | M2.1MiniMaxAI | 1,384 | +/-5 | 16,633 | MiniMaxAI | MIT |
| 169 | hunyuan-turbos-20250416Tencent | 1,383 | +/-7 | 10,587 | Tencent | Proprietary |
| 170 | GPT-4.1 miniOpenAI | 1,382 | +/-4 | 38,636 | OpenAI | Proprietary |
| 171 | Qwen3-30B-A3B-2507阿里巴巴 | 1,382 | +/-5 | 23,224 | 阿里巴巴 | Apache 2.0 |
| 172 | Gemini 2.5 Flash-Lite-Preview-09-2025 (no-thinking)Google Deep Mind | 1,380 | +/-3 | 46,393 | Google Deep Mind | Proprietary |
| 173 | trinity-large-preview Apache 2.0 | 1,379 | +/-4 | 29,771 | — | — |
| 174 | GLM-4.6V智谱AI | 1,378 | +/-11 | 2,762 | 智谱AI | MIT |
| 175 | solar-pro4Upstage | 1,377 | +/-12 | 2,437 | Upstage | Proprietary |
| 176 | Qwen3-235B-A22B阿里巴巴 | 1,375 | +/-5 | 25,864 | 阿里巴巴 | Apache 2.0 |
| 177 | Gemini 2.5 Flash-Lite (thinking)Google Deep Mind | 1,374 | +/-5 | 32,218 | Google Deep Mind | Proprietary |
| 178 | Qwen2.5-Max阿里巴巴 | 1,374 | +/-4 | 32,417 | 阿里巴巴 | Proprietary |
| 179 | Claude 3.5 SonnetAnthropic | 1,374 | +/-3 | 87,696 | Anthropic | Proprietary |
| 180 | GLM-4.5-Air智谱AI | 1,373 | +/-4 | 30,372 | 智谱AI | MIT |
| 181 | Claude3-SonnetAnthropic | 1,372 | +/-4 | 42,452 | Anthropic | Proprietary |
| 182 | trinity-large-thinking Apache 2.0 | 1,369 | +/-5 | 28,989 | — | — |
| 183 | Qwen3-Next (thinking)阿里巴巴 | 1,369 | +/-6 | 13,391 | 阿里巴巴 | Apache 2.0 |
| 184 | GLM-4.7-Flash智谱AI | 1,366 | +/-6 | 11,514 | 智谱AI | MIT |
| 185 | amazon-nova-experimental-chat-11-10Amazon | 1,365 | +/-4 | 25,104 | Amazon | Proprietary |
| 186 | Gemma 3 - 27B (IT)Google Deep Mind | 1,365 | +/-4 | 46,421 | Google Deep Mind | Gemma |
| 187 | OpenAI o3-mini (high)OpenAI | 1,364 | +/-5 | 15,536 | OpenAI | Proprietary |
| 188 | minimax-m1MiniMax | 1,364 | +/-4 | 34,038 | MiniMax | Apache 2.0 |
| 189 | OpenAI o3-mini (high)OpenAI | 1,363 | +/-5 | 18,589 | OpenAI | Proprietary |
| 190 | nvidia-nemotron-3-super-120b-a12bNvidia | 1,361 | +/-7 | 7,458 | Nvidia | NVIDIA Open Model |
| 191 | Gemini 2.0 Flash ExperimentalDeepMind | 1,360 | +/-4 | 43,346 | DeepMind | Proprietary |
| 192 | DeepSeek-V3DeepSeek-AI | 1,358 | +/-5 | 21,770 | DeepSeek-AI | DeepSeek |
| 193 | 1,358 | +/-5 | 20,840 | xAI | Proprietary | |
| 194 | Mistral-Small-3.2MistralAI | 1,357 | +/-5 | 17,399 | MistralAI | Apache 2.0 |
| 195 | intellect-3 MIT | 1,356 | +/-8 | 5,284 | — | — |
| 196 | nvidia-nemotron-3.5-lightning-30b-a3b-nvfp4Nvidia | 1,355 | +/-9 | 4,814 | Nvidia | OpenMDW-1.1 |
| 197 | C4AI Command A (202503)CohereAI | 1,354 | +/-3 | 55,449 | CohereAI | CC-BY-NC-4.0 |
| 198 | Gemini 2.0 Flash-LiteDeepMind | 1,353 | +/-4 | 24,955 | DeepMind | Proprietary |
| 199 | GLM-4.5V智谱AI | 1,353 | +/-8 | 4,817 | 智谱AI | MIT |
| 200 | GPT OSS 120BOpenAI | 1,352 | +/-4 | 29,955 | OpenAI | Apache 2.0 |
| 201 | Gemini 1.5 ProGoogle Deep Mind | 1,351 | +/-3 | 55,606 | Google Deep Mind | Proprietary |
| 202 | amazon-nova-experimental-chat-10-20Amazon | 1,350 | +/-6 | 11,363 | Amazon | Proprietary |
| 203 | Step3StepFunAI | 1,349 | +/-8 | 6,277 | StepFunAI | Apache 2.0 |
| 204 | hunyuan-turbos-20250226Tencent | 1,349 | +/-12 | 2,220 | Tencent | Proprietary |
| 205 | OpenAI o3-miniOpenAI | 1,348 | +/-4 | 56,661 | OpenAI | Proprietary |
| 206 | llama-3.1-nemotron-ultra-253b-v1Nvidia | 1,347 | +/-12 | 2,549 | Nvidia | Nvidia Open Model |
| 207 | Qwen3-32B阿里巴巴 | 1,347 | +/-9 | 3,926 | 阿里巴巴 | Apache 2.0 |
| 208 | amazon-nova-experimental-chat-10-09Amazon | 1,347 | +/-11 | 2,775 | Amazon | Proprietary |
| 209 | mercury-2 InceptionAI | 1,347 | +/-11 | 3,043 | AI | Proprietary |
| 210 | qwen-plus-0125Alibaba | 1,346 | +/-8 | 5,819 | Alibaba | Proprietary |
| 211 | GPT-4oOpenAI | 1,346 | +/-3 | 112,881 | OpenAI | Proprietary |
| 212 | MiniMax M2MiniMaxAI | 1,346 | +/-8 | 6,752 | MiniMaxAI | Apache 2.0 |
| 213 | ling-flash-2.0 AntGroup | 1,344 | +/-7 | 6,853 | Group | MIT |
| 214 | nvidia-llama-3.3-nemotron-super-49b-v1.5Nvidia | 1,343 | +/-10 | 3,316 | Nvidia | Nvidia Open |
| 215 | Claude 3.5 SonnetAnthropic | 1,343 | +/-3 | 82,419 | Anthropic | Proprietary |
| 216 | glm-4-plus-0111Zhipu | 1,343 | +/-8 | 5,760 | Zhipu | Proprietary |
| 217 | granite-4.2-30bIBM | 1,342 | +/-11 | 3,275 | IBM | Apache 2.0 |
| 218 | Gemma 3 - 12B (IT)Google Deep Mind | 1,342 | +/-10 | 3,829 | Google Deep Mind | Gemma |
| 219 | hunyuan-turbo-0110Tencent | 1,341 | +/-12 | 2,290 | Tencent | Proprietary |
| 220 | GPT-5-Nano (high)OpenAI | 1,337 | +/-7 | 8,134 | OpenAI | Proprietary |
| 221 | OpenAI o1-miniOpenAI | 1,337 | +/-4 | 51,981 | OpenAI | Proprietary |
| 222 | Nova 2 Lite亚马逊 | 1,336 | +/-6 | 12,119 | 亚马逊 | Proprietary |
| 223 | QwQ-32B阿里巴巴 | 1,336 | +/-4 | 25,092 | 阿里巴巴 | Apache 2.0 |
| 224 | gemini-advanced-0514Google | 1,335 | +/-5 | 50,148 | Proprietary | |
| 225 | 1,335 | +/-4 | 63,498 | xAI | Proprietary | |
| 226 | GPT-4oOpenAI | 1,335 | +/-4 | 45,499 | OpenAI | Proprietary |
| 227 | llama-3.1-405b-instruct-bf16Meta | 1,335 | +/-4 | 41,375 | Meta | Llama 3.1 Community |
| 228 | step-2-16k-exp-202412StepFun | 1,333 | +/-9 | 4,833 | StepFun | Proprietary |
| 229 | llama-3.1-405b-instruct-fp8Meta | 1,333 | +/-4 | 59,656 | Meta | Llama 3.1 Community |
| 230 | olmo-3.1-32b-instructAi2 | 1,330 | +/-6 | 11,460 | Ai2 | Apache 2.0 |
| 231 | yi-lightning Proprietary | 1,328 | +/-5 | 27,332 | — | — |
| 232 | llama-3.3-nemotron-49b-super-v1Nvidia | 1,328 | +/-12 | 2,218 | Nvidia | Nvidia |
| 233 | molmo-2-8bAi2 | 1,328 | +/-21 | 792 | Ai2 | Apache 2.0 |
| 234 | Qwen3-30B-A3B阿里巴巴 | 1,327 | +/-5 | 26,092 | 阿里巴巴 | Apache 2.0 |
| 235 | Llama 4 Maverick InstructFacebook AI研究实验室 | 1,327 | +/-4 | 39,360 | Facebook AI研究实验室 | Llama 4 |
| 236 | hunyuan-large-2025-02-10Tencent | 1,326 | +/-10 | 3,738 | Tencent | Proprietary |
| 237 | gpt-4-turbo-2024-04-09OpenAI | 1,324 | +/-4 | 98,114 | OpenAI | Proprietary |
| 238 | Claude 3.5 HaikuAnthropic | 1,324 | +/-3 | 68,974 | Anthropic | Proprietary |
| 239 | Gemini 1.5 ProGoogle Deep Mind | 1,324 | +/-4 | 79,138 | Google Deep Mind | Proprietary |
| 240 | deepseek-v2.5-1210DeepSeek | 1,323 | +/-8 | 6,795 | DeepSeek | DeepSeek |
| 241 | GPT-4.1 nanoOpenAI | 1,322 | +/-8 | 6,103 | OpenAI | Proprietary |
| 242 | Claude3-OpusAnthropic | 1,322 | +/-3 | 194,909 | Anthropic | Proprietary |
| 243 | Llama 4 Scout InstructFacebook AI研究实验室 | 1,321 | +/-5 | 29,747 | Facebook AI研究实验室 | Llama |
| 244 | ring-flash-2.0 AntGroup | 1,321 | +/-7 | 6,902 | Group | MIT |
| 245 | step-1o-turbo-202506StepFun | 1,320 | +/-7 | 8,860 | StepFun | Proprietary |
| 246 | glm-4-plusZhipu AI | 1,319 | +/-5 | 26,126 | Zhipu AI | Proprietary |
| 247 | qwen-max-0919Alibaba | 1,318 | +/-6 | 16,478 | Alibaba | Qwen |
| 248 | GPT-4o miniOpenAI | 1,317 | +/-4 | 68,697 | OpenAI | Proprietary |
| 249 | Llama3.3-70B-InstructFacebook AI研究实验室 | 1,317 | +/-4 | 54,415 | Facebook AI研究实验室 | Llama-3.3 |
| 250 | Gemma-3n-E4BGoogle Deep Mind | 1,317 | +/-5 | 22,087 | Google Deep Mind | Gemma |
| 251 | GPT OSS 20BOpenAI | 1,317 | +/-6 | 10,394 | OpenAI | Apache 2.0 |
| 252 | qwen2.5-plus-1127Alibaba | 1,315 | +/-6 | 10,187 | Alibaba | Proprietary |
| 253 | nvidia-nemotron-3-nano-30b-a3b-bf16Nvidia | 1,314 | +/-6 | 15,332 | Nvidia | NVIDIA Open Model |
| 254 | mistral-large-2407Mistral | 1,314 | +/-4 | 45,459 | Mistral | Mistral Research |
| 255 | athene-v2-chat NexusFlow | 1,314 | +/-5 | 24,739 | — | — |
| 256 | GPT-4OpenAI | 1,313 | +/-4 | 93,439 | OpenAI | Proprietary |
| 257 | GPT-4OpenAI | 1,312 | +/-4 | 100,105 | OpenAI | Proprietary |
| 258 | hunyuan-standard-2025-02-10Tencent | 1,311 | +/-10 | 3,904 | Tencent | Proprietary |
| 259 | gemini-1.5-flash-002Google | 1,309 | +/-4 | 34,902 | Proprietary | |
| 260 | 1,308 | +/-4 | 52,567 | xAI | Proprietary | |
| 261 | mercury InceptionAI | 1,308 | +/-14 | 1,928 | AI | Proprietary |
| 262 | DeepSeek V2.5DeepSeek-AI | 1,307 | +/-5 | 24,572 | DeepSeek-AI | DeepSeek |
| 263 | olmo-3-32b-thinkAi2 | 1,307 | +/-8 | 5,683 | Ai2 | Apache 2.0 |
| 264 | athene-70b-0725 CC-BY-NC-4.0 | 1,306 | +/-6 | 19,621 | — | — |
| 265 | granite-4.1-8bIBM | 1,306 | +/-10 | 4,028 | IBM | Apache 2.0 |
| 266 | mistral-large-2411Mistral | 1,305 | +/-4 | 28,073 | Mistral | MRL |
| 267 | Magistral-Medium-2506MistralAI | 1,304 | +/-6 | 11,467 | MistralAI | Proprietary |
| 268 | Gemma 3 - 4B (IT)Google Deep Mind | 1,303 | +/-9 | 4,171 | Google Deep Mind | Gemma |
| 269 | Mistral-Small-3.1-24B-Instruct-2503MistralAI | 1,303 | +/-5 | 32,630 | MistralAI | Apache 2.0 |
| 270 | Qwen2.5-VL-72B-Instruct阿里巴巴 | 1,303 | +/-4 | 39,406 | 阿里巴巴 | Qwen |
| 271 | Llama3.1-70B-InstructFacebook AI研究实验室 | 1,299 | +/-8 | 7,140 | Facebook AI研究实验室 | Llama 3.1 |
| 272 | granite-4.2-3bIBM | 1,296 | +/-12 | 3,093 | IBM | Apache 2.0 |
| 273 | hunyuan-large-visionTencent | 1,294 | +/-9 | 5,260 | Tencent | Proprietary |
| 274 | Llama3.1-70B-InstructFacebook AI研究实验室 | 1,293 | +/-4 | 55,240 | Facebook AI研究实验室 | Llama 3.1 Community |
| 275 | amazon-nova-pro-v1.0Amazon | 1,290 | +/-5 | 24,745 | Amazon | Proprietary |
| 276 | jamba-1.5-large Jamba Open | 1,289 | +/-7 | 8,662 | — | — |
| 277 | gemma-2-27b-itGoogle | 1,289 | +/-3 | 75,754 | Gemma license | |
| 278 | granite-4.2-8bIBM | 1,288 | +/-11 | 3,111 | IBM | Apache 2.0 |
| 279 | reka-core-20240904 Proprietary | 1,288 | +/-7 | 7,312 | — | — |
| 280 | GPT-4OpenAI | 1,287 | +/-5 | 54,173 | OpenAI | Proprietary |
| 281 | gemini-1.5-flash-001Google | 1,286 | +/-5 | 62,833 | Proprietary | |
| 282 | llama-3.1-nemotron-51b-instructNvidia | 1,286 | +/-10 | 3,749 | Nvidia | Llama 3.1 |
| 283 | llama-3.1-tulu-3-70bAi2 | 1,286 | +/-10 | 2,846 | Ai2 | Llama 3.1 |
| 284 | olmo-3.1-32b-thinkAi2 | 1,286 | +/-7 | 8,116 | Ai2 | Apache 2.0 |
| 285 | ibm-granite-h-smallIBM | 1,285 | +/-8 | 5,535 | IBM | Apache 2.0 |
| 286 | Claude3-SonnetAnthropic | 1,281 | +/-4 | 109,284 | Anthropic | Proprietary |
| 287 | gemma-2-9b-it-simpo MIT | 1,280 | +/-7 | 10,072 | — | — |
| 288 | nemotron-4-340b-instructNvidia | 1,277 | +/-5 | 19,659 | Nvidia | NVIDIA Open Model |
| 289 | Llama3-70B-InstructFacebook AI研究实验室 | 1,276 | +/-4 | 156,876 | Facebook AI研究实验室 | Llama 3 Community |
| 290 | command-r-plus-08-2024Cohere | 1,276 | +/-7 | 9,866 | Cohere | CC-BY-NC-4.0 |
| 291 | GPT-4OpenAI | 1,275 | +/-4 | 88,723 | OpenAI | Proprietary |
| 292 | Mistral Small 24B Instruct 2501MistralAI | 1,274 | +/-6 | 14,681 | MistralAI | Apache 2.0 |
| 293 | GLM4智谱AI | 1,273 | +/-7 | 9,788 | 智谱AI | Proprietary |
| 294 | reka-flash-20240904 Proprietary | 1,272 | +/-7 | 7,536 | — | — |
| 295 | Qwen2.5-Coder-32B-Instruct阿里巴巴 | 1,270 | +/-8 | 5,432 | 阿里巴巴 | Apache 2.0 |
| 296 | C4AI Aya Vision 32BCohereAI | 1,267 | +/-5 | 27,124 | CohereAI | CC-BY-NC-4.0 |
| 297 | gemma-2-9b-itGoogle | 1,267 | +/-4 | 54,611 | Gemma license | |
| 298 | deepseek-coder-v2DeepSeek | 1,265 | +/-6 | 15,147 | DeepSeek | DeepSeek License |
| 299 | Qwen2-72B-Instruct阿里巴巴 | 1,261 | +/-5 | 37,325 | 阿里巴巴 | Qianwen LICENSE |
| 300 | C4AI Command R+CohereAI | 1,261 | +/-4 | 77,554 | CohereAI | CC-BY-NC-4.0 |
| 301 | Claude3-HaikuAnthropic | 1,261 | +/-4 | 117,701 | Anthropic | Proprietary |
| 302 | amazon-nova-lite-v1.0Amazon | 1,260 | +/-5 | 19,372 | Amazon | Proprietary |
| 303 | gemini-1.5-flash-8b-001Google | 1,258 | +/-4 | 35,558 | Proprietary | |
| 304 | Phi-4-reasoningMicrosoft Azure | 1,256 | +/-5 | 24,126 | Microsoft Azure | MIT |
| 305 | olmo-2-0325-32b-instructAi2 | 1,251 | +/-11 | 3,334 | Ai2 | Apache-2.0 |
| 306 | command-r-08-2024Cohere | 1,250 | +/-7 | 10,140 | Cohere | CC-BY-NC-4.0 |
| 307 | mistral-large-2402Mistral | 1,242 | +/-5 | 62,436 | Mistral | Proprietary |
| 308 | amazon-nova-micro-v1.0Amazon | 1,240 | +/-5 | 19,364 | Amazon | Proprietary |
| 309 | jamba-1.5-mini Jamba Open | 1,239 | +/-7 | 8,858 | — | — |
| 310 | ministral-8b-2410Mistral | 1,237 | +/-9 | 4,781 | Mistral | MRL |
| 311 | gemini-pro-dev-apiGoogle | 1,236 | +/-7 | 18,354 | Proprietary | |
| 312 | Qwen1.5-110B-Chat阿里巴巴 | 1,234 | +/-6 | 26,195 | 阿里巴巴 | Qianwen LICENSE |
| 313 | hunyuan-standard-256kTencent | 1,233 | +/-12 | 2,728 | Tencent | Proprietary |
| 314 | reka-flash-21b-20240226-online Proprietary | 1,233 | +/-7 | 15,450 | — | — |
| 315 | Qwen1.5-72B-Chat阿里巴巴 | 1,233 | +/-5 | 39,302 | 阿里巴巴 | Qianwen LICENSE |
| 316 | Mixtral-8x22B-Instruct-v0.1MistralAI | 1,229 | +/-5 | 51,416 | MistralAI | Apache 2.0 |
| 317 | command-rCohere | 1,226 | +/-5 | 54,036 | Cohere | CC-BY-NC-4.0 |
| 318 | reka-flash-21b-20240226 Proprietary | 1,226 | +/-6 | 24,806 | — | — |
| 319 | gpt-3.5-turbo-0125OpenAI | 1,225 | +/-5 | 66,207 | OpenAI | Proprietary |
| 320 | Llama3-8B-InstructFacebook AI研究实验室 | 1,223 | +/-4 | 104,642 | Facebook AI研究实验室 | Llama 3 Community |
| 321 | Gemini-proDeepMind | 1,223 | +/-12 | 6,390 | DeepMind | Proprietary |
| 322 | C4AI Aya Vision 8BCohereAI | 1,223 | +/-7 | 9,818 | CohereAI | CC-BY-NC-4.0 |
| 323 | mistral-mediumMistral | 1,222 | +/-5 | 34,550 | Mistral | Proprietary |
| 324 | llama-3.1-tulu-3-8bAi2 | 1,220 | +/-11 | 2,896 | Ai2 | Llama 3.1 |
| 325 | Yi-1.5-34B零一万物 | 1,212 | +/-5 | 24,146 | 零一万物 | — |
| 326 | zephyr-orpo-141b-A35b-v0.1 Apache 2.0 | 1,212 | +/-11 | 4,652 | — | — |
| 327 | Llama3.1-8B-InstructFacebook AI研究实验室 | 1,211 | +/-4 | 49,605 | Facebook AI研究实验室 | Llama 3.1 Community |
| 328 | Llama3.1-8B-InstructFacebook AI研究实验室 | 1,208 | +/-11 | 3,090 | Facebook AI研究实验室 | Apache 2.0 |
| 329 | qwen1.5-32b-chatAlibaba | 1,203 | +/-6 | 21,741 | Alibaba | Qianwen LICENSE |
| 330 | gpt-3.5-turbo-1106OpenAI | 1,203 | +/-9 | 16,619 | OpenAI | Proprietary |
| 331 | gemma-2-2b-itGoogle | 1,200 | +/-4 | 46,616 | Gemma license | |
| 332 | Phi-3-medium 14B-previewMicrosoft Azure | 1,197 | +/-5 | 25,055 | Microsoft Azure | MIT |
| 333 | mixtral-8x7b-instruct-v0.1Mistral | 1,197 | +/-4 | 73,503 | Mistral | Apache 2.0 |
| 334 | dbrx-instruct-preview DBRX LICENSE | 1,195 | +/-6 | 32,191 | — | — |
| 335 | Qwen1.5-14B-Chat阿里巴巴 | 1,191 | +/-7 | 17,839 | 阿里巴巴 | Qianwen LICENSE |
| 336 | InternLM2-Base-20B上海人工智能实验室 | 1,190 | +/-7 | 9,901 | 上海人工智能实验室 | — |
| 337 | DeepSeek LLM 67B ChatDeepSeek-AI | 1,184 | +/-11 | 4,932 | DeepSeek-AI | DeepSeek License |
| 338 | WizardLM-70B-V1.0WizardLM Team | 1,184 | +/-9 | 8,214 | WizardLM Team | Llama 2 Community |
| 339 | Yi-34B零一万物 | 1,183 | +/-7 | 15,483 | 零一万物 | — |
| 340 | granite-3.0-8b-instructIBM | 1,182 | +/-9 | 6,638 | IBM | Apache 2.0 |
| 341 | openchat-3.5 Apache-2.0 | 1,182 | +/-10 | 7,968 | — | — |
| 342 | openchat-3.5-0106 Apache-2.0 | 1,182 | +/-8 | 12,637 | — | — |
| 343 | Gemma 1.1-7B-ITGoogle Research | 1,182 | +/-6 | 23,893 | Google Research | Gemma license |
| 344 | snowflake-arctic-instruct Apache 2.0 | 1,179 | +/-6 | 32,832 | — | — |
| 345 | granite-3.1-2b-instructIBM | 1,178 | +/-11 | 3,188 | IBM | Apache 2.0 |
| 346 | LLaMA2 70BFacebook AI研究实验室 | 1,177 | +/-10 | 6,535 | Facebook AI研究实验室 | — |
| 347 | openhermes-2.5-mistral-7b Apache-2.0 | 1,175 | +/-10 | 5,006 | — | — |
| 348 | Vicuna 33BLM-SYS | 1,172 | +/-6 | 22,479 | LM-SYS | — |
| 349 | starling-lm-7b-beta Apache-2.0 | 1,171 | +/-7 | 16,056 | — | — |
| 350 | Phi-3-small 7BMicrosoft Azure | 1,171 | +/-6 | 17,766 | Microsoft Azure | MIT |
| 351 | llama-2-70b-chatMeta | 1,170 | +/-5 | 38,492 | Meta | Llama 2 Community |
| 352 | starling-lm-7b-alpha CC-BY-NC-4.0 | 1,167 | +/-8 | 10,224 | — | — |
| 353 | llama-3.2-3b-instructMeta | 1,166 | +/-8 | 7,936 | Meta | Llama 3.2 |
| 354 | nous-hermes-2-mixtral-8x7b-dpo Apache-2.0 | 1,164 | +/-12 | 3,777 | — | — |
| 355 | Qwen3-VL-2B阿里巴巴 | 1,156 | +/-8 | 6,837 | 阿里巴巴 | Apache 2.0 |
| 356 | llama2-70b-steerlm-chatNvidia | 1,154 | +/-13 | 3,585 | Nvidia | Llama 2 Community |
| 357 | QwQ-32B-Preview阿里巴巴 | 1,154 | +/-11 | 3,231 | 阿里巴巴 | Apache 2.0 |
| 358 | solar-10.7b-instruct-v1.0 CC-BY-NC-4.0 | 1,152 | +/-13 | 4,155 | — | — |
| 359 | dolphin-2.2.1-mistral-7b Apache-2.0 | 1,152 | +/-15 | 1,679 | — | — |
| 360 | mpt-30b-chat CC-BY-NC-SA-4.0 | 1,150 | +/-12 | 2,572 | — | — |
| 361 | wizardlm-13bMicrosoft | 1,149 | +/-9 | 7,044 | Microsoft | Llama 2 Community |
| 362 | Mistral-7B-Instruct-v0.2MistralAI | 1,149 | +/-7 | 19,402 | MistralAI | Apache-2.0 |
| 363 | falcon-180b-chat Falcon-180B TII License | 1,147 | +/-17 | 1,295 | — | — |
| 364 | Qwen1.5-7B-Chat阿里巴巴 | 1,143 | +/-10 | 4,737 | 阿里巴巴 | Qianwen LICENSE |
| 365 | Phi-3-mini 3.8BMicrosoft Azure | 1,143 | +/-6 | 12,297 | Microsoft Azure | MIT |
| 366 | Baichuan2-13B-Chat百川智能 | 1,141 | +/-7 | 19,174 | 百川智能 | Llama 2 Community |
| 367 | vicuna-13b Llama 2 Community | 1,141 | +/-7 | 19,367 | — | — |
| 368 | Qwen-14B-Chat阿里巴巴 | 1,139 | +/-11 | 4,964 | 阿里巴巴 | Qianwen LICENSE |
| 369 | PaLM 2Google Research | 1,138 | +/-9 | 8,554 | Google Research | Proprietary |
| 370 | Gemma 7B - ItGoogle Research | 1,137 | +/-9 | 8,925 | Google Research | Gemma license |
| 371 | CodeLLaMA-34BFacebook AI研究实验室 | 1,136 | +/-9 | 7,366 | Facebook AI研究实验室 | Llama 2 Community |
| 372 | zephyr-7b-beta MIT | 1,130 | +/-9 | 11,118 | — | — |
| 373 | Phi-3-mini 3.8BMicrosoft Azure | 1,129 | +/-7 | 20,685 | Microsoft Azure | MIT |
| 374 | Phi-3-mini 3.8BMicrosoft Azure | 1,128 | +/-6 | 20,118 | Microsoft Azure | MIT |
| 375 | guanaco-33b Non-commercial | 1,127 | +/-12 | 2,921 | — | — |
| 376 | zephyr-7b-alpha MIT | 1,126 | +/-16 | 1,785 | — | — |
| 377 | stripedhyena-nous-7b Apache 2.0 | 1,121 | +/-11 | 5,182 | — | — |
| 378 | CodeLlama-70B-InstructFacebook AI研究实验室 | 1,119 | +/-18 | 1,143 | Facebook AI研究实验室 | Llama 2 Community |
| 379 | Gemma 1.1-2B-ITGoogle Research | 1,116 | +/-8 | 10,854 | Google Research | Gemma license |
| 380 | vicuna-7b Llama 2 Community | 1,115 | +/-9 | 6,923 | — | — |
| 381 | smollm2-1.7b-instruct Apache 2.0 | 1,114 | +/-14 | 2,199 | — | — |
| 382 | llama-3.2-1b-instructMeta | 1,111 | +/-8 | 8,045 | Meta | Llama 3.2 |
| 383 | Mistral 7B InstructMistralAI | 1,110 | +/-9 | 8,977 | MistralAI | Apache 2.0 |
| 384 | Baichuan2-7B-Chat百川智能 | 1,107 | +/-7 | 14,148 | 百川智能 | Llama 2 Community |
| 385 | Gemma 2B - ItGoogle Research | 1,093 | +/-11 | 4,780 | Google Research | Gemma license |
| 386 | Qwen1.5-4B-Chat阿里巴巴 | 1,090 | +/-9 | 7,597 | 阿里巴巴 | Qianwen LICENSE |
| 387 | olmo-7b-instructAi2 | 1,073 | +/-11 | 6,328 | Ai2 | Apache-2.0 |
| 388 | Koala达摩院 | 1,070 | +/-10 | 6,965 | 达摩院 | — |
| 389 | alpaca-13b Non-commercial | 1,069 | +/-11 | 5,745 | — | — |
| 390 | GPT4All 13BNomic AI | 1,067 | +/-15 | 1,743 | Nomic AI | — |
| 391 | mpt-7b-chat CC-BY-NC-SA-4.0 | 1,063 | +/-12 | 3,924 | — | — |
| 392 | ChatGLM3-6B智谱AI | 1,056 | +/-12 | 4,658 | 智谱AI | — |
| 393 | RWKV-4-Raven-14B Apache 2.0 | 1,042 | +/-11 | 4,845 | — | — |
| 394 | ChatGLM2-6B智谱AI | 1,024 | +/-14 | 2,658 | 智谱AI | — |
| 395 | oasst-pythia-12b Apache 2.0 | 1,023 | +/-11 | 6,310 | — | — |
| 396 | ChatGLM-6B智谱AI | 995 | +/-13 | 4,914 | 智谱AI | — |
| 397 | fastchat-t5-3b Apache 2.0 | 992 | +/-12 | 4,203 | — | — |
| 398 | dolly-v2-12b MIT | 982 | +/-13 | 3,412 | — | — |
| 399 | LLaMA 13BFacebook AI研究实验室 | 974 | +/-16 | 2,391 | Facebook AI研究实验室 | Non-commercial |
| 400 | stablelm-tuned-alpha-7b CC-BY-NC-SA-4.0 | 953 | +/-13 | 3,287 | — | — |
数据仅供参考,以官方来源为准。模型名称旁的链接可跳转到 DataLearner 模型详情页。
常见问题 (FAQ)
什么是 Text Generation Arena (LMArena)?
Text Generation Arena(原 LMSYS Chatbot Arena)是目前最具影响力的大模型匿名评测平台。用户向两个身份未知的模型提问,根据回答质量投票,系统通过 Elo 算法将数百万次投票汇聚为动态排行榜,被学术界和工业界广泛引用。
Arena Elo 分数是如何计算的?
Elo 算法源自国际象棋评分体系。每次对战后,胜者得分上升、败者下降,幅度取决于双方原始评分差距。95% 置信区间(CI)反映该模型参与对战次数的多少:CI 越窄说明数据越充分、排名越可信。
为什么同一模型会出现"Thinking"和普通两个版本?
部分模型支持"扩展思考"(Extended Thinking)模式,会在给出最终答案前进行更深入的内部推理。该模式通常在逻辑推理、数学和编程任务上得分更高,但响应时延也更长、成本更高。Arena 将两种模式分开评测,以便用户根据实际需求选择。
如何根据排行榜选择适合自己的大语言模型?
建议综合考虑:综合性能(看 Elo 总分)、成本(闭源 API 按量计费,开源可自部署)、中文支持、开源程度以及响应速度。



























