AI大模型评测排行榜
聚合 ARC-AGI-2、AIME 2025、SWE-bench Verified 等主流评测的实时排名,按综合、数学、编程、Agent 等维度快速筛选。
综合排名
目前没有一个被普遍认可的"AI 模型综合排名",因此我们选取了两个具有代表性、且切入角度不同的综合榜单并列展示。Artificial Analysis 智能指数(AA Intelligence Index)汇总编程、数学、推理等 10 项标准化评测的跑分,衡量模型的客观能力;LMArena(原 Chatbot Arena)基于全球用户匿名盲测 A/B 投票得出的 Elo 分数,反映真实使用体感。两者分别提供客观基准与主观偏好的视角。

近期排名变化
代码、数学、Agent 榜单近 30 天的排名上升、下降与新上榜模型。
代码能力
完整榜单- Gemini 3 Deep Think February 2026 Upgrade数据更新#1·Google Deep Mind·3455
- DeepSeek V3.2 Speciale数据更新#2·DeepSeek-AI·2701
- GPT Opensources 120B数据更新#3·OpenAI·1715.03
- GPT Opensources 20B数据更新#4·OpenAI·1593.33
- OpenAI o4 - mini数据更新#5·OpenAI·1393.55
- OpenAI o3-mini数据更新#7·OpenAI·1056.9
- Google Gemma 4 E4B数据更新#13·DeepMind·496
- Google Gemma 4 E2B数据更新#15·DeepMind·338.5
数学能力
完整榜单- Grok 4 Heavy数据更新#2·xAI·100
- Gemini 2.5 Deep Think数据更新#3·Google Deep Mind·99.2
- Step 3.5 Flash数据更新#5·StepFunAI·98.55
- GPT-5-Pro数据更新#6·OpenAI·98.35
- Kimi K2 Thinking数据更新#7·Moonshot AI·97.87
- Gemini 3.0 Flash数据更新#8·Google Deep Mind·97.45
- Kimi k1.5 (Long-CoT)数据更新#9·Moonshot AI·96.2
- OpenAI o4 - mini数据更新#11·OpenAI·96.07
单项评测排名
按数学、编程、Agent 等维度筛选排名。下方可切换评测基准,也可直接进入分类排行榜查看完整排名。 查看全部评测基准。
AI 模型推荐
按 HLE 排序大模型性能评测结果
数据来源:DataLearnerAI点击任意行查看模型详情;勾选左侧 可对比最多 4 个模型。表中分数为各评测模式中的最高得分。
排行榜常见问题
排行榜的数据来源是什么?
所有得分来自一手出处:模型官方 model card、技术报告、论文、厂商博客与可复现的第三方评测。每一行均链回对应的模型详情页,可查看原始引用。
为什么同一模型在不同基准上分数差异很大?
每个基准测的能力不一样:推理类(HLE、ARC-AGI-2)、数学类(AIME、FrontierMath)、编程类(SWE-bench Verified)、Agent 工具使用类(τ²-Bench)等。模型在某一能力上专门优化后,往往会牺牲另一些能力,因此排行榜按基准分别展示,而不是合并成一个分数。
排行榜多久更新一次?
数据每 5 分钟自动重新校验一次;新模型或新评测结果一旦公开就会同步收录。页面顶部的"数据更新于"指示器反映最近一次数据刷新时间。
综合排名应该怎么解读?
综合榜聚合了模型在多个核心基准上的位次,可作为初筛工具。但落地选型时建议进入与你业务最相关的单项基准查看,例如 Coding Agent 看 SWE-bench Verified、工具调用场景看 τ²-Bench。
开源大模型和闭源 API 模型怎么对比?
使用顶部的"许可"筛选切换为"全部",开源与闭源模型可在同一基准列直接对比。除分数外,还需考虑总持有成本:闭源模型按 API 用量计费,开源模型则需衡量自部署的硬件与运维成本。
知名模型开发商
查看全部 101 家机构点击进入开发商主页,查看其全部模型、系列与产品线。
阿里巴巴
OpenAI
Google Deep Mind
Facebook AI研究实验室
智谱AI
DeepSeek-AI
MistralAI
Google Research
Microsoft Azure
Anthropic
百度
Stability AI
字节跳动Seed团队模型对比分析
逐项对比的深度分析:评测分差到底意味着什么,以及什么场景该选哪一个。
GPT-6 Astra对比Claude Fable 5.1,谁更强,哪个价格更有优势
GPT-6 Astra 与 Claude Fable 5.1 是 OpenAI 和 Anthropic 在 2026 年推出的两款旗舰级模型,两者都面向复杂推理、编程、Agent 和长时程知识工作。从目前可直接对比的 8 项评测来看,GPT-6 Astra 以 5 项领先、3 项落后的成绩取得小幅整体优势,在 ARC-AGI、AutomationBench、Terminal-Bench 及科学工具任务上表现更突出;Claude Fable 5.1 则在 HLE、AA Intelligence Index 和 OSWorld 2.0 等知识推理与计算机操作评测中占优。两款模型均提供约 100 万 token 上下文和 128K 最大输出,API 基础价格也同为每百万 token 输入 10 美元、输出 50 美元,因此实际选型更取决于任务类型、Agent 工作流以及缓存使用方式,而非单纯的价格或综合分数。
Claude Fable 5.1 / Fable 5 / Opus 5 与 GPT-5.6 Sol 四方对比:评测、价格与选型
四款模型共有的 4 项 0–100 量表评测里,Fable 5.1 平均 58.8 分居首,Opus 5 50.3、Fable 5 46.7、GPT-5.6 Sol 42.5;计算机操作(OSWorld 2.0 partial)上 Fable 5.1 以 77.9 对 75.4 小幅领先 Opus 5,但它的价格是 Opus 5 的两倍、Sol 的 2.5 倍。
Claude Fable 5.1 相比 Fable 5 提升了什么?两代模型的评测数据与升级取舍
Fable 5.1 在双方共有的 5 项 0–100 量表评测中全部领先、平均分高 10.2 分,但增益极度集中——Terminal-Bench-Science 0.1 从 21.4 跳到 52.6,而知识密集型的 HLE 只提升 1.9 分。价格与规格完全没变。
HY-4(Hy4 preview)与 GLM-5.3 对比:770B 对 744B,两款国产 MoE 旗舰怎么选?
HY-4 与 GLM-5.3 的总参数分别为 770B 和 744B,激活参数分别为 49B 和 40B,规模与定位非常接近。当前 12 项共同评测中 GLM-5.3 领先 10 项,HY-4 则在 NL2Repo-Bench 与 Toolathlon-Verified 上小幅领先;前者已 GA,后者仍是 preview。
探索更多
排行榜只覆盖参与评测的模型。你还可以按模型、机构或评测基准浏览完整内容。





