AI大模型评测排行榜
聚合 ARC-AGI-2、AIME 2025、SWE-bench Verified 等主流评测的实时排名,按综合、数学、编程、Agent 等维度快速筛选。
综合排名
从三个视角参考大模型表现:AA 智能指数汇总标准化能力评测,LMArena 反映匿名对战中的用户偏好,Vals Index 衡量按行业经济权重加权的实际任务能力。三个榜单各自排名,分数不跨榜比较。










近期排名变化
代码、数学、Agent 榜单近 30 天的排名上升、下降与新上榜模型。
代码能力
完整榜单- DeepSeek V4.1 Flash新上榜#1·DeepSeek-AI·3471
- Gemini 3 Deep Think February 2026 Upgrade数据更新#2·Google DeepMind·3455
- DeepSeek V3.2 Speciale数据更新#3·DeepSeek-AI·1395.3
- Google Gemma 4 31B数据更新#4·Google DeepMind·1115
- GPT Opensources 120B数据更新#5·OpenAI·1060.72
- GPT Opensources 20B数据更新#6·OpenAI·984.58
- OpenAI o4 - mini数据更新#7·OpenAI·957.67
- Google Gemma 4 26B A4B数据更新#8·Google DeepMind·897.55
数学能力
完整榜单- Gemini 2.5 Deep Think数据更新#2·Google DeepMind·99.2
- GPT-5 Codex数据更新#3·OpenAI·98.7
- Anthropic Claude Opus 4.6数据更新#4·Anthropic·98.69
- MAI-Thinking-1数据更新#8·微软·97
- Ternary Bonsai 2 27B新上榜#9·PrismML·96.82
- Kimi k1.5 (Long-CoT)数据更新#10·Moonshot AI·96.2
- Kimi K2.5数据更新#11·Moonshot AI·96.1
- DeepSeek V3.2 Speciale数据更新#12·DeepSeek-AI·96
单项评测排名
按数学、编程、Agent 等维度筛选排名。下方可切换评测基准,也可直接进入分类排行榜查看完整排名。 查看全部评测基准。
大模型性能评测结果
数据来源:DataLearnerAI点击任意行查看模型详情;勾选左侧 可对比最多 4 个模型。表中分数为各评测模式中的最高得分。
排行榜常见问题
排行榜的数据来源是什么?
所有得分来自一手出处:模型官方 model card、技术报告、论文、厂商博客与可复现的第三方评测。每一行均链回对应的模型详情页,可查看原始引用。
为什么同一模型在不同基准上分数差异很大?
每个基准测的能力不一样:推理类(HLE、ARC-AGI-2)、数学类(AIME、FrontierMath)、编程类(SWE-bench Verified)、Agent 工具使用类(τ²-Bench)等。模型在某一能力上专门优化后,往往会牺牲另一些能力,因此排行榜按基准分别展示,而不是合并成一个分数。
排行榜多久更新一次?
数据每 5 分钟自动重新校验一次;新模型或新评测结果一旦公开就会同步收录。页面顶部的"数据更新于"指示器反映最近一次数据刷新时间。
综合排名应该怎么解读?
综合榜聚合了模型在多个核心基准上的位次,可作为初筛工具。但落地选型时建议进入与你业务最相关的单项基准查看,例如 Coding Agent 看 SWE-bench Verified、工具调用场景看 τ²-Bench。
开源大模型和闭源 API 模型怎么对比?
使用顶部的"许可"筛选切换为"全部",开源与闭源模型可在同一基准列直接对比。除分数外,还需考虑总持有成本:闭源模型按 API 用量计费,开源模型则需衡量自部署的硬件与运维成本。
截至 2026年10月,AA 智能指数前列模型包括 Claude Opus 5.5 (max with fallback)、Claude Opus 5.5 (xhigh with fallback)、Claude Sonnet 5.5 (max with fallback),该指数汇总编程、推理、科学等 10 项标准化评测。
LMArena 文本生成榜当前靠前的模型包括 gemini-4-argon-high、Claude Opus 4.6 (high)、claude-fable-5-high,排名基于真人匿名 A/B 投票。
知名模型开发商
查看全部 108 家机构点击进入开发商主页,查看其全部模型、系列与产品线。
阿里巴巴
OpenAI
Google DeepMind
MistralAI
Facebook AI研究实验室
微软
智谱AI
DeepSeek-AI
Anthropic
Google Research
百度
Stability AI
字节跳动Seed团队模型对比分析
逐项对比的深度分析:评测分差到底意味着什么,以及什么场景该选哪一个。
Claude Haiku 5.5 vs GPT-6 Luna:官网评测领先,长上下文成本如何取舍?
Anthropic 的 Haiku 5.5 官网对比图中,Haiku 在 Terminal-Bench 4.0 为 39.2%,Luna 为 16.4%;FrontierCode 1.1 Main 为 46.4% 对 42.4%,Chartography 无工具为 46.4% 对 29.1%。这是厂商公布的对比,具体推理档位未完整注明。两者短提示标准 API 单价相同,但 Haiku 超过 100K 输入 tokens 后涨价,Luna 的阈值为 272K。本文结合官网图表与站内价格讨论质量和成本取舍。
Haiku 5.5 与 DeepSeek-V4.1-Flash:短提示、长上下文与 API 成本怎么选?
Haiku 5.5 与 DeepSeek-V4.1-Flash 的 API 成本和规格对比:Haiku 提示长度 ≤100K 时,每百万 tokens 普通输入/输出为 0.1/0.5 美元,超过 100K 则为 0.5/2.5 美元;DeepSeek-V4.1-Flash 非高峰为 0.15/0.6 美元。两者上下文均为 1M。当前共同评测尚不足,本文不判定能力胜负,而是结合分档价格、缓存和输出规格给出试用建议。
Haiku 5.5 与 GLM-5.3-Flash:短提示、长上下文与 API 成本怎么选?
Haiku 5.5 与 GLM-5.3-Flash 的 API 成本和规格对比:Haiku 提示长度 ≤100K 时,每百万 tokens 普通输入/输出为 0.1/0.5 美元,超过 100K 则为 0.5/2.5 美元;GLM-5.3-Flash standard为 0.15/0.5 美元。两者上下文均为 1M。当前共同评测尚不足,本文不判定能力胜负,而是结合分档价格、缓存和输出规格给出试用建议。
GPT-6.1 Sol vs Claude Opus 5.5:编程与 Agent 工作流对比
对照 GPT-6.1 Sol 与 Claude Opus 5.5 的编程评测、API 价格和工具能力,评估跨厂商工作流的选择与迁移。
探索更多
排行榜只覆盖参与评测的模型。你还可以按模型、机构或评测基准浏览完整内容。





