DataLearner 标志DataLearnerAI
最新AI资讯
大模型评测
大模型列表
大模型对比
资源中心
工具
语言中文

加载中...

DataLearner 标志DataLearner AI

专注大模型评测、数据资源与实践教学的知识平台,持续更新可落地的 AI 能力图谱。

产品

  • 评测榜单
  • 模型对比
  • 数据资源

资源

  • 部署教程
  • 原创内容
  • 工具导航

关于

  • 关于我们
  • 隐私政策
  • 数据收集方法
  • 联系我们

© 2026 DataLearner AI. DataLearner 持续整合行业数据与案例,为科研、企业与开发者提供可靠的大模型情报与实践指南。

隐私政策服务条款

AI 大模型评测排行榜

综合排名与各项 Benchmark 分数持续更新,覆盖 MMLU Pro、HLE、SWE-Bench 等主流评测,帮你快速定位最优模型。

查看评测基准详情数据更新于 2025/11/08 22:10:24

综合排名

目前没有一个被普遍认可的"AI 模型总排名",所以我们选了两个切入角度不同的榜单放在一起:AA Intelligence Index 汇总标准化评测跑分,衡量客观能力;LMArena 通过真人盲测投票排序,反映实际使用体感。两者对照看,判断会更全面。

AA Intelligence Index

完整排名

汇总编程、数学、科学、推理、智能体等 10 项标准化评测的综合分数。

数据更新于 2026年03月26日

#模型分数
1
Gemini 3.1 Pro Preview
Google
57
2
GPT-5.4 (xhigh)
OpenAI
57
3
GPT-5.3 Codex (xhigh)
OpenAI
54
4
Claude Opus 4.6 (max)
Anthropic
53
5
Claude Sonnet 4.6 (max)
来源:Artificial Analysis

LMArena Text Generation

完整排名

基于匿名众包 A/B 对战的 Elo 评分,反映真实用户对回答质量的偏好。

数据更新于 2026年03月20日

#模型Elo
1
claude-opus-4-6-thinking
Anthropic
1502
2
claude-opus-4-6
Anthropic
1501
3
gemini-3.1-pro-preview
Google
1493
4

单项评测排名

我们在此精选了几项有代表性的评测基准,切换即可查看模型在该项上的得分。完整的 60+ 评测基准列表请前往评测基准目录。

综合评估MMLU ProGPQA Diamond
编程与软件工程SWE-bench VerifiedLiveCodeBench
数学推理MATH-500AIME 2024
更多评测
参数规模:全部3B及以下7B
Anthropic
52
6
GLM-5
Z AI
50
7
MiniMax-M2.7
MiniMax
50
8
MiMo-V2-Pro
Xiaomi
49
9
Grok 4.20 Beta 0309
xAI
48
10
GPT-5.4 mini (xhigh)
OpenAI
48
grok-4.20-beta1
xAI
1492
5
gemini-3-pro
Google
1486
6
gpt-5.4-high
OpenAI
1485
7
gpt-5.2-chat-latest-20260210
OpenAI
1482
8
grok-4.20-beta-0309-reasoning
xAI
1481
9
gemini-3-flash
Google
1475
10
claude-opus-4-5-20251101-thinking-32k
Anthropic
1474
来源:LMArena
13B
34B
65B
100B及以上
模型类型:全部推理大模型基座大模型指令优化/聊天优化大模型编程大模型

大模型性能评测结果

数据来源:DataLearnerAI
排名模型MMLU ProGPQA DiamondSWE-bench VerifiedMATH-500AIME 2024LiveCodeBench参数(亿)开源情况
1GPT OSS 120B79.0080.1060.100.0096.600.00117B免费商用
2Phi 4 - 14B70.400.000.000.000.000.00140B不可商用
3Qwen2.5-14B63.690.000.000.000.000.00140B免费商用
4Gemma 3 - 12B (IT)60.6040.900.000.000.0024.60120B免费商用
5Moonlight-16B-A3B-Instruct42.400.000.000.000.000.00160B免费商用
1
GPT OSS 120B
117B
MMLU Pro79.00
GPQA Diamond80.10
SWE-bench Verified60.10
MATH-5000.00
AIME 202496.60
LiveCodeBench0.00
免费商用
2
Phi 4 - 14B
140B
MMLU Pro70.40
GPQA Diamond0.00
SWE-bench Verified0.00
MATH-5000.00
AIME 20240.00
LiveCodeBench0.00
不可商用
3
Qwen2.5-14B
140B
MMLU Pro63.69
GPQA Diamond0.00
SWE-bench Verified0.00
MATH-5000.00
AIME 20240.00
LiveCodeBench0.00
免费商用
4
Gemma 3 - 12B (IT)
120B
MMLU Pro60.60
GPQA Diamond40.90
SWE-bench Verified0.00
MATH-5000.00
AIME 20240.00
LiveCodeBench24.60
免费商用
5
Moonlight-16B-A3B-Instruct
160B
MMLU Pro42.40
GPQA Diamond0.00
SWE-bench Verified0.00
MATH-5000.00
AIME 20240.00
LiveCodeBench0.00
免费商用