DataLearner 标志DataLearnerAI
最新AI资讯
大模型评测
大模型列表
大模型对比
资源中心
工具
语言中文

加载中...

DataLearner 标志DataLearner AI

专注大模型评测、数据资源与实践教学的知识平台,持续更新可落地的 AI 能力图谱。

产品

  • 评测榜单
  • 模型对比
  • 数据资源

资源

  • 部署教程
  • 原创内容
  • 工具导航

关于

  • 关于我们
  • 隐私政策
  • 数据收集方法
  • 联系我们

© 2026 DataLearner AI. DataLearner 持续整合行业数据与案例,为科研、企业与开发者提供可靠的大模型情报与实践指南。

隐私政策服务条款

AI 大模型评测排行榜

综合排名与各项 Benchmark 分数持续更新,覆盖 MMLU Pro、HLE、SWE-Bench 等主流评测,帮你快速定位最优模型。

查看评测基准详情数据更新于 2025/11/08 22:10:24

综合排名

目前没有一个被普遍认可的"AI 模型总排名",所以我们选了两个切入角度不同的榜单放在一起:AA Intelligence Index 汇总标准化评测跑分,衡量客观能力;LMArena 通过真人盲测投票排序,反映实际使用体感。两者对照看,判断会更全面。

AA Intelligence Index

完整排名

汇总编程、数学、科学、推理、智能体等 10 项标准化评测的综合分数。

数据更新于 2026年03月26日

#模型分数
1
Gemini 3.1 Pro Preview
Google
57
2
GPT-5.4 (xhigh)
OpenAI
57
3
GPT-5.3 Codex (xhigh)
OpenAI
54
4
Claude Opus 4.6 (max)
Anthropic
53
5
Claude Sonnet 4.6 (max)
Anthropic
52
6
GLM-5
Z AI
50
7
MiniMax-M2.7
MiniMax
50
8
MiMo-V2-Pro
Xiaomi
49
9
Grok 4.20 Beta 0309
xAI
48
10
GPT-5.4 mini (xhigh)
OpenAI
48
来源:Artificial Analysis

LMArena Text Generation

完整排名

基于匿名众包 A/B 对战的 Elo 评分,反映真实用户对回答质量的偏好。

数据更新于 2026年03月20日

#模型Elo
1
claude-opus-4-6-thinking
Anthropic
1502
2
claude-opus-4-6
Anthropic
1501
3
gemini-3.1-pro-preview
Google
1493
4
grok-4.20-beta1
xAI
1492
5
gemini-3-pro
Google
1486
6
gpt-5.4-high
OpenAI
1485
7
gpt-5.2-chat-latest-20260210
OpenAI
1482
8
grok-4.20-beta-0309-reasoning
xAI
1481
9
gemini-3-flash
Google
1475
10
claude-opus-4-5-20251101-thinking-32k
Anthropic
1474
来源:LMArena

单项评测排名

我们在此精选了几项有代表性的评测基准,切换即可查看模型在该项上的得分。完整的 60+ 评测基准列表请前往评测基准目录。

综合评估MMLU ProGPQA Diamond
编程与软件工程SWE-bench VerifiedLiveCodeBench
数学推理MATH-500AIME 2024
更多评测
参数规模:全部3B及以下7B13B34B65B100B及以上
模型类型:全部推理大模型基座大模型指令优化/聊天优化大模型编程大模型

大模型性能评测结果

数据来源:DataLearnerAI
排名模型MMLU ProGPQA DiamondSWE-bench VerifiedMATH-500AIME 2024LiveCodeBench参数(亿)开源情况
1OpenAI o191.0477.3048.9096.4079.2071.00—不开源
2Gemini 3.0 Pro (Preview 11-2025)90.0091.9076.200.000.0092.00—不开源
3Claude Opus 4.590.0087.0080.900.000.000.00—不开源
4Claude Opus 4.188.0081.0074.500.000.000.00—不开源
5M2.188.0081.0074.800.000.000.002300B免费商用
6Claude Sonnet 4.588.0083.400.000.000.0071.00—不开源
7Qwen3.5-397B-A17B87.8088.4076.400.000.000.00397B免费商用
8Qwen3.5-397B-A17B87.8088.400.000.000.0083.60397B免费商用
9Hunyuan-T187.2069.300.0096.2078.2064.90—不开源
10Grok 487.0087.0058.600.000.0082.00—不开源
11GPT-4.586.1071.4038.0090.7036.7046.40—不开源
12Qwen3.5-27B86.1085.5072.400.000.000.00270B免费商用
13Gemini 2.5-Pro86.000.000.0098.8092.0077.10—不开源
14Qwen3-Max-Thinking85.7087.4075.300.000.0085.9010000B不开源
15OpenAI o385.600.000.0098.1091.6075.80—不开源
16DeepSeek-R1-052885.0081.0057.6098.0091.4073.306710B免费商用
17Grok 4.1 Fast85.0085.000.000.000.0082.00—不开源
18DeepSeek V3.2-Exp85.0079.900.000.000.0074.106710B免费商用
19DeepSeek-V3.1 Terminus85.0080.7068.400.000.0074.906710B免费商用
20DeepSeek-V3.1 Terminus85.0079.000.000.000.0080.006710B免费商用
21DeepSeek-V3.185.0080.100.000.0093.1074.806710B免费商用
22Claude Opus 485.0079.6072.5098.2076.0056.60—不开源
23GLM-4.584.6079.1064.2098.2091.0072.903550B免费商用
24Kimi K2 Thinking84.6084.500.000.000.0083.1010400B免费商用
25Qwen3-235B-A22B-Thinking84.4081.100.000.000.0074.10305B免费商用
26Qwen3-235B-A22B-Thinking-250784.4081.100.000.000.0074.102350B免费商用
27GLM-4.784.3085.700.000.000.0084.903580B免费商用
28DeepSeek-R184.0071.5049.2097.3079.8065.906710B免费商用
29Claude Sonnet 484.0075.400.000.000.0066.00—不开源
30Qwen3 Max (Preview)84.0076.0069.600.000.0057.50—不开源
1
OpenAI o1
MMLU Pro91.04
GPQA Diamond77.30
SWE-bench Verified48.90
MATH-50096.40
AIME 202479.20
LiveCodeBench71.00
不开源
2
Gemini 3.0 Pro (Preview 11-2025)
MMLU Pro90.00
GPQA Diamond91.90
SWE-bench Verified76.20
MATH-5000.00
AIME 20240.00
LiveCodeBench92.00
不开源
3
Claude Opus 4.5
MMLU Pro90.00
GPQA Diamond87.00
SWE-bench Verified80.90
MATH-5000.00
AIME 20240.00
LiveCodeBench0.00
不开源
4
Claude Opus 4.1
MMLU Pro88.00
GPQA Diamond81.00
SWE-bench Verified74.50
MATH-5000.00
AIME 20240.00
LiveCodeBench0.00
不开源
5
M2.1
2300B
MMLU Pro88.00
GPQA Diamond81.00
SWE-bench Verified74.80
MATH-5000.00
AIME 20240.00
LiveCodeBench0.00
免费商用
6
Claude Sonnet 4.5
MMLU Pro88.00
GPQA Diamond83.40
SWE-bench Verified0.00
MATH-5000.00
AIME 20240.00
LiveCodeBench71.00
不开源
7
Qwen3.5-397B-A17B
397B
MMLU Pro87.80
GPQA Diamond88.40
SWE-bench Verified76.40
MATH-5000.00
AIME 20240.00
LiveCodeBench0.00
免费商用
8
Qwen3.5-397B-A17B
397B
MMLU Pro87.80
GPQA Diamond88.40
SWE-bench Verified0.00
MATH-5000.00
AIME 20240.00
LiveCodeBench83.60
免费商用
9
Hunyuan-T1
MMLU Pro87.20
GPQA Diamond69.30
SWE-bench Verified0.00
MATH-50096.20
AIME 202478.20
LiveCodeBench64.90
不开源
10
Grok 4
MMLU Pro87.00
GPQA Diamond87.00
SWE-bench Verified58.60
MATH-5000.00
AIME 20240.00
LiveCodeBench82.00
不开源
11
GPT-4.5
MMLU Pro86.10
GPQA Diamond71.40
SWE-bench Verified38.00
MATH-50090.70
AIME 202436.70
LiveCodeBench46.40
不开源
12
Qwen3.5-27B
270B
MMLU Pro86.10
GPQA Diamond85.50
SWE-bench Verified72.40
MATH-5000.00
AIME 20240.00
LiveCodeBench0.00
免费商用
13
Gemini 2.5-Pro
MMLU Pro86.00
GPQA Diamond0.00
SWE-bench Verified0.00
MATH-50098.80
AIME 202492.00
LiveCodeBench77.10
不开源
14
Qwen3-Max-Thinking
10000B
MMLU Pro85.70
GPQA Diamond87.40
SWE-bench Verified75.30
MATH-5000.00
AIME 20240.00
LiveCodeBench85.90
不开源
15
OpenAI o3
MMLU Pro85.60
GPQA Diamond0.00
SWE-bench Verified0.00
MATH-50098.10
AIME 202491.60
LiveCodeBench75.80
不开源
16
DeepSeek-R1-0528
6710B
MMLU Pro85.00
GPQA Diamond81.00
SWE-bench Verified57.60
MATH-50098.00
AIME 202491.40
LiveCodeBench73.30
免费商用
17
Grok 4.1 Fast
MMLU Pro85.00
GPQA Diamond85.00
SWE-bench Verified0.00
MATH-5000.00
AIME 20240.00
LiveCodeBench82.00
不开源
18
DeepSeek V3.2-Exp
6710B
MMLU Pro85.00
GPQA Diamond79.90
SWE-bench Verified0.00
MATH-5000.00
AIME 20240.00
LiveCodeBench74.10
免费商用
19
DeepSeek-V3.1 Terminus
6710B
MMLU Pro85.00
GPQA Diamond80.70
SWE-bench Verified68.40
MATH-5000.00
AIME 20240.00
LiveCodeBench74.90
免费商用
20
DeepSeek-V3.1 Terminus
6710B
MMLU Pro85.00
GPQA Diamond79.00
SWE-bench Verified0.00
MATH-5000.00
AIME 20240.00
LiveCodeBench80.00
免费商用
21
DeepSeek-V3.1
6710B
MMLU Pro85.00
GPQA Diamond80.10
SWE-bench Verified0.00
MATH-5000.00
AIME 202493.10
LiveCodeBench74.80
免费商用
22
Claude Opus 4
MMLU Pro85.00
GPQA Diamond79.60
SWE-bench Verified72.50
MATH-50098.20
AIME 202476.00
LiveCodeBench56.60
不开源
23
GLM-4.5
3550B
MMLU Pro84.60
GPQA Diamond79.10
SWE-bench Verified64.20
MATH-50098.20
AIME 202491.00
LiveCodeBench72.90
免费商用
24
Kimi K2 Thinking
10400B
MMLU Pro84.60
GPQA Diamond84.50
SWE-bench Verified0.00
MATH-5000.00
AIME 20240.00
LiveCodeBench83.10
免费商用
25
Qwen3-235B-A22B-Thinking
305B
MMLU Pro84.40
GPQA Diamond81.10
SWE-bench Verified0.00
MATH-5000.00
AIME 20240.00
LiveCodeBench74.10
免费商用
26
Qwen3-235B-A22B-Thinking-2507
2350B
MMLU Pro84.40
GPQA Diamond81.10
SWE-bench Verified0.00
MATH-5000.00
AIME 20240.00
LiveCodeBench74.10
免费商用
27
GLM-4.7
3580B
MMLU Pro84.30
GPQA Diamond85.70
SWE-bench Verified0.00
MATH-5000.00
AIME 20240.00
LiveCodeBench84.90
免费商用
28
DeepSeek-R1
6710B
MMLU Pro84.00
GPQA Diamond71.50
SWE-bench Verified49.20
MATH-50097.30
AIME 202479.80
LiveCodeBench65.90
免费商用
29
Claude Sonnet 4
MMLU Pro84.00
GPQA Diamond75.40
SWE-bench Verified0.00
MATH-5000.00
AIME 20240.00
LiveCodeBench66.00
不开源
30
Qwen3 Max (Preview)
MMLU Pro84.00
GPQA Diamond76.00
SWE-bench Verified69.60
MATH-5000.00
AIME 20240.00
LiveCodeBench57.50
不开源
查看全部 240 个模型的 MMLU Pro 完整排名