DataLearner 标志

Artificial Analysis Intelligence Index AI模型智能指数排行榜

Artificial Analysis Intelligence Index v4.0 综合了10项权威评测基准(GDPval-AA、Terminal-Bench、GPQA Diamond、SciCode等),从数学、科学、编程、推理等多维度对AI模型进行全面评估和排名。

榜首模型

Qwen3.8 Max (0902)

最高得分

45

模型数量

270

数据版本

2026年09月22日

数据来源: Artificial Analysis

榜单历史快照月份:

排名总表

排名模型名称智能指数机构
18AlibabaQwen3.8 Max (0902)Alibaba45Alibaba
25StepFunStep 5 PreviewStepFun44StepFun
26Moonshot AIKimi K3 (max)Moonshot AI44Moonshot AI
32AlibabaQwen3.8 2.4T A95BAlibaba40Alibaba
33AlibabaQwen3.8-Flash-NextAlibaba40Alibaba
35DeepSeekDeepSeek V4.1 Flash (max)DeepSeek39DeepSeek
41DeepSeek-AIDeepSeek-V4-Pro (max)DeepSeek-AI36DeepSeek-AI
45DeepSeekDeepSeek V4 Flash Vision (max)DeepSeek35DeepSeek
47Moonshot AIKimi K3 (low)Moonshot AI34Moonshot AI
62MiniMaxAIMiniMax M3MiniMaxAI29MiniMaxAI
76Moonshot AIKimi K2.7 CodeMoonshot AI26Moonshot AI
96AlibabaQwen3.5 397B A17B (Non-reasoning)Alibaba21Alibaba
103StepFunAIStep 3.7 FlashStepFunAI19StepFunAI
110AlibabaQwen3.5 122B A10B (Non-reasoning)Alibaba18Alibaba
112ByteDance SeedDoubao Seed CodeByteDance Seed17ByteDance Seed
121AlibabaQwen3.6 35B A3B (Non-reasoning)Alibaba15Alibaba
133AlibabaQwen3.5 9B (Non-reasoning)Alibaba13Alibaba
137AlibabaQwen3.5 4BAlibaba13Alibaba
154AlibabaQwen3 Next 80B A3B (Reasoning)Alibaba11Alibaba
160AlibabaQwen3.5 4B (Non-reasoning)Alibaba11Alibaba
199AlibabaQwen3 Omni 30B A3B (Reasoning)Alibaba8Alibaba
200StepFunStep3 VL 10BStepFun8StepFun
213KimiKimi Linear 48B A3B InstructKimi7Kimi
219AlibabaQwen3.5 2BAlibaba7Alibaba
232AlibabaQwen3.5 2B (Non-reasoning)Alibaba6Alibaba
233AlibabaQwen3.5 0.8BAlibaba6Alibaba
251AlibabaQwen3.5 0.8B (Non-reasoning)Alibaba5Alibaba

数据仅供参考,以官方来源为准。模型名称旁的链接可跳转到 DataLearner 模型详情页。

评测基准组成(Intelligence Index v4.0)

Intelligence Index 综合10项严格的评测基准,全面衡量AI模型能力,避免单一维度的过拟合。

GDPval-AA
智能体真实任务
τ²-Bench
智能体工具调用
Terminal-Bench
智能体编程
SciCode
编程能力
AA-LCR
长上下文推理
AA-Omniscience
知识与幻觉检测
IFBench
指令遵循
Humanity's Last Exam
推理与知识
GPQA Diamond
科学推理
CritPt
物理推理

常见问题 (FAQ)

什么是 Artificial Analysis Intelligence Index?▼
Artificial Analysis Intelligence Index v4.0 是一个综合评测指数,聚合了10项具有挑战性的评估——涵盖数学、科学、编程、智能体任务和推理——以全面衡量AI能力。它旨在防止单一维度的过拟合,提供一个统一分数来追踪模型进步。
智能指数是如何计算的?▼
该指数综合了10项评测的分数:GDPval-AA(智能体真实任务)、τ²-Bench(工具调用)、Terminal-Bench Hard(智能体编程)、SciCode(编程)、AA-LCR(长上下文推理)、AA-Omniscience(知识与幻觉检测)、IFBench(指令遵循)、Humanity's Last Exam(推理)、GPQA Diamond(科学推理)和 CritPt(物理推理)。所有测试由 Artificial Analysis 在标准化硬件上独立运行。
这与 LMArena 排行榜有什么区别?▼
LMArena 排名基于众包用户投票(盲测A/B对比的Elo评分),反映主观的人类偏好。而 Artificial Analysis Intelligence Index 使用标准化的自动评测基准进行客观评分,衡量特定领域的技术能力。两者各有价值——LMArena 捕捉真实用户体验,而 AA Intelligence Index 提供可复现的技术测量。
在哪里可以找到原始数据?▼
原始排行榜和详细方法论可在 artificialanalysis.ai 查看。Intelligence Index 的方法论详见 Intelligence Index 页面。