人工智能(AI)的通用智能(AGI)发展一直是研究领域的焦点。近期,由 ARC Prize 基金会推出并由 AI 研究者 François Chollet 联合发起的 ARC-AGI-2 评测基准,为衡量大模型在未知情境下的实时推理能力和学习效率提供了新的视角。
ARC-AGI-2 用抽象网格变换任务评估流体推理能力。完整基准由 1,000 个公开训练任务、120 个公开评测任务,以及各 120 个 semi-private 和 private 测试任务组成,共 1,360 个任务;公开仓库仅包含训练集和公开评测集。
查看 ARC-AGI-2 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
— | ![]() GPT-6 Astra 思考水平·Max | 95.00 | 2026-09-03 | 未知 | 闭源 |
— | ![]() GPT-6 Astra 思考水平·极高工具 | 93.33 | 2026-09-03 | 未知 | 闭源 |
— | ![]() Claude Opus 5.5 思考水平·高 | 93.33 | 2026-09-22 | 未知 | 闭源 |
— | ![]() GPT-5.6 Sol 思考水平·Max | 92.50 | 2026-06-26 | 未知 | 闭源 |
— | ![]() Claude Opus 5.5 思考水平·极高 | 92.50 | 2026-09-22 | 未知 | 闭源 |
— | ![]() GPT-6 Astra 思考水平·中工具 | 92.08 | 2026-09-03 | 未知 | 闭源 |
— | ![]() GPT-6 Astra 思考水平·高工具 | 92.08 | 2026-09-03 | 未知 | 闭源 |
— | ![]() Claude Opus 5.5 思考水平·Max | 91.67 | 2026-09-22 | 未知 | 闭源 |
— | ![]() Claude Opus 5 思考水平·Max | 90.42 | 2026-07-24 | 未知 | 闭源 |
— | ![]() GPT-5.6 Sol 思考水平·极高 | 90.00 | 2026-06-26 | 未知 | 闭源 |
— | ![]() Claude Fable 5.1 思考水平·Max | 90.00 | 2026-09-01 | 未知 | 闭源 |
— | ![]() Claude Fable 5.1 思考水平·极高 | 90.00 | 2026-09-01 | 未知 | 闭源 |
— | ![]() Claude Fable 5.1 思考水平·极高工具 | 90.00 | 2026-09-01 | 未知 | 闭源 |
— | ![]() Claude Fable 5 思考水平·Max | 89.17 | 2026-06-09 | 未知 | 闭源 |
— | ![]() Gemini 3.8 Flash 思考水平·高 | 89.17 | 2026-09-02 | 未知 | 闭源 |
— | ![]() Claude Fable 5.1 思考水平·高 | 88.75 | 2026-09-01 | 未知 | 闭源 |
— | ![]() Claude Fable 5 思考水平·极高 | 88.33 | 2026-06-09 | 未知 | 闭源 |
— | ![]() Claude Opus 5 思考水平·高工具 | 88.33 | 2026-07-24 | 未知 | 闭源 |
— | ![]() Claude Fable 5 思考水平·高 | 87.50 | 2026-06-09 | 未知 | 闭源 |
— | ![]() Claude Opus 5.5 思考水平·中 | 87.50 | 2026-09-22 | 未知 | 闭源 |
— | ![]() Claude Fable 5.1 思考水平·中 | 86.25 | 2026-09-01 | 未知 | 闭源 |
— | ![]() GPT-5.6 Sol 思考水平·高 | 85.42 | 2026-06-26 | 未知 | 闭源 |
— | ![]() GPT-6 Astra 思考水平·低工具 | 85.42 | 2026-09-03 | 未知 | 闭源 |
— | ![]() GPT-5.5 思考水平·极高 | 85.00 | 2026-04-23 | 未知 | 闭源 |
— | ![]() GPT-5.5 思考水平·高 | 85.00 | 2026-04-23 | 未知 | 闭源 |
— | 84.60 | 2026-02-13 | 未知 | 闭源 | |
— | ![]() GPT-5.5 Pro 思考水平·高 | 84.58 | 2026-04-23 | 未知 | 闭源 |
— | ![]() Gemini 3.7 Flash 思考水平·高 | 84.58 | 2026-08-13 | 未知 | 闭源 |
— | ![]() GPT-5.5 Pro 思考水平·极高 | 84.16 | 2026-04-23 | 未知 | 闭源 |
— | ![]() GPT-5.6 Terra 思考水平·Max | 83.90 | 2026-06-26 | 未知 | 闭源 |
截至 2026-09-01,官方 Verified 榜单最新加入 Claude Fable 5.1:Max 与 XHigh 均为 90.0%,High 88.8%、Medium 86.3%、Low 78.3%;榜单最高记录为 GPT-5.6 Sol (Max) 的 92.5%。