Artificial Analysis Coding Agent Index v1.5 是编码智能体综合指数,由 DeepSWE v1.1(113 个任务)、Terminal-Bench 4.0(66 个任务)和 SWE-Atlas-QnA(124 个任务)等权组成,共覆盖 303 个任务;每个组件按每题 3 次运行计算 pass@1 后再等权汇总。
查看 AA Coding Agent Index v1.5 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
— | ![]() Claude Fable 5.1 思考水平·Max工具 | 62.20 | 2026-09-01 | 未知 | 闭源 |
— | ![]() GPT-6 Astra 思考水平·Max工具 | 61.60 | 2026-09-03 | 未知 | 闭源 |
— | ![]() Claude Opus 5 思考水平·Max工具 | 59.70 | 2026-07-24 | 未知 | 闭源 |
— | ![]() GPT-5.6 Sol 思考水平·Max工具 | 54.60 | 2026-06-26 | 未知 | 闭源 |
— | ![]() Muse Spark 1.3 思考水平·Max工具 | 54.30 | 2026-09-02 | 未知 | 闭源 |
— | ![]() GLM-5.3 思考水平·Max工具 | 53.60 | 2026-08-14 | 7440亿 | 有条件商用 |
— | ![]() Kimi K3 unknown | 51.90 | 2026-07-16 | 28000亿 | 有条件商用 |
— | ![]() Muse Spark 1.3 思考水平·极高工具 | 48.30 | 2026-09-02 | 未知 | 闭源 |
— | Grok 4.6 思考水平·极高工具 | 47.00 | 2026-08-12 | 未知 | 闭源 |
— | ![]() Qwen3.8-Max unknown | 43.30 | 2026-08-03 | 24000亿 | 有条件商用 |
— | ![]() Gemini 3.8 Flash 思考水平·高工具 | 41.90 | 2026-09-02 | 未知 | 闭源 |