AA-Briefcase 是 Kimi K3 官方技术博客完整评测表采用的基准。本条目用于承载官方发布成绩;Kimi K3 的全局测试设置为 reasoning_effort=max、temperature=1.0、top_p=1.0,具体 harness、工具使用和重复运行口径以官方脚注为准。
查看 AA-Briefcase 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
![]() Claude Opus 5 思考水平·Max工具 | 1720.00 | 2026-07-24 | 未知 | 闭源 | |
Grok 4.6 思考水平·高工具 | 1577.00 | 2026-08-12 | 未知 | 闭源 | |
![]() Claude Fable 5 思考水平·Max工具 | 1574.00 | 2026-06-09 | 未知 | 闭源 | |
4 | ![]() Kimi K3 思考水平·Max工具 | 1548.00 | 2026-07-16 | 28000亿 | 免费商用 |
5 | ![]() GPT-5.6 Sol 思考水平·Max工具 | 1502.00 | 2026-06-26 | 未知 | 闭源 |
6 | Grok 4.5 思考水平·高工具 | 1313.00 | 2026-07-08 | 未知 | 闭源 |
Kimi K3 (max) 官方发布成绩:1548(2026-07-16)。