Terminal-Bench是一个针对AI代理在真实终端环境中的能力评测基准,由Stanford University与Laude Institute合作开发。Terminal-Bench 2.1是2.0的改进版本,基于Z.ai的Terminal-Bench 2.0 Verified进行优化,目前处于活跃状态,但任务尚未完全上传。
Terminal-Bench 2.1 是由 Terminal-Bench 团队维护的终端智能体评测,共 89 个复杂容器任务。2.1 版修复了任务缺陷、资源与超时配置,并由维护者运行和核验官方排行榜提交。
查看 Terminal-Bench 2.1 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
![]() GPT-5.6 Sol 思考水平·Max | 88.80 | 2026-06-26 | 未知 | 闭源 | |
![]() Kimi K3 思考水平·Max工具 | 88.30 | 2026-07-16 | 28000亿 | 免费商用 | |
![]() GLM-5.3 思考水平·Max工具 | 88.20 | 2026-08-14 | 7533.3亿 | — | |
4 | ![]() Claude Fable 5 思考水平·高工具 | 88.00 | 2026-06-09 | 未知 | 闭源 |
5 | ![]() Claude Fable 5 深度思考模式工具 | 88.00 | 2026-06-09 | 未知 | 闭源 |
6 | ![]() DeepSeek-V4-Pro 思考水平·极高工具 | 87.90 | 2026-08-13 | 16000亿 | 免费商用 |
7 | ![]() GPT-5.6 Terra 思考水平·Max | 87.40 | 2026-06-26 | 未知 | 闭源 |
8 | ![]() Qwen3.8-Max 思考水平·极高工具 | 86.60 | 2026-08-03 | 24000亿 | 免费商用 |
9 | ![]() Gemini 3.7 Flash 开启思考工具 | 85.80 | 2026-08-13 | 未知 | 闭源 |
10 | ![]() GPT-5.6 Luna 思考水平·Max | 84.70 | 2026-06-26 | 未知 | 闭源 |
11 | ![]() Claude Fable 5 思考水平·极高工具 | 83.80 | 2026-06-09 | 未知 | 闭源 |
12 | ![]() GPT-5.5 思考水平·高工具 | 83.40 | 2026-04-23 | 未知 | 闭源 |
13 | Grok 4.5 思考水平·高工具 | 83.30 | 2026-07-08 | 未知 | 闭源 |
14 | ![]() GPT-5.5 思考水平·极高工具 | 83.10 | 2026-04-23 | 未知 | 闭源 |
15 | ![]() DeepSeek-V4-Flash 思考水平·Max工具 | 82.70 | 2026-04-24 | 2840亿 | 免费商用 |
16 | ![]() GLM-5.2 思考水平·高工具 | 81.00 | 2026-06-13 | 7533.3亿 | 免费商用 |
17 | ![]() Claude Sonnet 5 思考水平·极高工具 | 80.40 | 2026-06-30 | 未知 | 闭源 |
18 | ![]() Muse Spark 1.1 开启思考工具 | 80.00 | 2026-07-09 | 未知 | 闭源 |
19 | ![]() Claude Opus 4.8 思考水平·高工具 | 78.90 | 2026-05-28 | 未知 | 闭源 |
20 | ![]() GPT-5.6 Terra 思考水平·Max工具 | 78.40 | 2026-06-26 | 未知 | 闭源 |
21 | ![]() Gemini 3.6 Flash 开启思考工具 | 78.00 | 2026-07-21 | 未知 | 闭源 |
22 | ![]() Gemini 3.5 Flash 思考水平·高工具 | 76.20 | 2026-06-20 | 未知 | 闭源 |
23 | ![]() Muse Spark 1.1 思考水平·极高工具 | 76.20 | 2026-07-09 | 未知 | 闭源 |
24 | ![]() GPT-5.6 Luna 思考水平·Max工具 | 75.70 | 2026-06-26 | 未知 | 闭源 |
25 | ![]() Claude Sonnet 5 思考水平·高工具 | 74.60 | 2026-06-30 | 未知 | 闭源 |
26 | ![]() Gemini 3 Pro 思考水平·高工具 | 74.40 | 2026-02-01 | 未知 | 闭源 |
27 | ![]() Gemini 3.1 Pro Preview 思考水平·高工具 | 73.80 | 2026-02-20 | 未知 | 闭源 |
28 | ![]() Qwen3.8-27B 开启思考工具 | 73.00 | 2026-08-14 | 270亿 | 免费商用 |
29 | ![]() Hy3 思考水平·高工具 | 71.70 | 2026-07-06 | 2950亿 | 免费商用 |
30 | ![]() Seed2.1 Pro 开启思考工具 | 71.00 | 2026-06-23 | 未知 | 闭源 |
官方 Terminal-Bench 2.1 排行榜当前最高已核验成绩为 Claude Fable 5 + Claude Code(xhigh)的 83.8%。