SRE-Bench 的单次尝试口径,用于评估模型完成站点可靠性工程任务的能力。本站保留 single-attempt 条件,不与多次尝试结果混用。
查看 SRE-Bench (single-attempt) 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
![]() GPT-6 Astra 思考水平·Max工具 | 88.00 | 2026-09-03 | 未知 | 闭源 |