τ³-Bench 是 Sierra 推出的第三代「工具-智能体-用户」评测,是 τ-Bench / τ²-Bench 的延续。在 τ²-Bench 双控(人机协同)环境的基础上,τ³ 新增了 τ-Knowledge(考察智能体在跨系统、跨格式的企业内部文档集合上的知识检索与运用)与 τ-Voice(全双工语音对话评测),并对既有任务做了大批量质量修正。代码与 τ² 一同维护在 sierra-research/tau2-bench 仓库中。此条目记录官方模型卡常用的 τ³-Bench 综合成绩,细分领域(如银行)另有独立条目。
查看 τ³-Bench 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
Spark-X2.5-4B 开启思考工具 | 30.40 | 2026-09-01 | 41.1亿 | 免费商用 |