Tax Agent Bench 考察智能体处理美国企业税研究级问题的能力:需要跨法条、法规与 IRS 指引做多步检索,识别适用条款、综合多个来源、把规则套到具体事实上并写出有据可依的答复。私有测试集 193 题,计分为「评分要点得分 ×(0.7 + 0.3 × 引用质量)」的加权部分分。
查看 Tax Agent Bench 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
— | ![]() Claude Opus 5.5 思考水平·Max工具 | 70.50 | 2026-09-22 | 未知 | 闭源 |
— | ![]() GPT-6 Luna 思考水平·Max工具 | 58.86 | 2026-09-22 | 未知 | 闭源 |
— | ![]() GPT-6 Sol 思考水平·Max工具 | 53.05 | 2026-09-22 | 未知 | 闭源 |