Harvey Lab-AA 是 Artificial Analysis 对 Harvey AI 的 Legal Agent Benchmark(LAB)所做的独立复跑,评估模型在专业法律知识工作上的表现,题目按专家撰写的评分要点由 LLM 评判。 ⚠️ 口径提醒:LAB 同时存在两种常见报告口径——criterion pass rate(满足的评分要点占比,通常在 90% 上下)与 all-pass rate(全部要点都满足才算通过,通常只有百分之十几)。本条目下现有成绩混用了这两种口径(例如 Kimi K3 94.6、Gemini 3.7 Flash 90.7 为 criterion pass rate;Grok 4.6 15.8、Claude Fable 5 11.3、GPT-5.6 Sol 2.5 为 all-pass rate),因此本条目的横向排序不可直接采信,逐条核对原始来源后再引用。
查看 Harvey Lab-AA 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
— | ![]() Kimi K3 思考水平·Max工具 | 94.60 | 2026-07-16 | 28000亿 | 有条件商用 |
— | ![]() Gemini 3.7 Flash 开启思考 | 90.70 | 2026-08-13 | 未知 | 闭源 |
— | Grok 4.6 思考水平·高工具 | 15.80 | 2026-08-12 | 未知 | 闭源 |
— | Grok 4.5 思考水平·高工具 | 12.90 | 2026-07-08 | 未知 | 闭源 |
— | ![]() Claude Fable 5 思考水平·Max工具 | 11.30 | 2026-06-09 | 未知 | 闭源 |
— | ![]() GPT-5.6 Sol 思考水平·Max工具 | 2.50 | 2026-06-26 | 未知 | 闭源 |