NL2Repo-Bench evaluates whether coding agents can build a complete, installable Python repository from a natural-language specification and an empty workspace. The 104 tasks are graded against upstream pytest suites.
查看 NL2Repo-Bench 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
— | ![]() Claude Opus 5 思考水平·Max工具 | 75.30 | 2026-07-24 | 未知 | 闭源 |
— | ![]() DeepSeek-V4.1-Flash 思考水平·Max工具 | 65.40 | 2026-09-10 | 5520亿 | 免费商用 |
— | ![]() Qwen3.8-Max-0902 思考水平·极高工具 | 64.90 | 2026-09-02 | 24000亿 | 闭源 |
— | ![]() DeepSeek-V4-Pro 思考水平·极高工具 | 61.50 | 2026-08-13 | 16000亿 | 免费商用 |
— | ![]() Hy4 preview 思考水平·高工具 | 58.90 | 2026-08-28 | 7700亿 | 免费商用 |
— | ![]() Kimi K3 思考水平·Max工具 | 58.00 | 2026-07-16 | 28000亿 | 有条件商用 |
— | ![]() GLM-5.3 思考水平·Max工具 | 58.00 | 2026-08-14 | 7440亿 | 有条件商用 |
— | ![]() DeepSeek-V4-Flash-Vision-Exp 思考水平·Max工具 | 57.70 | 2026-08-21 | 3050亿 | 免费商用 |
— | ![]() GPT-5.6 Sol 思考水平·Max工具 | 56.80 | 2026-06-26 | 未知 | 闭源 |
— | ![]() GLM-5.3-Flash 思考水平·Max工具 | 56.30 | 2026-08-26 | 3200亿 | 免费商用 |
— | ![]() Qwen3.8-Max 思考水平·极高工具 | 55.90 | 2026-08-03 | 24000亿 | 有条件商用 |
— | ![]() DeepSeek-V4-Flash 思考水平·Max工具 | 54.20 | 2026-04-24 | 2840亿 | 免费商用 |
— | ![]() GLM-5.2 开启思考工具 | 48.90 | 2026-06-13 | 7533.3亿 | 免费商用 |
— | ![]() Qwen3.8-Flash-Next 思考水平·极高工具 | 48.10 | 2026-08-26 | 1250亿 | 有条件商用 |
— | ![]() Qwen3.8-27B 开启思考工具 | 42.30 | 2026-08-14 | 270亿 | 免费商用 |
— | ![]() MiniMax-M2.7 开启思考工具 | 39.80 | 2026-03-18 | 2290亿 | 非商用 |
DeepSeek-V4-Flash-0731 官方发布成绩:54.2(2026-07-31,DeepSeek Harness minimal,max effort,temperature=1.0,top_p=0.95)。