Program Bench is an AI benchmark used to evaluate model capabilities. Review its overview, metrics, official resources, and model leaderboard results on DataLearnerAI.
Browse the latest scores, model modes, release dates, and parameter sizes for Program Bench.
Data sourced primarily from official releases (GitHub, Hugging Face, papers), then benchmark leaderboards, then third-party evaluators. Learn about our data methodology
| Rank | Model | License | |||
|---|---|---|---|---|---|
— | ![]() Claude Fable 5.1 Thinking Level · MaxTools | 87.60 | 2026-09-01 | Unknown | Closed |
— | ![]() GLM-5.2 Thinking EnabledTools | 63.70 | 2026-06-13 | 753.3B | Free Commercial |
— | ![]() Kimi K2.7 Code Thinking EnabledTools | 53.60 | 2026-06-12 | 1000B | Free Commercial |
— | ![]() Kimi K2.6 Thinking EnabledTools | 48.30 | 2026-04-20 | 1000B | Free Commercial |
— | ![]() Claude Opus 5 Thinking Level · MaxTools | 37.00 | 2026-07-24 | Unknown | Closed |
— | ![]() Qwen3.8-Max-0902 Thinking Level · Extra HighTools | 28.00 | 2026-09-02 | 2400B | Closed |
— | ![]() GPT-5.6 Sol Thinking Level · MaxTools | 23.00 | 2026-06-26 | Unknown | Closed |
— | ![]() DeepSeek-V4.1-Flash Thinking Level · MaxTools | 20.30 | 2026-09-10 | 552B | Free Commercial |
— | ![]() GLM-5.3 Thinking Level · MaxTools | 19.00 | 2026-08-14 | 744B | Conditional |
— | ![]() Kimi K3 Thinking Level · MaxTools | 17.50 | 2026-07-16 | 2800B | Conditional |
— | ![]() Hy4 preview Thinking Level · HighTools | 17.50 | 2026-08-28 | 770B | Free Commercial |