A multilingual benchmark that evaluates whether models can follow instructions to make practical, correct edits to existing code.
Browse the latest scores, model modes, release dates, and parameter sizes for Aider-Polyglot.
Data sourced primarily from official releases (GitHub, Hugging Face, papers), then benchmark leaderboards, then third-party evaluators. Learn about our data methodology
| Rank | Model | License | |||
|---|---|---|---|---|---|
— | ![]() GPT-5 Thinking Level · High | 88.00 | 2025-08-07 | Unknown | Closed |
— | ![]() GPT-5 Thinking Level · Medium | 86.70 | 2025-08-07 | Unknown | Closed |
— | ![]() o3-pro Thinking Level · High | 84.90 | 2025-06-10 | Unknown | Closed |
— | 83.10 | 2025-06-05 | Unknown | Closed | |
— | ![]() OpenAI o3 Thinking Level · High | 81.30 | 2025-04-16 | Unknown | Closed |
— | ![]() GPT-5 Thinking Level · Low | 81.30 | 2025-08-07 | Unknown | Closed |
— | Grok 4 Thinking Level · High | 79.60 | 2025-07-10 | Unknown | Closed |
— | ![]() Gemini 2.5-Pro Thinking Enabled | 79.10 | 2025-06-05 | Unknown | Closed |
— | ![]() OpenAI o3 Standard Mode | 76.90 | 2025-04-16 | Unknown | Closed |
— | ![]() Gemini-2.5-Pro-Preview-05-06 Standard Mode | 76.90 | 2025-05-06 | Unknown | Closed |
— | ![]() DeepSeek V3.2-Exp Thinking Enabled | 74.20 | 2025-09-29 | 671B | Free Commercial |
— | ![]() Gemini 2.5 Pro Experimental 03-25 Standard Mode | 72.90 | 2025-03-25 | Unknown | Closed |
— | ![]() OpenAI o4 - mini Thinking Level · High | 72.00 | 2025-04-16 | Unknown | Closed |
— | 72.00 | 2025-05-23 | Unknown | Closed | |
— | ![]() DeepSeek-R1-0528 Thinking Enabled | 71.40 | 2025-05-28 | 671B | Free Commercial |
— | ![]() Claude Opus 4 Standard Mode | 70.70 | 2025-05-23 | Unknown | Closed |
— | ![]() DeepSeek V3.2-Exp Standard Mode | 70.20 | 2025-09-29 | 671B | Free Commercial |
— | 64.90 | 2025-02-25 | Unknown | Closed | |
— | ![]() OpenAI o1 Thinking Level · High | 61.70 | 2024-12-05 | Unknown | Closed |
— | 61.30 | 2025-05-23 | Unknown | Closed | |
— | ![]() Claude Sonnet 3.7 Standard Mode | 60.40 | 2025-02-25 | Unknown | Closed |
— | ![]() OpenAI o3-mini Thinking Level · High | 60.40 | 2025-01-31 | Unknown | Closed |
— | ![]() Qwen3-235B-A22B Standard Mode | 59.60 | 2025-04-28 | 235B | Free Commercial |
— | ![]() Kimi K2 Standard Mode | 59.10 | 2025-07-11 | 1000B | Free Commercial |
— | ![]() DeepSeek-R1 Thinking Enabled | 56.90 | 2025-01-20 | 671B | Free Commercial |
— | ![]() Claude Sonnet 4 Standard Mode | 56.40 | 2025-05-23 | Unknown | Closed |
— | ![]() DeepSeek-V3-0324 Standard Mode | 55.10 | 2025-03-24 | 671B | Free Commercial |
— | 55.10 | 2025-04-17 | Unknown | Closed | |
— | ![]() OpenAI o3-mini Thinking Level · Medium | 53.80 | 2025-01-31 | Unknown | Closed |
— | Grok 3 Standard Mode | 53.30 | 2025-02-17 | Unknown | Closed |