A representative set of 500 problems selected from the MATH dataset to evaluate advanced mathematical reasoning.
Browse the latest scores, model modes, release dates, and parameter sizes for MATH-500.
Data sourced primarily from official releases (GitHub, Hugging Face, papers), then benchmark leaderboards, then third-party evaluators. Learn about our data methodology
| Rank | Model | License | |||
|---|---|---|---|---|---|
— | ![]() Gemini 2.5-Pro Standard Mode | 98.80 | 2025-06-05 | Unknown | Closed |
— | ![]() Gemini-2.5-Pro-Preview-05-06 Standard Mode | 98.80 | 2025-05-06 | Unknown | Closed |
— | ![]() GLM-4.5 Thinking Enabled | 98.20 | 2025-07-28 | 355B | Free Commercial |
— | ![]() Claude Opus 4 Standard Mode | 98.20 | 2025-05-23 | Unknown | Closed |
— | ![]() OpenAI o3 Standard Mode | 98.10 | 2025-04-16 | Unknown | Closed |
— | ![]() GLM-4.5-Air Thinking Enabled | 98.10 | 2025-07-28 | 106B | Free Commercial |
— | ![]() Qwen3-235B-A22B Thinking Enabled | 98.00 | 2025-04-28 | 235B | Free Commercial |
— | ![]() DeepSeek-R1-0528 Thinking Enabled | 98.00 | 2025-05-28 | 671B | Free Commercial |
— | ![]() OpenAI o3-mini (high) Standard Mode | 97.90 | 2025-01-31 | Unknown | Closed |
— | ![]() Claude Opus 4.6 Extended Thinking | 97.60 | 2026-02-05 | Unknown | Closed |
— | ![]() Qwen3-8B Thinking Enabled | 97.40 | 2025-04-28 | 8B | Free Commercial |
— | ![]() Kimi K2 Standard Mode | 97.40 | 2025-07-11 | 1000B | Free Commercial |
— | ![]() DeepSeek-R1 Standard Mode | 97.30 | 2025-01-20 | 671B | Free Commercial |
— | ![]() Qwen3-32B Thinking Enabled | 97.20 | 2025-04-28 | 32B | Free Commercial |
— | ![]() MiniMax-M1-80k Standard Mode | 96.80 | 2025-06-16 | 456B | Free Commercial |
— | ![]() Pangu Pro MoE Standard Mode | 96.80 | 2025-06-30 | 71.9B | Free Commercial |
— | ![]() OpenAI o1 Standard Mode | 96.40 | 2024-12-05 | Unknown | Closed |
— | ![]() ERNIE-4.5-300B-A47B Standard Mode | 96.40 | 2025-06-30 | 300B | Free Commercial |
— | ![]() Kimi k1.5 (Long-CoT) Standard Mode | 96.20 | 2025-01-22 | Unknown | Closed |
— | ![]() Claude Sonnet 3.7-64K Extended Thinking Standard Mode | 96.20 | 2025-02-25 | Unknown | Closed |
— | ![]() Hunyuan-T1 Standard Mode | 96.20 | 2025-03-21 | Unknown | Closed |
— | ![]() Qwen3-235B-A22B Standard Mode | 96.20 | 2025-04-28 | 235B | Free Commercial |
— | ![]() MiniMax-M1-40k Standard Mode | 96.00 | 2025-06-16 | 456B | Free Commercial |
— | ![]() OpenAI o3-mini Thinking Enabled | 95.80 | 2025-01-31 | Unknown | Closed |
— | ![]() Llama 4 Behemoth Instruct Standard Mode | 95.00 | 2025-04-05 | 2000B | Free Commercial |
— | ![]() Kimi k1.5 (Short-CoT) Standard Mode | 94.60 | 2025-01-22 | Unknown | Closed |
— | ![]() MiniCPM5-2B unknown | 94.60 | 2026-09-07 | 2.5B | Free Commercial |
— | ![]() DeepSeek-R1-Distill-Llama-70B Standard Mode | 94.50 | 2025-01-20 | 70B | Free Commercial |
— | ![]() DeepSeek-V3-0324 Standard Mode | 94.00 | 2025-03-24 | 671B | Free Commercial |
— | ![]() Hunyuan-7B Standard Mode | 93.70 | 2025-08-04 | 7B | Free Commercial |