DataLearner logo

MAI-Thinking-1 Benchmark Details

MAI-Thinking-1 currently shows benchmark results led by LiveCodeBench (13 / 126, score 87.70), MMLU-Pro (28 / 177, score 85), AIME2025 (20 / 111, score 97).

Benchmark Results

MAI-Thinking-1

Benchmark Results

Thinking
Tool usage

Knowledge Exams

1 evaluations
Benchmark / mode
Score
Rank/total
MMLU-Pro
Thinking Mode
85
28 / 177

Scientific Reasoning

1 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Thinking Mode
84.20
98 / 255

Repository Engineering

2 evaluations
Benchmark / mode
Score
Rank/total
SWE-bench Verified
Thinking ModeTools
73.50
47 / 119
SWE-Bench Pro - Public
Thinking ModeTools
52.80
42 / 66

Algorithmic Coding

1 evaluations
Benchmark / mode
Score
Rank/total
LiveCodeBench
Thinking Mode
87.70
13 / 126

Mathematics

3 evaluations
Benchmark / mode
Score
Rank/total
AIME2025
Thinking Mode
97
20 / 111
AIME 2026
Thinking Mode
94.50
16 / 32
HMMT Feb 2026
Thinking Mode
84.90
9 / 11

Instruction Following

2 evaluations
Benchmark / mode
Score
Rank/total
IF Bench
Thinking Mode
69
21 / 34
MultiChallenge
Thinking Mode
53
1 / 1

Agentic Development

1 evaluations
Benchmark / mode
Score
Rank/total
Terminal Bench 2.0
Thinking ModeTools
46
44 / 50

Clinical Workflows

1 evaluations
Benchmark / mode
Score
Rank/total
35
4 / 4

Honesty & Factuality

1 evaluations
Benchmark / mode
Score
Rank/total
SimpleQA Verified
Thinking Mode
31
5 / 7