DataLearner logo

Gemini 2.5-Pro Benchmark Details

Gemini 2.5-Pro currently shows benchmark results led by MATH-500 (1 / 44, score 98.80), Aider-Polyglot (4 / 59, score 83.10), AIME 2024 (9 / 62, score 92). 2 source links are attached for reference.

Benchmark Results

Gemini 2.5-Pro

Benchmark Results

Thinking
Tool usage

General Knowledge

5 evaluations
Benchmark / mode
Score
Rank/total
MMLU Pro
Standard Mode
86
22 / 133
LiveBench
Thinking Level · High
58.33
76 / 115
ARC-AGI
Thinking Enabled
37
50 / 68
HLE
Thinking Enabled
21.60
125 / 185
ARC-AGI-2
Thinking Enabled
4.90
47 / 62

Other

1 evaluations
Benchmark / mode
Score
Rank/total
GPQA Diamond
Thinking Enabled
86.40
84 / 270

Common Sense

1 evaluations
Benchmark / mode
Score
Rank/total
SimpleQA
Standard Mode
54
11 / 47

Coding and Software Engineer

4 evaluations
Benchmark / mode
Score
Rank/total
CodeClash
Standard ModeTools
1125
6 / 8
LiveCodeBench
Standard Mode
77.10
37 / 127
SWE-bench Verified
Thinking Enabled
67.20
74 / 114
GSO
Standard ModeTools
3.92
18 / 21

Math and Reasoning

9 evaluations
Benchmark / mode
Score
Rank/total
MATH-500
Standard Mode
98.80
1 / 44
AIME 2024
Standard Mode
92
9 / 62
AIME2025
Thinking Enabled
88
43 / 106
IMO-ProofBench
Thinking Enabled
55.20
3 / 16
IMO 2024
Thinking Enabled
19
2 / 10
IMO-ProofBench Advanced
Thinking Enabled
17.60
11 / 19
IMO 2025
Thinking Enabled
15.20
3 / 9
FrontierMath
Standard Mode
11
23 / 60
2.10
56 / 80

Writing and Creative Capabilities

1 evaluations
Benchmark / mode
Score
Rank/total
Creative Writing
Standard Mode
1418.80
54 / 99

AI Agent - Tool Usage

2 evaluations
Benchmark / mode
Score
Rank/total
Terminal Bench 2.0
Thinking EnabledTools
32.60
48 / 48
Terminal-Bench
Thinking Enabled
25.30
28 / 35

Multimodal Understanding

2 evaluations
Benchmark / mode
Score
Rank/total
MMMU
Thinking Enabled
82
9 / 28
VPCT
Standard Mode
46.40
12 / 24

Common Sense Reasoning

1 evaluations
Benchmark / mode
Score
Rank/total
SimpleBench
Thinking Enabled
62.40
13 / 67

Agent Level Benchmark

5 evaluations
Benchmark / mode
Score
Rank/total
83.10
4 / 59
Aider-Polyglot
Thinking Enabled
79.10
8 / 59
τ²-Bench - Telecom
Thinking EnabledTools
54
32 / 35
METR Time Horizons v1.1
Standard ModeTools
38.73
19 / 22
Terminal Bench Hard
Thinking EnabledTools
25
12 / 13

Instruction Following

1 evaluations
Benchmark / mode
Score
Rank/total
IF Bench
Thinking EnabledTools
49
33 / 34

AI Agent - Information Search

1 evaluations
Benchmark / mode
Score
Rank/total
BrowseComp
Thinking EnabledTools
7.80
53 / 54

Productivity Knowledge

1 evaluations
Benchmark / mode
Score
Rank/total
GDPval-AA
Thinking Enabled
22
21 / 21

Long Context

1 evaluations
Benchmark / mode
Score
Rank/total
AA-LCR
Thinking Enabled
66
18 / 27

Other

1 evaluations
Benchmark / mode
Score
Rank/total
Fiction.liveBench
Standard Mode
91.70
5 / 16

Sources