DataLearner logo

Gemini 2.0 Pro ExperimentalvsGPT-4o(2024-11-20)

Across 5 shared benchmarks, Gemini 2.0 Pro Experimental leads overall: Gemini 2.0 Pro Experimental wins 5, GPT-4o(2024-11-20) wins 0, with 0 ties and an average score difference of +9.64.

DeepMind
Gemini 2.0 Pro Experimental

DeepMind · 2025-02-05 · Chat model

OpenAI
GPT-4o(2024-11-20)

OpenAI · 2024-11-20 · Chat model

Gemini 2.0 Pro Experimental5 wins(100%)(0%)0 winsGPT-4o(2024-11-20)

Benchmark scores

Grouped by capability, sorted by largest gap within each. 5 shared benchmarks.

General Knowledge

Gemini 2.0 Pro Experimental 2/2
BenchmarkGemini 2.0 Pro ExperimentalGPT-4o(2024-11-20)Diff
MMLU Pro79.1065 / 13277.9075 / 132+1.20
MMLU86.5028 / 6685.7037 / 66+0.80

Agent Level Benchmark

Gemini 2.0 Pro Experimental 1/1
BenchmarkGemini 2.0 Pro ExperimentalGPT-4o(2024-11-20)Diff
Aider-Polyglot35.6041 / 59Normal (No Tools)18.2050 / 59Normal (No Tools)+17.40

Common Sense

Gemini 2.0 Pro Experimental 1/1
BenchmarkGemini 2.0 Pro ExperimentalGPT-4o(2024-11-20)Diff
SimpleQA44.3016 / 4738.8021 / 47+5.50

Math and Reasoning

Gemini 2.0 Pro Experimental 1/1
BenchmarkGemini 2.0 Pro ExperimentalGPT-4o(2024-11-20)Diff
MATH91.804 / 4268.5024 / 42+23.30

Specs

FieldGemini 2.0 Pro ExperimentalGPT-4o(2024-11-20)
PublisherDeepMindOpenAI
Release date2025-02-052024-11-20
Model typeChat modelChat model
ArchitectureDenseDense
ParametersNot availableNot available
Context length2000K128K
Max output8KNot available

Summary

  • Gemini 2.0 Pro Experimentalleads in:General Knowledge (2/2), Agent Level Benchmark (1/1), Common Sense (1/1), Math and Reasoning (1/1)

On average across the 5 shared benchmarks, Gemini 2.0 Pro Experimental scores 9.64 higher.

Largest single-benchmark gap: MATH — Gemini 2.0 Pro Experimental 91.80 vs GPT-4o(2024-11-20) 68.50 (+23.30).

Page generated from structured model, pricing and benchmark records. No real-time LLM is used to write the prose.