DataLearner 标志

Claude Sonnet 4.5vsGemini 2.5-Pro

Claude Sonnet 4.5 与 Gemini 2.5-Pro 在 13 个共同 benchmark 中整体接近:Claude Sonnet 4.5 领先 6 项,Gemini 2.5-Pro 领先 6 项,持平 1 项,平均分差 +38.18。

Anthropic
Claude Sonnet 4.5

Anthropic · 2025-09-30 · 聊天大模型

Google Deep Mind
Gemini 2.5-Pro

Google Deep Mind · 2025-06-05 · 推理大模型

Claude Sonnet 4.56 (46%)持平1(46%)6 Gemini 2.5-Pro

评测分数

按能力类目分组,每组内按分差大小排列;共 13 项。

Math and Reasoning

Gemini 2.5-Pro 领先 3/4
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
IMO-ProofBench27.108 / 16Thinking (No Tools)55.203 / 16Thinking (No Tools)-28.10
IMO-ProofBench Advanced4.8019 / 24Thinking (No Tools)17.6014 / 24Thinking (No Tools)-12.80
FrontierMath5.2038 / 60Normal (No Tools)1123 / 60Normal (No Tools)-5.80
FrontierMath - Tier 42.1056 / 80Normal (No Tools)2.1056 / 80Normal (No Tools)持平

Coding and Software Engineer

Claude Sonnet 4.5 领先 2/3
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
CodeClash1,3891 / 8Normal (With Tools)1,1256 / 8Normal (With Tools)+264
LiveCodeBench59136 / 250Normal (No Tools)77.1037 / 128Normal (No Tools)-18.10
GSO14.7012 / 21Normal (With Tools)3.9218 / 21Normal (With Tools)+10.78

Multimodal Understanding

Gemini 2.5-Pro 领先 2/2
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
VPCT3820 / 24Normal (No Tools)46.4012 / 24Normal (No Tools)-8.40
MMMU77.8023 / 74Thinking (No Tools)829 / 28Thinking (No Tools)-4.20

AI Agent - Information Search

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
BrowseComp24.1055 / 57Thinking (With Tools)7.8056 / 57Thinking (With Tools)+16.30

AI Agent - Tool Usage

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
Terminal Bench 2.042.8043 / 48Thinking (With Tools)32.6048 / 48Thinking (With Tools)+10.20

Productivity Knowledge

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
GDPval-AA3910 / 15Thinking (No Tools)2215 / 15Thinking (No Tools)+17

Writing and Creative Capabilities

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
Creative Writing1,67430 / 106Normal (No Tools)1,41958 / 106Normal (No Tools)+255.50

规格对比

字段Claude Sonnet 4.5Gemini 2.5-Pro
发布机构AnthropicGoogle Deep Mind
发布时间2025-09-302025-06-05
模型类型聊天大模型推理大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度1000K1000K
最大输出64K64K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Claude Sonnet 4.5Gemini 2.5-Pro
文本输入$3 / 1M tokens$1.25 / 1M tokens
文本输出$15 / 1M tokens$10 / 1M tokens
缓存读取$0.3 / 1M tokens$0.125 / 1M tokens
缓存写入$3.75 / 1M tokens暂无公开价格

小结

  • Claude Sonnet 4.5在以下类目领先:Coding and Software Engineer (2/3)、AI Agent - Information Search (1/1)、AI Agent - Tool Usage (1/1)、Productivity Knowledge (1/1)、Writing and Creative Capabilities (1/1)
  • Gemini 2.5-Pro在以下类目领先:Math and Reasoning (3/4)、Multimodal Understanding (2/2)

13 个共同 benchmark 上,Claude Sonnet 4.5 平均高出 38.18 分。

单项差距最大的 benchmark:CodeClash — Claude Sonnet 4.5 1,389,Gemini 2.5-Pro 1,125(分差 +264)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。