DataLearner 标志

Gemini 3.6 FlashvsClaude Sonnet 5

在 9 个共同 benchmark 中,Claude Sonnet 5 整体领先:Gemini 3.6 Flash 领先 3 项,Claude Sonnet 5 领先 6 项,持平 0 项,平均分差 -23.04。

Google Deep Mind
Gemini 3.6 Flash

Google Deep Mind · 2026-07-21 · 多模态大模型

Anthropic
Claude Sonnet 5

Anthropic · 2026-06-30 · 多模态大模型

Gemini 3.6 Flash3 (33%)(67%)6 Claude Sonnet 5

评测分数

按能力类目分组,每组内按分差大小排列;共 9 项。

AI Agent - Tool Usage

胶着 2/2
评测项Gemini 3.6 FlashClaude Sonnet 5分差
Terminal-Bench 2.17827 / 49Thinking (With Tools)80.4023 / 49Extra-High (With Tools)-2.40
OSWorld-Verified835 / 26Thinking (With Tools)81.206 / 26Extra-High (With Tools)+1.80

Coding and Software Engineer

Claude Sonnet 5 领先 2/2
评测项Gemini 3.6 FlashClaude Sonnet 5分差
WeirdML v256.1033 / 52Thinking High (With Tools)68.7820 / 52Thinking High (With Tools)-12.68
DeepSWE4928 / 35Thinking (With Tools)5424 / 35Deep Thinking (With Tools)-5

Math and Reasoning

Claude Sonnet 5 领先 2/2
评测项Gemini 3.6 FlashClaude Sonnet 5分差
FrontierMath Tier 4 v221.9525 / 41Thinking High (No Tools)29.2719 / 41Max (No Tools)-7.32
FrontierMath v258.9523 / 58Thinking High (No Tools)65.6120 / 58Max (No Tools)-6.67

Text Embedding

Gemini 3.6 Flash 领先 1/1
评测项Gemini 3.6 FlashClaude Sonnet 5分差
Context Arena88.7817 / 126Thinking High (No Tools)79.5340 / 126Max (No Tools)+9.25

Writing and Creative Capabilities

Claude Sonnet 5 领先 1/1
评测项Gemini 3.6 FlashClaude Sonnet 5分差
Creative Writing1,60034 / 99Normal (No Tools)1,78818 / 99Normal (No Tools)-187.90

科学与综合推理

Gemini 3.6 Flash 领先 1/1
评测项Gemini 3.6 FlashClaude Sonnet 5分差
GPQA Diamond94.138 / 271Thinking High (No Tools)90.5340 / 271Extra-High (No Tools)+3.60

规格对比

字段Gemini 3.6 FlashClaude Sonnet 5
发布机构Google Deep MindAnthropic
发布时间2026-07-212026-06-30
模型类型多模态大模型多模态大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度1M1M
最大输出64K128K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Gemini 3.6 FlashClaude Sonnet 5
文本输入$1.5 / 1M tokens$2 / 1M tokens
文本输出$7.5 / 1M tokens$10 / 1M tokens
缓存读取$0.15 / 1M tokens$0.2 / 1M tokens
缓存写入暂无公开价格$2.5 / 1M tokens

小结

  • Gemini 3.6 Flash在以下类目领先:Text Embedding (1/1)、科学与综合推理 (1/1)
  • Claude Sonnet 5在以下类目领先:Coding and Software Engineer (2/2)、Math and Reasoning (2/2)、Writing and Creative Capabilities (1/1)
  • 胶着类目:AI Agent - Tool Usage

9 个共同 benchmark 上,Claude Sonnet 5 平均高出 23.04 分。

单项差距最大的 benchmark:Creative Writing — Gemini 3.6 Flash 1,600,Claude Sonnet 5 1,788(分差 -187.90)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。