DataLearner 标志

Gemini 3.7 FlashvsClaude Sonnet 5

在 7 个同模式 benchmark 中,Gemini 3.7 Flash 整体领先:Gemini 3.7 Flash 领先 4 项,Claude Sonnet 5 领先 3 项,持平 0 项,平均分差 -3.20。另有 25 项测试模式不同,仅供参考。

Google DeepMind
Gemini 3.7 Flash

Google DeepMind · 2026-08-13 · 多模态大模型

Anthropic
Claude Sonnet 5

Anthropic · 2026-06-30 · 多模态大模型

Gemini 3.7 Flash4 项(57%)(43%)3 项Claude Sonnet 5

评测分数

按能力类目分组,每组内按分差大小排列;共 7 项。

仓库修复与多文件工程

胶着 2/2
评测项Gemini 3.7 FlashClaude Sonnet 5分差
DeepSWE65.2741 / 97Thinking High (With Tools)48.2374 / 97Thinking High (With Tools)+17.04
APEX-SWE4233 / 72Thinking High (With Tools)43.6532 / 72Thinking High (With Tools)-1.65

写作与创意表达

Claude Sonnet 5 领先 1/1
评测项Gemini 3.7 FlashClaude Sonnet 5分差
Creative Writing1,72328 / 110Normal (No Tools)1,79424 / 110Normal (No Tools)-70.80

文档与图表理解

Gemini 3.7 Flash 领先 1/1
评测项Gemini 3.7 FlashClaude Sonnet 5分差
GDP.pdf341 / 122Thinking Medium (No Tools)11.6076 / 122Thinking Medium (No Tools)+22.40

科学知识与推理

Claude Sonnet 5 领先 1/1
评测项Gemini 3.7 FlashClaude Sonnet 5分差
CritPt14.3061 / 204Thinking High (No Tools)15.1058 / 204Thinking High (No Tools)-0.80

科学计算与科研编程

Gemini 3.7 Flash 领先 1/1
评测项Gemini 3.7 FlashClaude Sonnet 5分差
SciCode57.2020 / 134Thinking High (No Tools)54.3045 / 134Thinking High (No Tools)+2.90

自主开发与终端任务

Gemini 3.7 Flash 领先 1/1
评测项Gemini 3.7 FlashClaude Sonnet 5分差
Terminal-Bench 4.013.6053 / 102Thinking High (With Tools)5.1071 / 102Thinking High (With Tools)+8.50

测试模式不同的成绩

共 25 项。两款模型的公开成绩来自不同测试模式,分数不直接可比,不计入胜负和平均分差。

评测项Gemini 3.7 FlashClaude Sonnet 5
Terminal-Bench 2.185.80Thinking (With Tools)80.40Extra-High (With Tools)
IOI (Vals v2)67.83Thinking High (With Tools)45Max (With Tools)
Vals Index59.31Thinking High (With Tools)59.61Max (With Tools)
Vals Index v2.151.27Thinking High (With Tools)51.77Max (task-specific tools)
MedCode53.39Thinking High (With Tools)47.54Max (With Tools)
MedScribe83.94Thinking High (With Tools)76.05Max (With Tools)
Vibe Code Bench v1.170.39Thinking High (With Tools)81.33Max (With Tools)
LiveBench78.83Thinking High (No Tools)76.04Extra-High (No Tools)
AA-AnalystAgent60Thinking High (With Tools + Internet)46.25Max (With Tools + Internet)
EMB (Excel Modeling)71.33Thinking High (With Tools)66.32Max (With Tools)
Finance Agent v259.04Thinking High (With Tools)53.91Max (With Tools)
Tax Agent Bench57.66Thinking High (With Tools)62.27Max (With Tools)
HLE-Verified53.60Thinking Medium (No Tools)31Reported best (effort unspecified)
Harvey Lab-AA90.66Thinking (No Tools)90.07Max (With Tools)
Harvey's Legal Agent Benchmark8.75Thinking High (With Tools)5Max (With Tools)
Legal Research Bench34.62Thinking High (With Tools)41.83Max (With Tools)
Code Migration34.80Thinking High (With Tools)44.39Max (With Tools)
FrontierMath Tier 4 v236.59Thinking High (With Tools)29.27Max (With Tools)
FrontierMath v271.58Thinking High (With Tools)65.61Max (With Tools)
ProofBench v1.1 (Lean 4)58Thinking High (With Tools)77Max (With Tools)
Context Arena95.95Thinking High (No Tools)79.53Max (No Tools)
GPQA Diamond94.82Thinking High (No Tools)90.53Extra-High (No Tools)
SAGE49.23Thinking High (With Tools)48.92Max (With Tools)
τ³-Banking35.50Thinking Medium (With Tools)15.70Normal (With Tools)
MMMU-Pro85.50Thinking High (No Tools)71.90Normal (No Tools)

规格对比

字段Gemini 3.7 FlashClaude Sonnet 5
发布机构Google DeepMindAnthropic
发布时间2026-08-132026-06-30
模型类型多模态大模型多模态大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度1M1M
最大输出64K128K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Gemini 3.7 FlashClaude Sonnet 5
文本输入$0.75 / 1M tokens$2 / 1M tokens
文本输出$3.75 / 1M tokens$10 / 1M tokens
缓存读取$0.075 / 1M tokens$0.2 / 1M tokens
缓存写入暂无公开价格$2.5 / 1M tokens

小结

  • Gemini 3.7 Flash在以下类目领先:文档与图表理解 (1/1)、科学计算与科研编程 (1/1)、自主开发与终端任务 (1/1)
  • Claude Sonnet 5在以下类目领先:写作与创意表达 (1/1)、科学知识与推理 (1/1)
  • 胶着类目:仓库修复与多文件工程

7 个同模式 benchmark 上,Claude Sonnet 5 平均高出 3.20 分。

单项差距最大的 benchmark:Creative Writing — Gemini 3.7 Flash 1,723,Claude Sonnet 5 1,794(分差 -70.80)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。