Gemini 3.7 FlashvsClaude Sonnet 5
在 7 个同模式 benchmark 中,Gemini 3.7 Flash 整体领先:Gemini 3.7 Flash 领先 4 项,Claude Sonnet 5 领先 3 项,持平 0 项,平均分差 -3.20。另有 25 项测试模式不同,仅供参考。
Gemini 3.7 Flash
Google DeepMind · 2026-08-13 · 多模态大模型
Claude Sonnet 5
Anthropic · 2026-06-30 · 多模态大模型
Gemini 3.7 Flash4 项(57%)(43%)3 项Claude Sonnet 5
评测分数
按能力类目分组,每组内按分差大小排列;共 7 项。
仓库修复与多文件工程
胶着 2/2| 评测项 | Gemini 3.7 Flash | Claude Sonnet 5 | 分差 |
|---|---|---|---|
| DeepSWE | 65.2741 / 97Thinking High (With Tools) | 48.2374 / 97Thinking High (With Tools) | +17.04 |
| APEX-SWE | 4233 / 72Thinking High (With Tools) | 43.6532 / 72Thinking High (With Tools) | -1.65 |
写作与创意表达
Claude Sonnet 5 领先 1/1| 评测项 | Gemini 3.7 Flash | Claude Sonnet 5 | 分差 |
|---|---|---|---|
| Creative Writing | 1,72328 / 110Normal (No Tools) | 1,79424 / 110Normal (No Tools) | -70.80 |
文档与图表理解
Gemini 3.7 Flash 领先 1/1| 评测项 | Gemini 3.7 Flash | Claude Sonnet 5 | 分差 |
|---|---|---|---|
| GDP.pdf | 341 / 122Thinking Medium (No Tools) | 11.6076 / 122Thinking Medium (No Tools) | +22.40 |
科学知识与推理
Claude Sonnet 5 领先 1/1| 评测项 | Gemini 3.7 Flash | Claude Sonnet 5 | 分差 |
|---|---|---|---|
| CritPt | 14.3061 / 204Thinking High (No Tools) | 15.1058 / 204Thinking High (No Tools) | -0.80 |
科学计算与科研编程
Gemini 3.7 Flash 领先 1/1| 评测项 | Gemini 3.7 Flash | Claude Sonnet 5 | 分差 |
|---|---|---|---|
| SciCode | 57.2020 / 134Thinking High (No Tools) | 54.3045 / 134Thinking High (No Tools) | +2.90 |
自主开发与终端任务
Gemini 3.7 Flash 领先 1/1| 评测项 | Gemini 3.7 Flash | Claude Sonnet 5 | 分差 |
|---|---|---|---|
| Terminal-Bench 4.0 | 13.6053 / 102Thinking High (With Tools) | 5.1071 / 102Thinking High (With Tools) | +8.50 |
测试模式不同的成绩
共 25 项。两款模型的公开成绩来自不同测试模式,分数不直接可比,不计入胜负和平均分差。
| 评测项 | Gemini 3.7 Flash | Claude Sonnet 5 |
|---|---|---|
| Terminal-Bench 2.1 | 85.80Thinking (With Tools) | 80.40Extra-High (With Tools) |
| IOI (Vals v2) | 67.83Thinking High (With Tools) | 45Max (With Tools) |
| Vals Index | 59.31Thinking High (With Tools) | 59.61Max (With Tools) |
| Vals Index v2.1 | 51.27Thinking High (With Tools) | 51.77Max (task-specific tools) |
| MedCode | 53.39Thinking High (With Tools) | 47.54Max (With Tools) |
| MedScribe | 83.94Thinking High (With Tools) | 76.05Max (With Tools) |
| Vibe Code Bench v1.1 | 70.39Thinking High (With Tools) | 81.33Max (With Tools) |
| LiveBench | 78.83Thinking High (No Tools) | 76.04Extra-High (No Tools) |
| AA-AnalystAgent | 60Thinking High (With Tools + Internet) | 46.25Max (With Tools + Internet) |
| EMB (Excel Modeling) | 71.33Thinking High (With Tools) | 66.32Max (With Tools) |
| Finance Agent v2 | 59.04Thinking High (With Tools) | 53.91Max (With Tools) |
| Tax Agent Bench | 57.66Thinking High (With Tools) | 62.27Max (With Tools) |
| HLE-Verified | 53.60Thinking Medium (No Tools) | 31Reported best (effort unspecified) |
| Harvey Lab-AA | 90.66Thinking (No Tools) | 90.07Max (With Tools) |
| Harvey's Legal Agent Benchmark | 8.75Thinking High (With Tools) | 5Max (With Tools) |
| Legal Research Bench | 34.62Thinking High (With Tools) | 41.83Max (With Tools) |
| Code Migration | 34.80Thinking High (With Tools) | 44.39Max (With Tools) |
| FrontierMath Tier 4 v2 | 36.59Thinking High (With Tools) | 29.27Max (With Tools) |
| FrontierMath v2 | 71.58Thinking High (With Tools) | 65.61Max (With Tools) |
| ProofBench v1.1 (Lean 4) | 58Thinking High (With Tools) | 77Max (With Tools) |
| Context Arena | 95.95Thinking High (No Tools) | 79.53Max (No Tools) |
| GPQA Diamond | 94.82Thinking High (No Tools) | 90.53Extra-High (No Tools) |
| SAGE | 49.23Thinking High (With Tools) | 48.92Max (With Tools) |
| τ³-Banking | 35.50Thinking Medium (With Tools) | 15.70Normal (With Tools) |
| MMMU-Pro | 85.50Thinking High (No Tools) | 71.90Normal (No Tools) |
规格对比
| 字段 | Gemini 3.7 Flash | Claude Sonnet 5 |
|---|---|---|
| 发布机构 | Google DeepMind | Anthropic |
| 发布时间 | 2026-08-13 | 2026-06-30 |
| 模型类型 | 多模态大模型 | 多模态大模型 |
| 架构 | 稠密模型 | 稠密模型 |
| 参数规模 | 暂无数据 | 暂无数据 |
| 上下文长度 | 1M | 1M |
| 最大输出 | 64K | 128K |
API 调用价格
价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。
| 价格项 | Gemini 3.7 Flash | Claude Sonnet 5 |
|---|---|---|
| 文本输入 | $0.75 / 1M tokens | $2 / 1M tokens |
| 文本输出 | $3.75 / 1M tokens | $10 / 1M tokens |
| 缓存读取 | $0.075 / 1M tokens | $0.2 / 1M tokens |
| 缓存写入 | 暂无公开价格 | $2.5 / 1M tokens |
小结
- Gemini 3.7 Flash在以下类目领先:文档与图表理解 (1/1)、科学计算与科研编程 (1/1)、自主开发与终端任务 (1/1)
- Claude Sonnet 5在以下类目领先:写作与创意表达 (1/1)、科学知识与推理 (1/1)
- 胶着类目:仓库修复与多文件工程
7 个同模式 benchmark 上,Claude Sonnet 5 平均高出 3.20 分。
单项差距最大的 benchmark:Creative Writing — Gemini 3.7 Flash 1,723,Claude Sonnet 5 1,794(分差 -70.80)。
本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。