GLM-5.3-FlashvsGemini 3.7 Flash
在 4 个同模式 benchmark 中,Gemini 3.7 Flash 整体领先:GLM-5.3-Flash 领先 1 项,Gemini 3.7 Flash 领先 3 项,持平 0 项,平均分差 -5.18。另有 23 项测试模式不同,仅供参考。
GLM-5.3-Flash
智谱AI · 2026-08-26 · 多模态大模型
Gemini 3.7 Flash
Google DeepMind · 2026-08-13 · 多模态大模型
GLM-5.3-Flash1 项(25%)(75%)3 项Gemini 3.7 Flash
评测分数
按能力类目分组,每组内按分差大小排列;共 4 项。
仓库修复与多文件工程
Gemini 3.7 Flash 领先 1/1| 评测项 | GLM-5.3-Flash | Gemini 3.7 Flash | 分差 |
|---|---|---|---|
| FrontierSWE v2 | 18.1317 / 22Max (With Tools) | 20.2615 / 22Max (With Tools) | -2.14 |
多轮记忆与持续上下文
Gemini 3.7 Flash 领先 1/1| 评测项 | GLM-5.3-Flash | Gemini 3.7 Flash | 分差 |
|---|---|---|---|
| Context Arena | 79.4541 / 126Thinking High (No Tools) | 95.954 / 126Thinking High (No Tools) | -16.50 |
抽象归纳与泛化
Gemini 3.7 Flash 领先 1/1| 评测项 | GLM-5.3-Flash | Gemini 3.7 Flash | 分差 |
|---|---|---|---|
| ARC-AGI-1 | 71.83129 / 221Thinking High (No Tools) | 95.5032 / 221Thinking High (No Tools) | -23.67 |
自主开发与终端任务
GLM-5.3-Flash 领先 1/1| 评测项 | GLM-5.3-Flash | Gemini 3.7 Flash | 分差 |
|---|---|---|---|
| Terminal-Bench 4.0 | 32.8030 / 102Thinking (With Tools) | 11.2161 / 102Thinking (With Tools) | +21.59 |
测试模式不同的成绩
共 23 项。两款模型的公开成绩来自不同测试模式,分数不直接可比,不计入胜负和平均分差。
| 评测项 | GLM-5.3-Flash | Gemini 3.7 Flash |
|---|---|---|
| Terminal-Bench 2.1 | 84.30Max (With Tools) | 85.80Thinking (With Tools) |
| IOI (Vals v2) | 52.50Max (With Tools) | 67.83Thinking High (With Tools) |
| Vals Index | 47.22Max (With Tools) | 59.31Thinking High (With Tools) |
| MedScribe | 88.94Max (With Tools) | 83.94Thinking High (With Tools) |
| Vibe Code Bench v1.1 | 30.76Max (With Tools) | 70.39Thinking High (With Tools) |
| LiveBench | 71.59Reported best (effort unspecified) | 78.83Thinking High (No Tools) |
| CharXiv RQ | 89.40Max (With Tools) | 88.70Thinking Medium (With Tools) |
| GDP.pdf | 15.40Thinking (No Tools) | 34Thinking Medium (No Tools) |
| EMB (Excel Modeling) | 55.93Max (With Tools) | 71.33Thinking High (With Tools) |
| Finance Agent v2 | 57.85Max (With Tools) | 59.04Thinking High (With Tools) |
| Harvey's Legal Agent Benchmark | 6.67Max (With Tools) | 8.75Thinking High (With Tools) |
| Legal Research Bench | 45.19Max (With Tools) | 34.62Thinking High (With Tools) |
| Code Migration | 20.52Max (With Tools) | 34.80Thinking High (With Tools) |
| FrontierMath Tier 4 v2 | 17.07Max (With Tools) | 36.59Thinking High (With Tools) |
| FrontierMath v2 | 55.79Max (With Tools) | 71.58Thinking High (With Tools) |
| ProofBench v1.1 (Lean 4) | 21Max (With Tools) | 58Thinking High (With Tools) |
| AutomationBench | 48.80Max (With Tools) | 30.40Thinking (With Tools) |
| APEX-SWE | 46.10Max (With Tools) | 42Thinking High (With Tools) |
| DeepSWE | 63.39Max (With Tools) | 65.49Thinking Medium (With Tools) |
| SciCode | 51.60Thinking (No Tools) | 59.80Thinking Medium (No Tools) |
| CritPt | 15.40Thinking (No Tools) | 14.30Thinking High (No Tools) |
| GPQA Diamond | 90.15Max (No Tools) | 94.82Thinking High (No Tools) |
| τ³-Banking | 47.20Thinking (With Tools) | 35.50Thinking Medium (With Tools) |
规格对比
| 字段 | GLM-5.3-Flash | Gemini 3.7 Flash |
|---|---|---|
| 发布机构 | 智谱AI | Google DeepMind |
| 发布时间 | 2026-08-26 | 2026-08-13 |
| 模型类型 | 多模态大模型 | 多模态大模型 |
| 架构 | MoE 架构 | 稠密模型 |
| 参数规模 | 3200亿 | 暂无数据 |
| 上下文长度 | 1M | 1M |
| 最大输出 | 128K | 64K |
API 调用价格
价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。
| 价格项 | GLM-5.3-Flash | Gemini 3.7 Flash |
|---|---|---|
| 文本输入 | $0.15 / 1M tokens | $0.75 / 1M tokens |
| 文本输出 | $0.5 / 1M tokens | $3.75 / 1M tokens |
| 缓存读取 | $0.03 / 1M tokens | $0.075 / 1M tokens |
小结
- GLM-5.3-Flash在以下类目领先:自主开发与终端任务 (1/1)
- Gemini 3.7 Flash在以下类目领先:仓库修复与多文件工程 (1/1)、多轮记忆与持续上下文 (1/1)、抽象归纳与泛化 (1/1)
4 个同模式 benchmark 上,Gemini 3.7 Flash 平均高出 5.18 分。
单项差距最大的 benchmark:ARC-AGI-1 — GLM-5.3-Flash 71.83,Gemini 3.7 Flash 95.50(分差 -23.67)。
本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。