DataLearner 标志

GLM-5.3-FlashvsGemini 3.7 Flash

在 4 个同模式 benchmark 中,Gemini 3.7 Flash 整体领先:GLM-5.3-Flash 领先 1 项,Gemini 3.7 Flash 领先 3 项,持平 0 项,平均分差 -5.18。另有 23 项测试模式不同,仅供参考。

智谱AI
GLM-5.3-Flash

智谱AI · 2026-08-26 · 多模态大模型

Google DeepMind
Gemini 3.7 Flash

Google DeepMind · 2026-08-13 · 多模态大模型

GLM-5.3-Flash1 项(25%)(75%)3 项Gemini 3.7 Flash

评测分数

按能力类目分组,每组内按分差大小排列;共 4 项。

仓库修复与多文件工程

Gemini 3.7 Flash 领先 1/1
评测项GLM-5.3-FlashGemini 3.7 Flash分差
FrontierSWE v218.1317 / 22Max (With Tools)20.2615 / 22Max (With Tools)-2.14

多轮记忆与持续上下文

Gemini 3.7 Flash 领先 1/1
评测项GLM-5.3-FlashGemini 3.7 Flash分差
Context Arena79.4541 / 126Thinking High (No Tools)95.954 / 126Thinking High (No Tools)-16.50

抽象归纳与泛化

Gemini 3.7 Flash 领先 1/1
评测项GLM-5.3-FlashGemini 3.7 Flash分差
ARC-AGI-171.83129 / 221Thinking High (No Tools)95.5032 / 221Thinking High (No Tools)-23.67

自主开发与终端任务

GLM-5.3-Flash 领先 1/1
评测项GLM-5.3-FlashGemini 3.7 Flash分差
Terminal-Bench 4.032.8030 / 102Thinking (With Tools)11.2161 / 102Thinking (With Tools)+21.59

测试模式不同的成绩

共 23 项。两款模型的公开成绩来自不同测试模式,分数不直接可比,不计入胜负和平均分差。

评测项GLM-5.3-FlashGemini 3.7 Flash
Terminal-Bench 2.184.30Max (With Tools)85.80Thinking (With Tools)
IOI (Vals v2)52.50Max (With Tools)67.83Thinking High (With Tools)
Vals Index47.22Max (With Tools)59.31Thinking High (With Tools)
MedScribe88.94Max (With Tools)83.94Thinking High (With Tools)
Vibe Code Bench v1.130.76Max (With Tools)70.39Thinking High (With Tools)
LiveBench71.59Reported best (effort unspecified)78.83Thinking High (No Tools)
CharXiv RQ89.40Max (With Tools)88.70Thinking Medium (With Tools)
GDP.pdf15.40Thinking (No Tools)34Thinking Medium (No Tools)
EMB (Excel Modeling)55.93Max (With Tools)71.33Thinking High (With Tools)
Finance Agent v257.85Max (With Tools)59.04Thinking High (With Tools)
Harvey's Legal Agent Benchmark6.67Max (With Tools)8.75Thinking High (With Tools)
Legal Research Bench45.19Max (With Tools)34.62Thinking High (With Tools)
Code Migration20.52Max (With Tools)34.80Thinking High (With Tools)
FrontierMath Tier 4 v217.07Max (With Tools)36.59Thinking High (With Tools)
FrontierMath v255.79Max (With Tools)71.58Thinking High (With Tools)
ProofBench v1.1 (Lean 4)21Max (With Tools)58Thinking High (With Tools)
AutomationBench48.80Max (With Tools)30.40Thinking (With Tools)
APEX-SWE46.10Max (With Tools)42Thinking High (With Tools)
DeepSWE63.39Max (With Tools)65.49Thinking Medium (With Tools)
SciCode51.60Thinking (No Tools)59.80Thinking Medium (No Tools)
CritPt15.40Thinking (No Tools)14.30Thinking High (No Tools)
GPQA Diamond90.15Max (No Tools)94.82Thinking High (No Tools)
τ³-Banking47.20Thinking (With Tools)35.50Thinking Medium (With Tools)

规格对比

字段GLM-5.3-FlashGemini 3.7 Flash
发布机构智谱AIGoogle DeepMind
发布时间2026-08-262026-08-13
模型类型多模态大模型多模态大模型
架构MoE 架构稠密模型
参数规模3200亿暂无数据
上下文长度1M1M
最大输出128K64K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项GLM-5.3-FlashGemini 3.7 Flash
文本输入$0.15 / 1M tokens$0.75 / 1M tokens
文本输出$0.5 / 1M tokens$3.75 / 1M tokens
缓存读取$0.03 / 1M tokens$0.075 / 1M tokens

小结

  • GLM-5.3-Flash在以下类目领先:自主开发与终端任务 (1/1)
  • Gemini 3.7 Flash在以下类目领先:仓库修复与多文件工程 (1/1)、多轮记忆与持续上下文 (1/1)、抽象归纳与泛化 (1/1)

4 个同模式 benchmark 上,Gemini 3.7 Flash 平均高出 5.18 分。

单项差距最大的 benchmark:ARC-AGI-1 — GLM-5.3-Flash 71.83,Gemini 3.7 Flash 95.50(分差 -23.67)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。