Gemini 3.7 Flash 是正式版还是预览版?
它是 GA 正式版。官方稳定 API ID 为 gemini-3.7-flash,可用于生产环境。
Gemini 3.7 Flash
Gemini 3.7 Flash 是 Google 于 2026 年 8 月 13 日以 GA 发布的多模态推理模型(API 标识 gemini-3.7-flash),官方称其为「最智能的 workhorse 模型」。由于同系列 Gemini 3.5 Pro 持续跳票,它实际承担着 Gemini 当前的主力角色。规格为 1M 输入上下文、64K 最大输出,知识截止 2026 年 3 月,支持文本、图像、视频、音频和 PDF 输入,思考分 low/medium/high 三档、默认 medium。官方成绩包括 Terminal-Bench 2.1 85.8%、DeepSWE v1.1 65.3%、GDM-MRCR v2(128K)97.0%、AA Intelligence Index 56;但同一张模型卡上 Terminal-Bench 3.0 仅 14.9%,说明面对更长链路的开放式终端任务成功率仍然很低,做智能体规划时更该参考后者。价格需注意悬崖:2026 年 12 月 31 日前为推广价输入 0.75 / 输出 3.75 美元每百万 tokens,2027 年 1 月 1 日起翻倍至 1.50 / 7.50 美元。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.750/ 1M | $3.75/ 1M |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.375/ 1M | $1.88/ 1M |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.375/ 1M | $1.88/ 1M |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $1.35/ 1M | $6.75/ 1M |
| 类型 | 有效期 | 写入 | 读取 |
|---|---|---|---|
| 文本 | - | — | $0.037/ 1M |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
Gemini 3.7 Flash 当前已收录的代表性评测结果包括 GPQA Diamond(1 / 270,得分 94.82)、Context Arena(4 / 126,得分 95.95)、AA-AnalystAgent(1 / 12,得分 60)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
Gemini 3.7 Flash(稳定 API 标识 gemini-3.7-flash)是 Google 于 2026 年 8 月 13 日以 GA 身份发布的多模态推理模型。Google 官方给它的定语是「我们最智能的 workhorse 模型」,重点方向是真实软件工程、网页与 UI 生成、复杂知识工作,以及需要可靠执行的多步智能体流程。
放在时间线里看会更清楚它的分量:同系列的 Gemini 3.5 Pro 自 2026 年 5 月官宣后连续跳票、至今未发布,Flash 线却已经从 3.5 一路迭代到 3.7。所以它虽然叫 Flash,实际承担的是 Gemini 当前的主力角色,而不是「省钱的备选」。
DeepMind 官方模型卡给出的数据是:Artificial Analysis Intelligence Index 56、FrontierCode 1.1 Main 43.6%、DeepSWE v1.1 65.3%、Code Arena 1588 Elo、Terminal-Bench 2.1 85.8%、GDPval-AA v2 1525 Elo、GDP.pdf 34.0%、GDM-MRCR v2(128K)97.0%、OSWorld 2.0 47.9%、HLE-Verified 53.6%。
其中最值得单独拎出来的一组对比是 Terminal-Bench 2.1 拿到 85.8%,而 Terminal-Bench 3.0 只有 14.9%。这不是模型忽然变差,而是 3.0 版本大幅提高了任务难度和长程要求——它恰好说明:当前一代模型在「已被充分适配的命令行任务」上已经接近饱和,但面对更长链路、更开放的终端任务时,成功率仍然很低。做智能体规划时,这个数字比 85.8% 更有参考价值。
Google 的评测方法说明也值得留意:多数结果使用默认采样设置,DeepSWE 使用 high thinking 与 mini-SWE agent harness,各基准在工具、联网、视频帧数和重复运行次数上的条件并不一致,跨模型比较时不能只看数字。
输入上下文上限 1,048,576 tokens,最大输出 65,536 tokens;支持文本、图像、视频、音频和 PDF 输入,输出文本,知识截止为 2026 年 3 月。思考档位分 low / medium / high 三档,默认 medium。功能面覆盖函数调用、代码执行、File Search、Google 搜索与 Maps grounding、结构化输出、URL Context、上下文缓存,以及预览阶段的 Computer Use;推理档位可选 Batch、Flex 和 Priority。
Gemini Developer API 目前执行推广价,且官方已经写明了到期时间:2026 年 12 月 31 日前,标准档每百万 tokens 输入 0.75 美元、输出 3.75 美元(含 thinking tokens),缓存读取 0.075 美元;2027 年 1 月 1 日起分别涨到 1.50、7.50 和 0.15 美元,正好翻倍。如果你在做全年成本测算或者签长期用量,务必按翻倍后的价格留出余量。
可用渠道包括 Gemini API、Google AI Studio、Google Antigravity、Gemini Enterprise Agent Platform、Gemini Enterprise 应用以及 Gemini Spark。模型权重未公开,使用需遵守 Google Gemini API 服务条款。
它是 GA 正式版。官方稳定 API ID 为 gemini-3.7-flash,可用于生产环境。
输入上下文上限为 1,048,576 tokens,最大输出为 65,536 tokens;支持文本、图像、视频、音频和 PDF 输入,输出文本。
支持 low、medium、high 三档,默认是 medium;minimal 不受支持。high 适合最困难的推理、数学、编码和 Agent 任务,但会使用更多 thinking tokens。
2026 年 12 月 31 日前 Standard 推广价为每百万 tokens 输入 $0.75、输出 $3.75、缓存读取 $0.075;2027 年 1 月 1 日起分别调整为 $1.50、$7.50 和 $0.15。
官方模型卡报告 DeepSWE 65.3%、Terminal-Bench 2.1 85.8%、Code Arena 1588 Elo、GDP.pdf 34.0%、GDM-MRCR v2 128K 97.0%、OSWorld 2.0 47.9% 和 HLE-Verified 53.6% 等成绩。
不开源。Google 未公开模型权重、总参数量或激活参数量;该模型通过 Gemini API 和 Google 产品提供。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
