Gemini 3.6 Flash 相比 3.5 Flash 提升在哪?
官方强调的是效率而非单纯的分数:相较 Gemini 3.5 Flash,在 Artificial Analysis Index 上平均减少 17% 的输出 tokens,并以更少的推理步骤、对话轮次和工具调用完成多步工作流。对按 token 计费的场景,这直接等于成本下降。能力方向上重点提升了代码生成、知识工作、多模态与空间推理,以及复杂编码循环中的智能体执行效率。
Gemini 3.6 Flash 是 Google 于 2026 年 7 月 21 日以 GA 发布的多模态模型(API 标识 gemini-3.6-flash),与 3.5 Flash-Lite、Flash Cyber 同批推出。它相对 3.5 Flash 最有辨识度的改进是效率而非峰值能力:官方称在 Artificial Analysis Index 上平均少用 17% 输出 tokens,并以更少的推理步骤、对话轮次和工具调用完成多步工作流。官方模型卡对照显示 DeepSWE v1.1 从 37% 升至 49%、MLE-Bench 从 49.7% 升至 63.9%,涨幅最大;SWE-Bench Pro 58.7%、Terminal-bench 2.1 78.0%、OSWorld-Verified 83.0%、GDPval-AA v2 1421 则是稳步小幅改进。规格为 1M 上下文、64K 输出,默认 thinking level 为 medium。标准价每百万 tokens 输入 1.50 美元、输出 7.50 美元。需注意 8 月 13 日发布的 Gemini 3.7 Flash 成绩更高且推广价更低,新项目通常更划算。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $1.50/ 1M | $7.50/ 1M |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.750/ 1M | $3.75/ 1M |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.750/ 1M | $3.75/ 1M |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $2.70/ 1M | $13.50/ 1M |
| 类型 | 有效期 | 写入 | 读取 |
|---|---|---|---|
| 文本 | - | — | $0.075/ 1M |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
Gemini 3.6 Flash 当前已收录的代表性评测结果包括 GPQA Diamond(7 / 270,得分 94.13)、Context Arena(17 / 126,得分 88.78)、OSWorld-Verified(5 / 26,得分 83)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
Gemini 3.6 Flash(API 标识 gemini-3.6-flash)由 Google 于 2026 年 7 月 21 日以 GA 身份发布,与 Gemini 3.5 Flash-Lite、以及仅面向政府和可信伙伴的 Gemini 3.5 Flash Cyber 同批推出。
它相对前代 3.5 Flash 最有辨识度的改进不在某个跑分上,而在效率:Google 明确给出的数字是,在 Artificial Analysis Index 的测试中它平均少用 17% 的输出 tokens,并且能以更少的推理步骤、更少的对话轮次和更少的工具调用完成同样的多步工作流。对按 token 计费、又跑大量智能体循环的团队来说,这类改进直接体现在账单上——同样的输出价,实际花费更低。
官方模型卡把 3.6 Flash 与 3.5 Flash 放在了同一张表里,对照关系很清楚(括号内为 3.5 Flash):
可以看出,命令行和计算机操作是稳步小幅改进,而编程与 ML 研究类任务是跳跃式提升。Google 自己的总结也是:代码修改精度、执行循环、机器学习研究、计算机操作和知识工作五个方面有改进。
在 DataLearner 的横向榜单里,它的画像同样偏「推理与长上下文」而非「工程落地」:GPQA Diamond 94.13 在 226 个模型中排第 6,GDM-MRCR v2 的 1M 长上下文档位 54 分排第 1;但 DeepSWE 49 分在 27 个模型中仍只排第 20。长文档、科学推理交给它没问题,跨文件仓库改造仍需谨慎。
输入上下文 1,048,576 tokens,最大输出 65,536 tokens;输入支持文本、图像、视频、音频和 PDF,输出文本。默认 thinking level 为 medium,复杂任务可提到 high。支持函数调用、代码执行、File Search、Google 搜索与 Maps grounding、结构化输出、URL Context、上下文缓存与 Computer Use(预览),并可走 Batch、Flex、Priority 三种推理档。
Gemini Developer API 标准付费价为每百万 tokens 输入 1.50 美元、输出 7.50 美元(输出含 thinking tokens),上下文缓存读取 0.15 美元;Batch 与 Flex 档均为输入 0.75 美元、输出 3.75 美元。对比前代 3.5 Flash 的输出 9.00 美元,这一代在单价上也降了。
需要补充的是后续变化:2026 年 8 月 13 日 Google 又发布了 Gemini 3.7 Flash,各项成绩更高,且 2026 年底前推广价低至输入 0.75 / 输出 3.75 美元。因此如果没有已经绑定 3.6 的理由,新项目直接上 3.7 Flash 会更划算;3.6 Flash 更适合已在生产中、看重「输出 token 更省」这一点且不想再验证一轮的场景。可用渠道包括 Google AI Studio 的 Gemini API、Gemini 应用、Gemini Enterprise Agent Platform、Gemini Enterprise 与 Google Antigravity。模型权重未公开。
官方强调的是效率而非单纯的分数:相较 Gemini 3.5 Flash,在 Artificial Analysis Index 上平均减少 17% 的输出 tokens,并以更少的推理步骤、对话轮次和工具调用完成多步工作流。对按 token 计费的场景,这直接等于成本下降。能力方向上重点提升了代码生成、知识工作、多模态与空间推理,以及复杂编码循环中的智能体执行效率。
最强的是科学推理和长上下文:GPQA Diamond 94.13 在 226 个模型中排第 6,GDM-MRCR v2(8-needle,1M)54 分在 3 个模型中排第 1、128K 档 91.80 排 8 个第 2,MLE-Bench 63.90 排 3 个第 1,OSWorld-Verified 83 分排 26 个第 5。最弱的是仓库级编程:DeepSWE 49 分排 27 个模型第 20,WeirdML v2 56.10 排 52 个第 33,生产力任务 GDPval-AA v2 1421 排 13 个第 10。
默认 thinking level 为 medium,复杂任务可切换为 high。档位影响明显:GPQA Diamond 在 High 档 94.13 排第 6,切到 Low 档掉到 86.36、第 75 位;CharXiv RQ 带工具 89.40(第 3)对比不带工具 85.20(第 7)。
支持,但处于 Preview 阶段。完整功能列表包括 Thinking、函数调用、代码执行、File Search、Google Search 与 Maps grounding、结构化输出、URL Context、上下文缓存及 Computer Use(Preview),并支持 Batch、Flex 和 Priority 三种推理模式。
3.7 Flash 是 2026 年 8 月 13 日发布的更新版本,价格更低(推广期输入 $0.75、输出 $3.75,约为 3.6 Flash 的一半)且在编程与智能体任务上更强。新项目直接用 3.7 Flash 更合适;3.6 Flash 的价值在于它已有稳定的生产验证,且在 1M 超长上下文检索上仍是库内第一。
The model weights are proprietary and are not published for download. Review the linked license text before commercial or derivative use.
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
