DataLearner 标志
GE

Gemini 3.6 Flash

多模态大模型编程大模型Gemini 3.6

Gemini 3.6 Flash

发布时间: 2026-07-21更新于: 2026-08-22浏览量: 1,092
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1M
多语言支持
暂无数据
推理能力
4/5

Gemini 3.6 Flash 是 Google 于 2026 年 7 月 21 日以 GA 发布的多模态模型(API 标识 gemini-3.6-flash),与 3.5 Flash-Lite、Flash Cyber 同批推出。它相对 3.5 Flash 最有辨识度的改进是效率而非峰值能力:官方称在 Artificial Analysis Index 上平均少用 17% 输出 tokens,并以更少的推理步骤、对话轮次和工具调用完成多步工作流。官方模型卡对照显示 DeepSWE v1.1 从 37% 升至 49%、MLE-Bench 从 49.7% 升至 63.9%,涨幅最大;SWE-Bench Pro 58.7%、Terminal-bench 2.1 78.0%、OSWorld-Verified 83.0%、GDPval-AA v2 1421 则是稳步小幅改进。规格为 1M 上下文、64K 输出,默认 thinking level 为 medium。标准价每百万 tokens 输入 1.50 美元、输出 7.50 美元。需注意 8 月 13 日发布的 Gemini 3.7 Flash 成绩更高且推广价更低,新项目通常更划算。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Gemini 3.6 Flash

模型基本信息

推理过程
支持
思考模式
思考水平 · 中 (Medium) (默认)思考水平 · 高 (High)
上下文长度
1M tokens
最大输出长度
64K tokens
模型类型
多模态大模型
输入/输出模态
文本、图像、音频、视频 → 文本
发布时间
2026-07-21
模型文件大小
暂无数据
MoE架构
总参数 / 激活参数
暂无数据 / 不适用
知识截止
暂无数据
Gemini 3.6 Flash

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
Gemini 3.6 Flash

官方介绍与博客

官方论文
DataLearnerAI博客
暂无
Gemini 3.6 Flash

API接口信息

接口速度
4/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$1.50/ 1M$7.50/ 1M
批量模式
类型适用条件输入输出
文本-$0.750/ 1M$3.75/ 1M
flex
类型适用条件输入输出
文本-$0.750/ 1M$3.75/ 1M
priority
类型适用条件输入输出
文本-$2.70/ 1M$13.50/ 1M
缓存定价Prompt缓存
类型有效期写入读取
文本-$0.075/ 1M

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Gemini 3.6 Flash

评测结果

Gemini 3.6 Flash 当前已收录的代表性评测结果包括 GPQA Diamond(7 / 270,得分 94.13)、Context Arena(17 / 126,得分 88.78)、OSWorld-Verified(5 / 26,得分 83)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

科学与综合推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
86.36
85 / 270
94.13
7 / 270

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1599.70
34 / 99

编程与软件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
SWE-Bench Pro - Public
思考模式工具
58.70
16 / 60
WeirdML v2
工具
56.10
33 / 52
DeepSWE
思考模式工具
49
27 / 34

文本向量检索

共 3 项评测
评测名称 / 模式
得分
排名/总数
71.70
60 / 126
86.56
21 / 126
88.78
17 / 126

AI Agent - 工具使用

共 3 项评测
评测名称 / 模式
得分
排名/总数
OSWorld-Verified
思考模式工具
83
5 / 26
Terminal-Bench 2.1
思考模式工具
78
27 / 49
MLE-Bench
思考模式工具
63.90
1 / 3

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA v2
思考模式
1421
18 / 25

多模态理解

共 2 项评测
评测名称 / 模式
得分
排名/总数
CharXiv RQ
思考模式
85.20
10 / 19
CharXiv RQ
思考模式工具
89.40
4 / 19

长上下文

共 2 项评测
评测名称 / 模式
得分
排名/总数
91.80
2 / 8
54
1 / 3

数学推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
58.95
23 / 58
21.95
24 / 40

和其他模型对比

Gemini 3.6 Flash

发布机构

Gemini 3.6 Flash

模型解读

这一代的主题不是更聪明,而是更省

Gemini 3.6 Flash(API 标识 gemini-3.6-flash)由 Google 于 2026 年 7 月 21 日以 GA 身份发布,与 Gemini 3.5 Flash-Lite、以及仅面向政府和可信伙伴的 Gemini 3.5 Flash Cyber 同批推出。

它相对前代 3.5 Flash 最有辨识度的改进不在某个跑分上,而在效率:Google 明确给出的数字是,在 Artificial Analysis Index 的测试中它平均少用 17% 的输出 tokens,并且能以更少的推理步骤、更少的对话轮次和更少的工具调用完成同样的多步工作流。对按 token 计费、又跑大量智能体循环的团队来说,这类改进直接体现在账单上——同样的输出价,实际花费更低。

逐项对比前代:全面上移,但幅度不一

官方模型卡把 3.6 Flash 与 3.5 Flash 放在了同一张表里,对照关系很清楚(括号内为 3.5 Flash):

  • DeepSWE v1.1:49%(37%)——涨幅最大的一项,仓库级编程是这代补得最狠的短板。
  • MLE-Bench:63.9%(49.7%)——机器学习研究类任务提升同样明显。
  • SWE-Bench Pro (Public):58.7%(55.1%)
  • Terminal-bench 2.1(Terminus-2 harness):78.0%(76.2%)
  • OSWorld-Verified:83.0%(78.4%)
  • GDPval-AA v2:1421(1349)

可以看出,命令行和计算机操作是稳步小幅改进,而编程与 ML 研究类任务是跳跃式提升。Google 自己的总结也是:代码修改精度、执行循环、机器学习研究、计算机操作和知识工作五个方面有改进。

在 DataLearner 的横向榜单里,它的画像同样偏「推理与长上下文」而非「工程落地」:GPQA Diamond 94.13 在 226 个模型中排第 6,GDM-MRCR v2 的 1M 长上下文档位 54 分排第 1;但 DeepSWE 49 分在 27 个模型中仍只排第 20。长文档、科学推理交给它没问题,跨文件仓库改造仍需谨慎。

规格与调用

输入上下文 1,048,576 tokens,最大输出 65,536 tokens;输入支持文本、图像、视频、音频和 PDF,输出文本。默认 thinking level 为 medium,复杂任务可提到 high。支持函数调用、代码执行、File Search、Google 搜索与 Maps grounding、结构化输出、URL Context、上下文缓存与 Computer Use(预览),并可走 Batch、Flex、Priority 三种推理档。

价格与去向

Gemini Developer API 标准付费价为每百万 tokens 输入 1.50 美元、输出 7.50 美元(输出含 thinking tokens),上下文缓存读取 0.15 美元;Batch 与 Flex 档均为输入 0.75 美元、输出 3.75 美元。对比前代 3.5 Flash 的输出 9.00 美元,这一代在单价上也降了。

需要补充的是后续变化:2026 年 8 月 13 日 Google 又发布了 Gemini 3.7 Flash,各项成绩更高,且 2026 年底前推广价低至输入 0.75 / 输出 3.75 美元。因此如果没有已经绑定 3.6 的理由,新项目直接上 3.7 Flash 会更划算;3.6 Flash 更适合已在生产中、看重「输出 token 更省」这一点且不想再验证一轮的场景。可用渠道包括 Google AI Studio 的 Gemini API、Gemini 应用、Gemini Enterprise Agent Platform、Gemini Enterprise 与 Google Antigravity。模型权重未公开。

官方来源

Gemini 3.6 Flash

常见问题

Gemini 3.6 Flash 相比 3.5 Flash 提升在哪?

官方强调的是效率而非单纯的分数:相较 Gemini 3.5 Flash,在 Artificial Analysis Index 上平均减少 17% 的输出 tokens,并以更少的推理步骤、对话轮次和工具调用完成多步工作流。对按 token 计费的场景,这直接等于成本下降。能力方向上重点提升了代码生成、知识工作、多模态与空间推理,以及复杂编码循环中的智能体执行效率。

Gemini 3.6 Flash 最强和最弱的能力分别是什么?

最强的是科学推理和长上下文:GPQA Diamond 94.13 在 226 个模型中排第 6,GDM-MRCR v2(8-needle,1M)54 分在 3 个模型中排第 1、128K 档 91.80 排 8 个第 2,MLE-Bench 63.90 排 3 个第 1,OSWorld-Verified 83 分排 26 个第 5。最弱的是仓库级编程:DeepSWE 49 分排 27 个模型第 20,WeirdML v2 56.10 排 52 个第 33,生产力任务 GDPval-AA v2 1421 排 13 个第 10。

Gemini 3.6 Flash 的思考档位默认是什么?

默认 thinking level 为 medium,复杂任务可切换为 high。档位影响明显:GPQA Diamond 在 High 档 94.13 排第 6,切到 Low 档掉到 86.36、第 75 位;CharXiv RQ 带工具 89.40(第 3)对比不带工具 85.20(第 7)。

Gemini 3.6 Flash 支持电脑操作吗?

支持,但处于 Preview 阶段。完整功能列表包括 Thinking、函数调用、代码执行、File Search、Google Search 与 Maps grounding、结构化输出、URL Context、上下文缓存及 Computer Use(Preview),并支持 Batch、Flex 和 Priority 三种推理模式。

Gemini 3.6 Flash 和 3.7 Flash 怎么选?

3.7 Flash 是 2026 年 8 月 13 日发布的更新版本,价格更低(推广期输入 $0.75、输出 $3.75,约为 3.6 Flash 的一半)且在编程与智能体任务上更强。新项目直接用 3.7 Flash 更合适;3.6 Flash 的价值在于它已有稳定的生产验证,且在 1M 超长上下文检索上仍是库内第一。

Is Gemini 3.6 Flash open source?

The model weights are proprietary and are not published for download. Review the linked license text before commercial or derivative use.

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码