Gemini 3.5 Flash-Lite 适合做什么?不适合做什么?
适合量大、单步、结构清晰的活:高吞吐的智能体子任务、文档解析、结构化数据提取、翻译和简单数据处理,这也是 Google 给它的官方定位。不适合复杂长程任务——库内实测 Terminal-Bench 2.1 只有 54 分,在 44 个模型中排第 42;SWE-Bench Pro(Public)54.20 排 57 个第 34。把它当便宜的通用主力会很吃亏,当流水线上的批量工人则性价比很高。
Gemini 3.5 Flash-Lite
Gemini 3.5 Flash-Lite 是 Google 于 2026 年 7 月 21 日发布的 GA 低延迟模型(API 标识 gemini-3.5-flash-lite),是 Gemini 3.5 系列中速度最快、成本最低的一档,官方测得约每秒 350 个输出 token。规格为 1M 输入上下文、64K 最大输出,支持文本、图像、视频、音频和 PDF 输入,功能面覆盖思考、函数调用、代码执行、搜索与 Maps grounding 等,但默认 thinking level 为 minimal。选型时需清楚它的短板:Terminal-Bench 2.1 仅 54 分,在 44 个模型中排第 42,长链路、多步骤、需自我纠错的任务明显吃力,适合承担拆解后的单个环节而非统筹整条链路。官方成绩还包括 SWE-Bench Pro 54.2%、OSWorld-Verified 74.0%、GDM-MRCR v2 72.2、GDPval-AA v2 1140。标准价每百万 tokens 输入 0.30 美元、输出 2.50 美元,比同期 3.6 Flash 输入便宜 5 倍、输出便宜 3 倍。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.300/ 1M | $2.50/ 1M |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.150/ 1M | $1.25/ 1M |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.150/ 1M | $1.25/ 1M |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.540/ 1M | $4.50/ 1M |
| 类型 | 有效期 | 写入 | 读取 |
|---|---|---|---|
| 文本 | - | — | $0.020/ 1M |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
Gemini 3.5 Flash-Lite 当前已收录的代表性评测结果包括 Creative Writing(41 / 99,得分 1556)、GPQA Diamond(114 / 270,得分 83.33)、Context Arena(57 / 126,得分 72.57)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
Gemini 3.5 Flash-Lite(API 标识 gemini-3.5-flash-lite)是 Google 于 2026 年 7 月 21 日正式发布的 GA 模型,与 Gemini 3.6 Flash 同批推出。它在 Gemini 3.5 系列里的定位是速度最快、成本最低的那一档,官方公布的 Artificial Analysis 测量结果约为每秒 350 个输出 token。
Google 给出的推荐场景也很具体,都是「量大、结构清晰、单步能完成」的活:高吞吐量的智能体子任务、文档解析、结构化数据提取、翻译,以及简单的数据处理。
比起罗列它能做什么,选型时更该先知道它做不好什么。在 DataLearner 的横向榜单中,Terminal-Bench 2.1 只有 54 分,在 44 个模型中排第 42——几乎垫底。这类基准考察的正是长链路、多步骤、需要自我纠错的终端任务,而这恰恰是 Flash-Lite 为了速度和成本做出的取舍。
与之呼应的是它的默认配置:默认 thinking level 是 minimal,也就是默认几乎不思考。官方文档也提示,如果要用于自主智能体、工具调用或多步推理,需要手动把档位提到 medium 或 high——但那样一来,速度与成本优势也会同步被稀释。
所以正确的用法是:把它放在流水线里承担「拆解后的单个环节」,而不是让它统筹整条链路。真正需要规划和纠错的部分,交给 3.6 或 3.7 Flash。
Google 发布博客给出的成绩为:Terminal-Bench 2.1 54%、SWE-Bench Pro 54.2%、OSWorld-Verified 74.0%、GDM-MRCR v2 72.2、GDPval-AA v2 1140。相较上一代 Gemini 3.1 Flash-Lite,它在智能体编码、长上下文和真实任务执行上都有提升——考虑到这是最低成本档,这组数字其实相当能打,只是不能拿去和同系列的 Flash 正牌比。具体档位与 harness 以 Google 的评测说明为准。
输入上下文上限 1,048,576 tokens,最大输出 65,536 tokens;输入支持文本、图像、视频、音频和 PDF,输出文本。功能面并没有因为是 Lite 而缩水多少:思考、函数调用、代码执行、File Search、Google 搜索与 Maps grounding、结构化输出、URL Context、上下文缓存均支持,并可走 Batch、Flex、Priority 推理档。
Gemini Developer API 标准付费价为每百万 tokens 输入 0.30 美元、输出 2.50 美元(输出含 thinking tokens),上下文缓存读取 0.03 美元;Batch 与 Flex 档均为输入 0.15 美元、输出 1.25 美元。对比同期的 Gemini 3.6 Flash(输入 1.50 / 输出 7.50 美元),输入便宜 5 倍、输出便宜 3 倍——这个差价足以让「先用 Lite 批量预处理、再把少量难题上交给大模型」成为一种很划算的架构。
可用渠道包括 Google AI Studio 的 Gemini API、Gemini 应用、Gemini Enterprise Agent Platform,并已开始在 Google 搜索中逐步上线。模型权重未公开,使用需遵守 Google Gemini API 服务条款。
适合量大、单步、结构清晰的活:高吞吐的智能体子任务、文档解析、结构化数据提取、翻译和简单数据处理,这也是 Google 给它的官方定位。不适合复杂长程任务——库内实测 Terminal-Bench 2.1 只有 54 分,在 44 个模型中排第 42;SWE-Bench Pro(Public)54.20 排 57 个第 34。把它当便宜的通用主力会很吃亏,当流水线上的批量工人则性价比很高。
标准 API 价格为每百万 tokens 输入 $0.30、输出 $2.50。作为对比,同期的 Gemini 3.6 Flash 是输入 $1.50、输出 $7.50,也就是 Flash-Lite 大约便宜到五分之一到三分之一。缓存命中输入低至 $0.03/百万 tokens。
Google 公布的 Artificial Analysis Index 测量结果为约 350 output tokens/s。它是 Gemini 3.5 系列里速度最快的型号,这个吞吐量是它的主要卖点。
默认 thinking level 是 minimal,也就是基本不思考,这是它能跑这么快的原因之一。如果任务涉及复杂的自主智能体、工具调用或多步推理,可以手动提高到 medium 或 high,但要注意这会同时抬高延迟和成本。
输入支持文本、图像、视频、音频和 PDF,输出文本;上下文上限 1,048,576 tokens,最大输出 65,536 tokens。功能上支持 Thinking、函数调用、代码执行、File Search、Google Search 与 Maps grounding、结构化输出、URL Context、上下文缓存,以及 Batch、Flex 和 Priority 三种推理模式。
The model weights are proprietary and are not published for download. Review the linked license text before commercial or derivative use.
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
