DataLearner 标志
GE

Gemini 3.5 Flash-Lite

多模态大模型工具使用Gemini 3.5

Gemini 3.5 Flash-Lite

发布时间: 2026-07-21更新于: 2026-08-22浏览量: 288
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1M
多语言支持
暂无数据
推理能力
3/5

Gemini 3.5 Flash-Lite 是 Google 于 2026 年 7 月 21 日发布的 GA 低延迟模型(API 标识 gemini-3.5-flash-lite),是 Gemini 3.5 系列中速度最快、成本最低的一档,官方测得约每秒 350 个输出 token。规格为 1M 输入上下文、64K 最大输出,支持文本、图像、视频、音频和 PDF 输入,功能面覆盖思考、函数调用、代码执行、搜索与 Maps grounding 等,但默认 thinking level 为 minimal。选型时需清楚它的短板:Terminal-Bench 2.1 仅 54 分,在 44 个模型中排第 42,长链路、多步骤、需自我纠错的任务明显吃力,适合承担拆解后的单个环节而非统筹整条链路。官方成绩还包括 SWE-Bench Pro 54.2%、OSWorld-Verified 74.0%、GDM-MRCR v2 72.2、GDPval-AA v2 1140。标准价每百万 tokens 输入 0.30 美元、输出 2.50 美元,比同期 3.6 Flash 输入便宜 5 倍、输出便宜 3 倍。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Gemini 3.5 Flash-Lite

模型基本信息

推理过程
支持
思考模式
思考水平 · 低 (Low)思考水平 · 中 (Medium)思考水平 · 高 (High)
上下文长度
1M tokens
最大输出长度
64K tokens
模型类型
多模态大模型
输入/输出模态
文本、图像、音频、视频 → 文本
发布时间
2026-07-21
模型文件大小
暂无数据
MoE架构
总参数 / 激活参数
暂无数据 / 不适用
知识截止
暂无数据
Gemini 3.5 Flash-Lite

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
Gemini 3.5 Flash-Lite

官方介绍与博客

DataLearnerAI博客
暂无
Gemini 3.5 Flash-Lite

API接口信息

接口速度
5/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.300/ 1M$2.50/ 1M
批量模式
类型适用条件输入输出
文本-$0.150/ 1M$1.25/ 1M
flex
类型适用条件输入输出
文本-$0.150/ 1M$1.25/ 1M
priority
类型适用条件输入输出
文本-$0.540/ 1M$4.50/ 1M
缓存定价Prompt缓存
类型有效期写入读取
文本-$0.020/ 1M

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Gemini 3.5 Flash-Lite

评测结果

Gemini 3.5 Flash-Lite 当前已收录的代表性评测结果包括 Creative Writing(41 / 99,得分 1556)、GPQA Diamond(114 / 270,得分 83.33)、Context Arena(57 / 126,得分 72.57)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

科学与综合推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
75.76
166 / 270
83.33
114 / 270

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1556
41 / 99

编程与软件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-Bench Pro - Public
思考模式工具
54.20
36 / 60

文本向量检索

共 3 项评测
评测名称 / 模式
得分
排名/总数
61.90
75 / 126
65.50
72 / 126
72.57
57 / 126

AI Agent - 工具使用

共 2 项评测
评测名称 / 模式
得分
排名/总数
OSWorld-Verified
思考模式工具
74
14 / 26
Terminal-Bench 2.1
思考模式工具
54
47 / 49

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-Briefcase
思考模式工具
636.95
17 / 19

数学推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
25.96
46 / 58

和其他模型对比

Gemini 3.5 Flash-Lite

发布机构

Gemini 3.5 Flash-Lite

模型解读

系列里最快最便宜的一档,定位很清楚

Gemini 3.5 Flash-Lite(API 标识 gemini-3.5-flash-lite)是 Google 于 2026 年 7 月 21 日正式发布的 GA 模型,与 Gemini 3.6 Flash 同批推出。它在 Gemini 3.5 系列里的定位是速度最快、成本最低的那一档,官方公布的 Artificial Analysis 测量结果约为每秒 350 个输出 token

Google 给出的推荐场景也很具体,都是「量大、结构清晰、单步能完成」的活:高吞吐量的智能体子任务、文档解析、结构化数据提取、翻译,以及简单的数据处理。

它的短板必须先说清楚

比起罗列它能做什么,选型时更该先知道它做不好什么。在 DataLearner 的横向榜单中,Terminal-Bench 2.1 只有 54 分,在 44 个模型中排第 42——几乎垫底。这类基准考察的正是长链路、多步骤、需要自我纠错的终端任务,而这恰恰是 Flash-Lite 为了速度和成本做出的取舍。

与之呼应的是它的默认配置:默认 thinking level 是 minimal,也就是默认几乎不思考。官方文档也提示,如果要用于自主智能体、工具调用或多步推理,需要手动把档位提到 mediumhigh——但那样一来,速度与成本优势也会同步被稀释。

所以正确的用法是:把它放在流水线里承担「拆解后的单个环节」,而不是让它统筹整条链路。真正需要规划和纠错的部分,交给 3.6 或 3.7 Flash。

官方评测

Google 发布博客给出的成绩为:Terminal-Bench 2.1 54%、SWE-Bench Pro 54.2%、OSWorld-Verified 74.0%、GDM-MRCR v2 72.2、GDPval-AA v2 1140。相较上一代 Gemini 3.1 Flash-Lite,它在智能体编码、长上下文和真实任务执行上都有提升——考虑到这是最低成本档,这组数字其实相当能打,只是不能拿去和同系列的 Flash 正牌比。具体档位与 harness 以 Google 的评测说明为准。

规格与能力

输入上下文上限 1,048,576 tokens,最大输出 65,536 tokens;输入支持文本、图像、视频、音频和 PDF,输出文本。功能面并没有因为是 Lite 而缩水多少:思考、函数调用、代码执行、File Search、Google 搜索与 Maps grounding、结构化输出、URL Context、上下文缓存均支持,并可走 Batch、Flex、Priority 推理档。

价格:便宜是它最核心的产品力

Gemini Developer API 标准付费价为每百万 tokens 输入 0.30 美元、输出 2.50 美元(输出含 thinking tokens),上下文缓存读取 0.03 美元;Batch 与 Flex 档均为输入 0.15 美元、输出 1.25 美元。对比同期的 Gemini 3.6 Flash(输入 1.50 / 输出 7.50 美元),输入便宜 5 倍、输出便宜 3 倍——这个差价足以让「先用 Lite 批量预处理、再把少量难题上交给大模型」成为一种很划算的架构。

可用渠道包括 Google AI Studio 的 Gemini API、Gemini 应用、Gemini Enterprise Agent Platform,并已开始在 Google 搜索中逐步上线。模型权重未公开,使用需遵守 Google Gemini API 服务条款。

官方来源

Gemini 3.5 Flash-Lite

常见问题

Gemini 3.5 Flash-Lite 适合做什么?不适合做什么?

适合量大、单步、结构清晰的活:高吞吐的智能体子任务、文档解析、结构化数据提取、翻译和简单数据处理,这也是 Google 给它的官方定位。不适合复杂长程任务——库内实测 Terminal-Bench 2.1 只有 54 分,在 44 个模型中排第 42;SWE-Bench Pro(Public)54.20 排 57 个第 34。把它当便宜的通用主力会很吃亏,当流水线上的批量工人则性价比很高。

Gemini 3.5 Flash-Lite 多少钱?比 Flash 便宜多少?

标准 API 价格为每百万 tokens 输入 $0.30、输出 $2.50。作为对比,同期的 Gemini 3.6 Flash 是输入 $1.50、输出 $7.50,也就是 Flash-Lite 大约便宜到五分之一到三分之一。缓存命中输入低至 $0.03/百万 tokens。

Gemini 3.5 Flash-Lite 有多快?

Google 公布的 Artificial Analysis Index 测量结果为约 350 output tokens/s。它是 Gemini 3.5 系列里速度最快的型号,这个吞吐量是它的主要卖点。

Flash-Lite 的思考模式默认是开的吗?

默认 thinking level 是 minimal,也就是基本不思考,这是它能跑这么快的原因之一。如果任务涉及复杂的自主智能体、工具调用或多步推理,可以手动提高到 medium 或 high,但要注意这会同时抬高延迟和成本。

Gemini 3.5 Flash-Lite 支持哪些输入和功能?

输入支持文本、图像、视频、音频和 PDF,输出文本;上下文上限 1,048,576 tokens,最大输出 65,536 tokens。功能上支持 Thinking、函数调用、代码执行、File Search、Google Search 与 Maps grounding、结构化输出、URL Context、上下文缓存,以及 Batch、Flex 和 Priority 三种推理模式。

Is Gemini 3.5 Flash-Lite open source?

The model weights are proprietary and are not published for download. Review the linked license text before commercial or derivative use.

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码