Google 于 2026 年 7 月 21 日发布的 GA 多模态 Flash-Lite 模型:1M 上下文、64K 最大输出,约 350 output tokens/s,标准 API 价格为每百万 tokens 输入 $0.30、输出 $2.50。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
模型基本信息
开源和体验地址
官方介绍与博客
API接口信息
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.300/ 1M | $2.50/ 1M |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.150/ 1M | $1.25/ 1M |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.150/ 1M | $1.25/ 1M |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.540/ 1M | $4.50/ 1M |
| 类型 | 有效期 | 写入 | 读取 |
|---|---|---|---|
| 文本 | - | - | $0.020/ 1M |
评测结果
Gemini 3.5 Flash-Lite 当前已收录的代表性评测结果包括 OSWorld-Verified(12 / 23,得分 74)、SWE-Bench Pro - Public(31 / 53,得分 54.20)、TerminalBench 2.1(26 / 27,得分 54)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
和其他模型对比
暂时没有为该模型整理的相关对比页面。
想自定义其他组合?打开对比工具
发布机构
模型解读
定位与发布
Gemini 3.5 Flash-Lite 是 Google 于 2026 年 7 月 21 日正式发布的低延迟、多模态生成模型,正式 API 标识为 gemini-3.5-flash-lite,生命周期为 GA。Google 将其定位为 Gemini 3.5 系列中速度最快、成本最低的模型,面向高吞吐量的智能体子任务、文档解析、结构化数据提取、翻译和简单数据处理。Google 公布的 Artificial Analysis Index 测量结果为约 350 output tokens/s。
规格与能力
官方模型页确认其输入上下文上限为 1,048,576 tokens,最大输出为 65,536 tokens;支持文本、图像、视频、音频和 PDF 输入,输出文本。模型支持 Thinking、函数调用、代码执行、File Search、Google Search 与 Maps grounding、结构化输出、URL Context、上下文缓存以及 Batch、Flex 和 Priority 推理。默认 thinking level 为 minimal;复杂的自主智能体、工具调用或多步推理任务可提高到 medium 或 high。
官方评测
Google 发布博客给出的成绩包括 Terminal-Bench 2.1 54%、GDM-MRCR v2 72.2、GDPval-AA v2 1140、SWE-Bench Pro 54.2% 和 OSWorld-Verified 74.0%。这些结果显示其相较 Gemini 3.1 Flash-Lite 在智能体编码、长上下文和真实任务执行方面有所提升;具体测试档位和 harness 应以 Google 的评测说明为准。
访问与价格
模型自发布日起可通过 Google AI Studio 的 Gemini API 使用,并进入 Gemini 应用、Gemini Enterprise Agent Platform,亦开始在 Google Search 中逐步上线。Gemini Developer API 的标准付费价格为每百万 tokens 输入 0.30 美元、输出 2.50 美元(输出价格包含 thinking tokens),上下文缓存读取为 0.03 美元;Batch 和 Flex 档均为输入 0.15 美元、输出 1.25 美元。模型权重未公开,使用时应遵守 Google Gemini API 的服务条款。
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
