还在用 gemini-3.1-flash-lite-preview 的应用要做什么?
要迁移到正式版。Google Cloud 文档说明正式模型 ID 为 gemini-3.1-flash-lite,发布阶段 GA、发布日期 2026 年 5 月 7 日,旧的 gemini-3.1-flash-lite-preview 将停用。这是一个明确的停用通知,不迁移会在停用后中断服务。
Gemini 3.1 Flash-Lite
Google DeepMind 于 2026 年 5 月 7 日 GA 的 Gemini 3.1 Flash-Lite,面向高吞吐、低延迟和成本敏感场景,支持 1M 输入、约 64K 输出以及最高 High 档 thinking。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.250/ 1M tokens | $1.50/ 1M tokens |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.125/ 1M tokens | $0.750/ 1M tokens |
| 类型 | 有效期 | 写入 | 读取 |
|---|---|---|---|
| 文本 | - | — | $0.025/ 1M tokens |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
Gemini 3.1 Flash-Lite 当前已收录的代表性评测结果包括 IF Bench(17 / 282,得分 77.20)、PinchBench v2(10 / 45,得分 80.50)、MMMU-Pro(83 / 229,得分 75.50)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
Gemini 3.1 Flash-Lite 是 Google DeepMind 在 Gemini 3.1 系列中面向高吞吐、低延迟和成本敏感场景的 Flash-Lite 模型。Google Cloud 文档显示,正式模型 ID 为 gemini-3.1-flash-lite,发布阶段为 GA,发布日期为 2026 年 5 月 7 日;旧的 gemini-3.1-flash-lite-preview 将停用,应用应迁移到正式版。
官方文档将 Gemini 3.1 Flash-Lite 定位为最具成本效率的 Gemini 模型,面向高容量 LLM 流量。模型支持文本、图像、音频和视频输入,输出为文本;最大输入长度为 1,048,576 tokens,默认最大输出长度为 65,535 tokens。文档还列出可控 thinking levels,包括 minimal、low、medium 和 high,用于在质量与速度之间调节推理开销。
模型可通过 Google Cloud Agent Platform / Vertex AI 使用,也可在 Google AI Studio 生态中作为 Gemini API 模型迁移目标。模型参数规模、训练数据细节和权重未公开,因此本条目按闭源模型收录,参数字段留空。
Scale Labs 的 MCP-Atlas leaderboard 收录了 gemini-3.1-flash-lite (high),其 All 1000 pass rate 为 57.1%,本次按 DataLearner 的 thinking_high_with_tool mode 写入 MCP-Atlas 成绩。
要迁移到正式版。Google Cloud 文档说明正式模型 ID 为 gemini-3.1-flash-lite,发布阶段 GA、发布日期 2026 年 5 月 7 日,旧的 gemini-3.1-flash-lite-preview 将停用。这是一个明确的停用通知,不迁移会在停用后中断服务。
官方定位是最具成本效率的 Gemini 模型,面向高容量 LLM 流量——也就是量大、单次任务不复杂的场景。库内实测印证了这个边界:LiveBench 61.68 在 115 个模型中排第 61,MCP-Atlas 57.10 在 38 个中排第 34,都在中下游。它的价值在单位成本而不是能力上限。
文档列出 minimal、low、medium 和 high 四档,用于在质量与速度之间调节推理开销。既然选它是为了成本效率,默认应该走低档;只在确实需要多步推理的子任务上临时提档,否则会抵消掉成本优势。
支持文本、图像、音频和视频输入,输出为文本。最大输入长度 1,048,576 tokens,默认最大输出长度 65,535 tokens,知识截止 2025 年 1 月。模型可通过 Google Cloud Agent Platform / Vertex AI 使用,也可在 Google AI Studio 生态中作为 Gemini API 模型迁移目标。
未公开。模型参数规模、训练数据细节和权重 Google 均未披露,本条目按闭源模型收录,参数字段留空。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
