DataLearner 标志
GE

Gemini 3.1 Flash-Lite

承诺至少可用至 2027-05-07多模态大模型工具使用Gemini 3.1

Gemini 3.1 Flash-Lite

发布时间: 2026-05-07更新于: 2026-09-18知识截止: 2025-01记录日期: 2027-05-07浏览量: 139
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1M
多语言支持
支持
推理能力
3/5

Google DeepMind 于 2026 年 5 月 7 日 GA 的 Gemini 3.1 Flash-Lite,面向高吞吐、低延迟和成本敏感场景,支持 1M 输入、约 64K 输出以及最高 High 档 thinking。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Gemini 3.1 Flash-Lite

模型基本信息

推理过程
支持
思考模式
常规模式 (默认)思考水平 · 低 (Low)思考水平 · 中 (Medium)思考水平 · 高 (High)
上下文长度
1M tokens
最大输出长度
64K tokens
模型类型
多模态大模型
输入/输出模态
文本、图像、音频、视频 → 文本
发布时间
2026-05-07
模型文件大小
暂无数据
MoE架构
总参数 / 激活参数
暂无数据 / 不适用
知识截止
2025-01
Gemini 3.1 Flash-Lite

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
Gemini 3.1 Flash-Lite

官方介绍与博客

Gemini 3.1 Flash-Lite

API接口信息

接口速度
5/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.250/ 1M tokens$1.50/ 1M tokens
批量模式
类型适用条件输入输出
文本-$0.125/ 1M tokens$0.750/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-$0.025/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Gemini 3.1 Flash-Lite

评测结果

Gemini 3.1 Flash-Lite 当前已收录的代表性评测结果包括 IF Bench(17 / 282,得分 77.20)、PinchBench v2(10 / 45,得分 80.50)、MMMU-Pro(83 / 229,得分 75.50)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

综合评估

共 4 项评测
评测名称 / 模式
得分
排名/总数
61.68
63 / 117
HLE
思考模式
17.20
321 / 565
HLE
unknown
8.64
412 / 565
CritPt
思考模式
1.10
148 / 201

科学与综合推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
74.24
289 / 463
GPQA Diamond
思考模式
82.20
206 / 463
81.82
208 / 463

Agent能力评测

共 3 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
思考模式工具
31.30
210 / 264
Terminal Bench Hard
思考模式工具
24.20
134 / 244
τ³-Banking
思考模式工具
9.70
134 / 167

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
思考模式
77.20
17 / 282

AI Agent - 工具使用

共 3 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
工具
57.10
39 / 44
Terminal-Bench 2.1
思考模式工具
31.10
158 / 196
Terminal-Bench 4.0
思考模式工具
0.50
86 / 91

多模态理解

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
思考模式
75.50
83 / 229
GDP.pdf
思考模式
7.80
89 / 119

编程与软件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
思考模式
43.40
96 / 131

生产力知识

共 2 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
思考模式工具
31.15
41 / 44
AA-AnalystAgent
思考模式工具联网
8.75
26 / 29

OpenClaw智能体能力综合测评

共 1 项评测
评测名称 / 模式
得分
排名/总数
80.50
10 / 45

和其他模型对比

Gemini 3.1 Flash-Lite

发布机构

Gemini 3.1 Flash-Lite

模型解读

Gemini 3.1 Flash-Lite 是 Google DeepMind 在 Gemini 3.1 系列中面向高吞吐、低延迟和成本敏感场景的 Flash-Lite 模型。Google Cloud 文档显示,正式模型 ID 为 gemini-3.1-flash-lite,发布阶段为 GA,发布日期为 2026 年 5 月 7 日;旧的 gemini-3.1-flash-lite-preview 将停用,应用应迁移到正式版。


规格与能力

官方文档将 Gemini 3.1 Flash-Lite 定位为最具成本效率的 Gemini 模型,面向高容量 LLM 流量。模型支持文本、图像、音频和视频输入,输出为文本;最大输入长度为 1,048,576 tokens,默认最大输出长度为 65,535 tokens。文档还列出可控 thinking levels,包括 minimal、low、medium 和 high,用于在质量与速度之间调节推理开销。


访问方式

模型可通过 Google Cloud Agent Platform / Vertex AI 使用,也可在 Google AI Studio 生态中作为 Gemini API 模型迁移目标。模型参数规模、训练数据细节和权重未公开,因此本条目按闭源模型收录,参数字段留空。


评测收录

Scale Labs 的 MCP-Atlas leaderboard 收录了 gemini-3.1-flash-lite (high),其 All 1000 pass rate 为 57.1%,本次按 DataLearner 的 thinking_high_with_tool mode 写入 MCP-Atlas 成绩。

Gemini 3.1 Flash-Lite

常见问题

还在用 gemini-3.1-flash-lite-preview 的应用要做什么?

要迁移到正式版。Google Cloud 文档说明正式模型 ID 为 gemini-3.1-flash-lite,发布阶段 GA、发布日期 2026 年 5 月 7 日,旧的 gemini-3.1-flash-lite-preview 将停用。这是一个明确的停用通知,不迁移会在停用后中断服务。

Gemini 3.1 Flash-Lite 适合什么场景?

官方定位是最具成本效率的 Gemini 模型,面向高容量 LLM 流量——也就是量大、单次任务不复杂的场景。库内实测印证了这个边界:LiveBench 61.68 在 115 个模型中排第 61,MCP-Atlas 57.10 在 38 个中排第 34,都在中下游。它的价值在单位成本而不是能力上限。

它的 thinking 档位怎么选?

文档列出 minimal、low、medium 和 high 四档,用于在质量与速度之间调节推理开销。既然选它是为了成本效率,默认应该走低档;只在确实需要多步推理的子任务上临时提档,否则会抵消掉成本优势。

支持哪些输入?上下文多长?

支持文本、图像、音频和视频输入,输出为文本。最大输入长度 1,048,576 tokens,默认最大输出长度 65,535 tokens,知识截止 2025 年 1 月。模型可通过 Google Cloud Agent Platform / Vertex AI 使用,也可在 Google AI Studio 生态中作为 Gemini API 模型迁移目标。

它的参数量是多少?

未公开。模型参数规模、训练数据细节和权重 Google 均未披露,本条目按闭源模型收录,参数字段留空。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码