Gemini 3.5 Transcribe 是 Google 于 2026 年 8 月 26 日发布的语音转文字模型,面向预录音频提供 85+ 语言自动检测与语种切换、智能转写、自定义词表、说话人分离和词级时间戳。模型处于公开预览,支持最长 1 小时音频;启用说话人分离或词级时间戳时上限为 30 分钟,标准 API 综合估算约 0.005 美元/分钟。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
模型基本信息
开源和体验地址
官方介绍与博客
API接口信息
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | — | $12.00/ 1M |
| 音频 | - | $2.00/ 1M | — |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
发布机构
模型解读
发布背景:面向智能转写的 Gemini Audio 模型
Gemini 3.5 Transcribe 由 Google 于 2026 年 8 月 26 日发布,是基于 Gemini 音频理解能力构建的专用语音转文字模型。它面向会议录音、通话记录、听写与转写流水线,把原始音频转换为带标点和格式的文本;发布时通过 Google AI Studio 的 Gemini API 与 Gemini Enterprise Agent Platform 提供公开预览。
官方同时提供两个不同的模型 ID:gemini-3.5-transcribe 通过 Interactions API 处理预录音频,gemini-3.5-transcribe-live 通过 Live API 和 WebSocket 进行实时流式转写。二者使用不同端点、功能限制与价格;本条目记录的是非流式的 gemini-3.5-transcribe,不把 Live 版本当作同一价格档位或别名合并。
规格与输入限制
Google DeepMind 模型页给出的上下文为 96K tokens,最大输出为 32K tokens,输入支持文本与音频,输出为文本。Google 未公开参数规模、训练数据、知识截止时间或可下载权重,模型权重不开源。
- 单次音频上限:最长 1 小时
- 启用说话人分离或词级时间戳:最长 30 分钟
- 输入模态:文本、音频
- 输出模态:文本与词级标注
- 官方 API 模型 ID:
gemini-3.5-transcribe
模型不支持上下文缓存、Batch API、Flex inference、Priority inference、代码执行、File Search、图像生成或 Thinking。Gemini API 模型页也明确标注该模型不支持函数调用;Google 发布博客提到的函数调用发生在 Gemini macOS 应用的产品编排中,由其他 Gemini 模型处理复杂任务,不能等同于该转写 API 本身具备函数调用。
多语言与智能转写能力
模型可自动检测 85+ 种语言,支持同一段话或会话中的语种切换,无需预先固定语言。自定义词表最多可提供 1,000 个术语,用于增强专有名词、缩写与行业词汇的识别;Google 提示通常在不超过 100 个术语时效果最好。
默认的 verbatim 模式逐字保留填充词、重复、停顿和口误;smart 模式会移除“嗯”“啊”等不流畅内容,解析说话过程中的自我纠正,并自动处理标点、段落、列表、日期、货币和字母数字格式。非流式 API 还支持最多 8 位说话人的分离与词级起止时间戳,但 3 位及以上说话人的归属仍属实验功能,词级时间戳也可能降低转写准确率。
官方评测
Google 发布博客引用 Artificial Analysis 的测量结果:Gemini 3.5 Transcribe 在非流式场景的平均词错误率(WER)为 2.6%,实时流式版本为 4.0%。在 Google 公布的 FLEURS 多语言 top locales 口径中,非流式版本 WER 为 5.04%,流式版本为 5.50%;相较上一代 Chirp 3,官方称最终转写完成时间改善 70%。
WER 越低代表转写错误越少。上述 2.6% 来自 Artificial Analysis 测量,FLEURS 5.04% 则是 Google 发布页披露的多语言子集结果,两个数字对应不同数据集和测试条件,不能直接互相替代;本站当前没有与官方口径完全匹配的结构化 FLEURS 评测项,因此先在正文保留来源与口径,不把分数挂到无关 benchmark。
调用方式与适用边界
预录音频需先上传到 Gemini Files API,再通过 Interactions API 把文件 URI、MIME 类型和转写配置提交给 gemini-3.5-transcribe。需要实时字幕、语音代理或麦克风连续输入时,应改用 gemini-3.5-transcribe-live;Live 版本单次会话最长 10 分钟,不支持说话人分离和词级时间戳。
智能转写适合把自然口语整理为可读文本,但它会主动删除填充词、重排格式和消解自我纠正;法律取证、语言学研究或必须忠实保留每个口语现象的场景应使用默认逐字模式,并结合人工复核。说话人较多、强噪声、罕见专名或需要精确词级对齐时,也应关注官方列出的实验状态与准确率退化提示。
API 价格
Gemini Developer API 的标准付费价格按每 100 万 tokens 计费:音频输入 2.00 美元,文本输出 12.00 美元。Google 以每秒 25 个音频 tokens、每分钟 175 个文本 tokens 估算,分别约为输入 0.003 美元/分钟、输出 0.002 美元/分钟,综合约 0.005 美元/分钟;免费层免费,但提交内容可能被用于改进产品,付费层不用于该目的。实时 Live 版本的综合估算约 0.009 美元/分钟,属于独立 SKU,不采用本条目的价格。
官方来源
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
