200 多种音频标签怎么用?和提示词控制有什么区别?
两者是不同粒度。自然语言提示词控制的是整体风格、语调、语速和口音,作用于整段;音频标签直接嵌在文本里(如 [whispers]、[excitedly]、[short pause]),作用于具体的词或短语,可以做到「这半句话压低声音、那里停顿一下」。两者可以叠加使用——先用提示词定基调,再用标签做局部调节。
Gemini 3.1 Flash TTS (preview)
Google DeepMind 于 2026 年 4 月 16 日推出的文本转语音模型,以公开预览形式在 Google AI Studio 和 Vertex AI 上线,基于 Gemini 3.1 Flash 架构开发(参数规模未公开),定位高可控性、高表现力的 TTS。输入文本加提示词合计最多 8,000 字节,单次生成音频时长上限约 655 秒(约 11 分钟),输出为 24 kHz 16 位单声道 PCM(audio/l16),可封装成 WAV,所有音频均嵌入 SynthID 数字水印。核心能力有三:70 多种语言的高保真合成并支持多说话人对话;精细可控性——既能用自然语言提示词控制风格、语调、语速和口音,也能在文本中嵌入 200 多种音频标签(如 [whispers]、[excitedly]、[short pause])做词级表达调节;以及全局场景编排——支持场景设定、说话人级别的音频画像定义,并可把完整配置导出为 Gemini API 代码,保证语音角色跨项目一致。Artificial Analysis TTS 排行榜 Elo 1211 分,因语音质量与成本的平衡被列入「最具吸引力」区间。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
Gemini 3.1 Flash TTS 是由 Google DeepMind 于 2026 年 4 月 16 日推出的最新文本转语音模型,目前以公开预览(public preview)形式在 Google AI Studio 和 Vertex AI 平台上线。该模型是 Gemini 3.1 系列中专为语音合成优化的版本,定位为高可控性、高表现力的 TTS 解决方案,旨在为开发者、企业及个人用户提供构建下一代 AI 语音应用的能力。
Gemini 3.1 Flash TTS 基于 Gemini 3.1 Flash 架构开发,谷歌尚未公开该模型的参数规模与激活参数量。模型支持输入文本加提示词合计最多 8,000 字节,单次生成的音频时长上限约 655 秒(约 11 分钟)。音频输出规格为 24 kHz 16 位单声道 PCM(audio/l16),可封装为 WAV 格式播放。所有生成的音频均嵌入 SynthID 数字水印,以便于识别 AI 生成内容。
该模型为纯文本输入、音频输出的 TTS 模型,不涉及图像、视频等其他模态。其核心能力体现在三个方面:
在第三方评测机构 Artificial Analysis 的 TTS 排行榜上,Gemini 3.1 Flash TTS 获得了 1,211 分的 Elo 评分。该排行榜基于数千次盲测人类偏好数据,模型因在语音质量与成本之间的良好平衡,被列入排行榜的“最具吸引力象限”。
官方推荐的应用场景包括:播客与有声书制作、语音助手与客服系统、无障碍辅助工具、新闻播报、语言教学等。模型目前处于预览阶段,音频标签仅支持英文书写(但可与非英文语种的文本内容组合使用)。开发者通过 Gemini API 或 Google AI Studio 访问该模型,企业用户可通过 Vertex AI 使用,Workspace 用户则可在 Google Vids 中体验。
Gemini 3.1 Flash TTS 以 API 形式提供服务,用户可通过 Google AI Studio 免费在线体验,或通过 Gemini API 以付费方式集成使用。谷歌未公开该模型的权重或开源代码,也未明确声明相关开源许可条款。
两者是不同粒度。自然语言提示词控制的是整体风格、语调、语速和口音,作用于整段;音频标签直接嵌在文本里(如 [whispers]、[excitedly]、[short pause]),作用于具体的词或短语,可以做到「这半句话压低声音、那里停顿一下」。两者可以叠加使用——先用提示词定基调,再用标签做局部调节。
单次生成的音频时长上限约 655 秒(约 11 分钟);输入文本加提示词合计最多 8,000 字节。注意是字节不是字符——中文按 UTF-8 编码每字约 3 字节,实际能塞的中文字数会比英文少不少,长文本需要自行切段。
输出为 24 kHz、16 位、单声道 PCM(audio/l16),是裸 PCM 数据,需要封装为 WAV 才能直接播放。所有生成音频都嵌入 SynthID 数字水印,用于识别 AI 生成内容——这在合规场景是需要提前告知的点。
解决语音角色一致性问题。它支持场景设定和说话人级别的音频画像定义,并可以把完整配置导出为 Gemini API 代码。这样同一个角色在不同项目、不同批次生成时能保持一致的音色和表达习惯,而不用每次重新调参。对做有声书、播客、多集内容的场景很实用。
在 Artificial Analysis 的 TTS 排行榜上获得 1,211 分 Elo 评分。该榜单基于数千次盲测人类偏好数据,Gemini 3.1 Flash TTS 因在语音质量与成本之间的良好平衡被列入排行榜的「最具吸引力」区间——也就是说它不是绝对音质最好的,而是性价比区间里的推荐项。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
