跳到主内容
中欧娱乐平台

谷歌推出 Gemini 3.8 Flash / Flash-Lite 文本转语音模型,每一行台词都能精确控制

2026-09-23 · 彭文静 · 更新于 2026-09-27

谷歌于今日(9月23日)宣布,其Gemini产品线新增两款文本转语音模型,将语音生成从静态预设模式转变为动态创意工作流程,使创作者、开发人员及企业能够构建更丰富、更具感染力的音频体验,同时改进Gemini Notebook与Google Vids等产品的用户使用感受。

这两款新模型分别是 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,各自侧重不同领域:

  • Gemini 3.8 Flash TTS:面向深度创意与角色塑造,可通过自然语言提示从零开始创建全新语音,适用于游戏、沉浸式有声读物、播客及互动媒体等场景,为角色注入生命力,并支持对表演指令、语速、方言切换等参数进行精细化调整。
  • Gemini 3.8 Flash-Lite TTS:针对大容量、高性价比的规模化应用场景,专为大范围配音、音频内容制作及富有表现力的语音代理进行了优化,可精细调控音调、节奏与表现力细节。

据IT之家了解,用户能够从原先的30种基础语音扩展至无限语音库。该模型具备以下具体功能:

  • 生成式语音设计:借助自然语言提示,可在100多种语言及方言中自定义角色、口音与语音特征,从零构建定制语音。
  • 扩展语音库:可访问超过2000种预设语音,覆盖多种语言,包括墨西哥西班牙语、魁北克法语、苏格兰英语等地区性变体。
  • 语音复制:仅需30秒音频样本即可重现一致的声音特征,并内置同意验证、SynthID水印及C2PA凭证,以保护开发者与声音人才。
  • 保存与扩展:可保存并管理自定义语音,确保在持续项目中保持稳定性能,最大程度减少声音漂移。
  • 语音混音(即将推出):用户可从语音库中选择一种语音,对音色、音高、节奏及口音进行微调,或使用提示调整特征。

选定声音后,两款TTS模型均允许用户对每句台词的演绎方式进行精准操控:

  • 逐行指导表演: 用户可自行编写舞台指导说明,或让Gemini通过自然脚本提示引导输出,无论是平静的客服对话还是低沉的悬疑场景均可实现。
  • 长篇生成: 在长达数小时的连续音频中保持高语音质量、自然节奏与角色音色,声音漂移极小,特别适合播客与有声读物。
  • 原生双声音场景编排: 可从单一脚本中无缝指导多轮对话,同时保持两种声音清晰区分,实现自然的对话交替。
  • 脚本化声音爆发与背景反馈: 可添加非语言提示(如<laughs>、<sigh>、<gasp>)及主动倾听插入语(如mhm或yeah),实现精确的喜剧节奏与反应时机,增添逼真的对话质感。

在性能方面,Gemini 3.8 Flash TTS 在Hume AI的语音设计基准测试中(得分71.4分)排名总体第一,在口音建模方面(得分60.8分)同样处于领先地位。

Gemini 3.8 Flash TTS与Gemini 3.8 Flash-Lite TTS 能在不牺牲可靠性的前提下实现真正富有表现力的性能,在Hume AI的整体质量指数中分别占据第一与第二的位置。与Gemini 3.1 Flash TTS相比,在长格式内容及双扬声器剧本控制等广泛用例中均有显著改进。

在Voice Arena的盲法人类偏好评估中,Gemini 3.8 Flash与Flash-Lite TTS在全球主要语言(日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语及印地语)的竞争对手中占据领先地位。凭借对100多种语言的支持,这些模型能够帮助创作者、开发人员及企业在全球范围内打造高质量的多语言语音体验。

谷歌在语音创建与复制功能中内置了严格的保护措施,以保护声音人才、尊重身份认同并确保内容透明度。对于语音复制,系统采用同意验证机制:用户必须提供来自语音所有者的口头同意记录,并与参考说话者匹配后才能创建语音。

Gemini Audio模型生成的每个音频片段均带有SynthID水印,该水印难以察觉,并被直接嵌入音频输出中,确保AI生成的语音可被检测,从而帮助防止错误信息。

即日起,开发者即可在Google AI Studio中体验这些新的语音生成功能。用户可通过提示从零开始创建全新的声音身份,或复制自身声音,然后将它们直接导入双扬声器剧本编辑器,逐行指导输出。

两款模型现已向开发者推送,可在Gemini API与Google AI Studio中使用;面向企业用户,很快将通过Gemini Enterprise中的API推出;面向所有用户,Gemini 3.8 Flash TTS可在Gemini Notebook中使用,Gemini 3.8 Flash-Lite TTS可在Google Vids中使用。

需要注意的是,通过AI Studio进行的语音复制在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士及印度不可用。

更多文章