Copied


谷歌推出Gemini 3.8 Flash TTS模型,用于动态语音创建

realtime news   Sep 23, 2026 17:39 1 Min Read


谷歌推出了两个先进的文本转语音(TTS)模型——Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS,这标志着人工智能驱动的语音技术迈出了一大步。该公告于2026年9月23日发布,基于Gemini Audio系列,赋能创作者、开发者和企业提供细致入微、富有表现力且可扩展的音频体验。

旗舰产品Gemini 3.8 Flash TTS模型针对游戏、有声读物和播客等高保真应用,提供对语音表演、口音和语速的精细控制。用户可以使用自然语言提示从头设计全新的语音,从而实现媒体和叙事的动态角色创建。同时,Flash-Lite变体则针对高效成本的高产量使用场景进行了优化,如配音和对话代理,仍然保持对语调和情感的细致控制。

主要功能和使用场景

Gemini 3.8 Flash TTS定位为创意专业人士的“语音工作室”。它支持定制语音设计,提供包含2000多个可生产使用的语音库,涵盖100多种语言和方言,包括墨西哥西班牙语和苏格兰英语等地区变体。该模型还利用语音复制技术,从30秒的样本中实现音频克隆,同时包含SynthID水印和同意验证等保障措施,以确保道德使用。

对于企业和开发者来说,Flash-Lite TTS擅长于为本地化媒体和AI驱动的语音代理扩展音频解决方案。两个模型都支持长篇内容生成、双人对话以及逼真的听者反馈,使其适用于播客、虚拟助手和多轮对话。

性能基准

这些模型已经在行业基准测试中占据了领先地位。Gemini 3.8 Flash TTS在Hume AI的语音设计基准测试中排名第一,得分为71.4,在口音建模和富有表现力的语音合成方面表现出色。在Voice Arena的盲选偏好测试中,Flash和Flash-Lite模型在包括日语、巴西葡萄牙语和印地语在内的主要全球语言中均优于竞争对手。这体现了谷歌在TTS领域的持续领先地位,此前在本月早些时候推出了Gemini 3.8 Live和Live Extended Thinking。

更广背景

谷歌的Gemini Audio模型正迅速扩展其在各种使用场景中的影响力,从Workspace集成(Gmail和Docs)到通过Gemini API的实时应用。公司对多模态能力的关注,例如结合文本、音频和图像输入以生成响应输出,与其引领AI驱动内容创作市场的雄心相一致。

Gemini 3.8 Flash TTS的推出还突显了谷歌对安全性和透明度的重视。诸如SynthID水印等功能确保AI生成的音频可以被识别,从而防止滥用,解决了对深度伪造技术日益增长的担忧。

可用性

开发者现在可以通过Gemini API和Google AI Studio访问这两种模型。企业可以期待通过Gemini Enterprise平台的API集成即将推出。Gemini 3.8 Flash TTS还集成到了面向消费者的产品中,例如Gemini Notebook,而Flash-Lite TTS则可在Google Vids中使用。

凭借这些进步,谷歌继续推动语音AI的边界,为创作者和企业提供工具,以大规模生产高质量、多语言的音频。随着对本地化和沉浸式音频体验的需求增长,这些模型有望在塑造数字内容的未来中发挥关键作用。


Read More