谷歌推出Gemini 3.5 Transcribe,实现更智能的语音转文本
谷歌推出了Gemini 3.5 Transcribe,这是其Gemini AI模型家族的新成员,旨在重新定义语音转文本的转录能力。该公告于8月26日发布,重点介绍了在准确性、实时能力以及对超过85种语言的支持方面的改进。开发者和企业现在可以通过Gemini API和企业代理平台集成这一先进模型。
Gemini 3.5 Transcribe专为应对现实世界中的挑战而设计,如背景噪音、讲话者的不流利言语和复杂词汇。该模型的词错误率(Word Error Rate,WER)在实时流处理中仅为4.0%,在预录音频处理中为2.6%,显著优于其前代产品Chirp 3。此外,在延迟方面也有显著改进,最终转录时间据报道快了70%。根据Artificial Analysis的测量数据,这些指标使Gemini 3.5成为市场上最精准的转录工具之一。
谷歌为该模型推出了两种API:
- 实时流处理:专为交互式应用设计,该API提供双向流处理,延迟不到一秒,非常适合实时字幕生成和语音助手。
- 预录音频处理:该API支持会议记录、通话记录等的转录,具备讲话者归属和单词级时间戳功能。
该模型还支持高级功能,例如定制词汇以处理特定行业术语、无缝处理中断和修正,以及最多支持三位讲话者的多讲话者归属。此外,它可以与其他Gemini模型集成,通过语音命令执行图像生成和文件分析等任务。
用户和开发者采纳
Gemini 3.5 Transcribe已经在谷歌的主要产品中上线。Android用户可以通过Gboard的Rambler功能实现优质的语音转文本转录,而macOS用户可以使用Gemini应用程序进行语音输入和工作流程自动化。开发者可以通过Google AI Studio和Antigravity平台访问该模型。
自2026年5月更广泛的Gemini 3.5系列推出以来,谷歌一直在稳步扩展其AI驱动工具组合。早期版本如Gemini 3.5 Live Translate专注于实时语音到语音翻译,支持超过70种语言。而此次Transcribe的推出似乎是对这些努力的补充,强调转录的准确性和智能语音交互。
企业用例
企业已经在医疗、客户服务和媒体等行业中探索Gemini 3.5 Transcribe的应用场景。Vivo和Lingopal等公司称赞该模型的低延迟和多语言能力,这对于全球化运营至关重要。包括Agora、LiveKit和Vercel在内的开发者平台提供了集成选项,使企业能够创建语音驱动的界面,而无需复杂的后端基础设施。
未来计划
谷歌计划在未来几个月内将Gemini 3.5 Transcribe引入Chrome,允许用户直接在网页字段中进行语音输入。该模型自动清理语气词并根据上下文调整的能力,可能使其成为依赖语音驱动工作流程的专业人士的首选工具。目前,该模型已面向开发者和企业进行公开预览,预计将在今年晚些时候正式推出。
凭借其先进的功能和谷歌生态系统的无缝集成,Gemini 3.5 Transcribe将推动语音转文本技术的发展,使语音交互变得比以往更精准、更直观。