谷歌推出Gemini 3.8实时AI对话模型
谷歌发布了其最新的AI技术突破,推出了Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款实时对话模型,这些模型旨在增强语音代理功能。于2026年9月15日宣布,这些模型通过改进对话流畅性、任务复杂性处理和响应速度,重新定义了用户与AI的交互方式。
Gemini 3.8 Live模型针对低延迟交互进行了优化,非常适合快节奏的语音代理和实时对话。而Gemini 3.8 Live Extended Thinking专为需要多步骤推理的高复杂性任务设计,例如技术诊断或多API旅行预订。这两款模型均基于谷歌的Gemini 3平台构建,重点在于多模态推理、成本效益和可扩展性。
性能基准和能力
Gemini 3.8 Live Extended Thinking在多个行业基准测试中获得了最高排名。它在Artificial Analysis的语音到语音质量指数(82.6)中获得了最高分,并在代理任务完成基准测试中表现出色,包括在τ-Voice上取得68.6%的表现,在Big Bench Audio推理任务中获得97.7%的分数。这些指标表明,AI在处理复杂工作流程的能力以及保持对话流畅性方面取得了显著进步。
与此同时,Gemini 3.8 Live通过在Speech Agent Arena基准测试中排名第二,展示了其高效性,为开发人员构建可扩展的语音驱动应用程序提供了性能与成本的平衡。这两款模型支持97种语言,并无缝集成视觉上下文,使AI能够近乎实时地处理和响应视觉输入。
开发者和企业的使用场景
对于开发者来说,Gemini 3.8模型可通过Gemini API和Google AI Studio获取。这些工具支持创建具有实时推理、后台任务执行和对话多任务处理能力的语音驱动应用程序。Agora、LangChain和LiveKit等集成合作伙伴已经在利用这些功能,简化高性能语音代理的部署。
企业可以通过Gemini Enterprise平台预览这些模型,更广泛的访问权限将扩展至Google Workspace和Search Live。使用场景包括技术支持、员工入职培训,甚至是复杂任务,例如STEM辅导和业务规划,其中对话AI可以叙述进展并提供实时更新。
聚焦安全性和透明性
Gemini 3.8模型生成的所有音频都包含SynthID水印,这是一种不可察觉的标记,确保AI生成的内容可被识别。这与谷歌在负责任AI部署和减轻诸如错误信息等风险方面的更广泛承诺保持一致。
发布和可用性
这两款模型从今天开始推出。开发者可以通过Gemini API访问它们,而企业则可以通过谷歌的Vertex AI Studio探索私人预览。与Google Workspace工具(如Docs Live和Gmail Live)的集成将在未来几个月内推出,将这些功能带给更广泛的用户群体。
通过Gemini 3.8 Live和Extended Thinking,谷歌继续推动实时AI对话的边界,为开发者和企业提供不仅智能而且实用和具有成本效益的工具。