Copied


OpenAI 推出 GPT-Live-1 API 自然语音人工智能

realtime news   Sep 10, 2026 19:14 1 Min Read


OpenAI 已于 2026 年 9 月 10 日正式在其 API 中推出了 GPT-Live-1,这是一款自然语音人工智能模型。GPT-Live-1 专为开发语音功能应用的开发者设计,支持实时的全双工对话、可定制语音选项以及先进的电话功能。这标志着从传统的回合制语音人工智能系统向更高级系统的重大飞跃。

GPT-Live-1 的特色在于其能够同时进行听和说的能力,通过用单一的集成模型取代传统的三阶段处理管道(语音转文本、语言建模和文本转语音),简化了语音代理的架构。这一改变减少了延迟并改善了对话流程,尤其是在涉及中断或交互频繁的场景中。OpenAI 声称,该模型在实际测试中已比之前的版本(如 GPT-Realtime-2.1)表现出 30% 的性能提升。

推动采用的关键功能

此次 API 发布引入了专为企业和开发者需求设计的多项增强功能:

  • 中断处理:GPT-Live-1 能够无缝处理中断,避免传统链式架构中常见的延迟和错误。
  • 可定制对话风格:开发者可以通过系统提示调整语气、语速和风格,为特定用例量身定制体验。
  • 电话集成:全双工功能允许在基于电话的应用(如客户服务和预订系统)中部署。
  • 背景噪音抗干扰性:改进的环境噪声处理能力确保了在动态环境中的一致性能。

企业已经看到了显著的收益。例如,Yelp 在将 GPT-Live-1 集成到其预订和点餐系统后,报告了更高的电话处理率以及更自然的来电者互动体验。早期合作伙伴 Speak 指出,与旧的回合制模型相比,其语言辅导课程中的中断减少了 80%。

扩展语音人工智能的应用场景

最初于 2026 年 7 月作为 GPT-Live 系列的一部分推出,GPT-Live-1 基于 OpenAI 对类人交互人工智能的愿景构建。通过将复杂任务(例如推理或知识检索)分配给后台模型(如 GPT-6 Astra),GPT-Live-1 在保持对话流畅的同时,能够在后台处理密集的计算任务。

OpenAI 还在不断扩展其语音选项,增加了多种口音、方言和语言,以更好地服务全球用户群。这与其更广泛的目标一致,即帮助开发者创建在不同市场中感觉自然且符合上下文的语音代理。

定价和可用性

GPT-Live-1 API 的语音层现在以每分钟 $0.05 的价格提供,具体费用还取决于选用的后台模型。开发者可以将 GPT-Live-1 与 OpenAI 的 Codex 或第三方工具结合使用,构建可扩展、针对任务的人工智能系统。

随着 OpenAI 继续优化其语音技术,GPT-Live-1 有望成为从客户服务到教育等行业的基础工具。该模型将自然的对话节奏与高级推理能力相结合,使其成为快速增长的语音人工智能市场中的一项竞争产品。

在 OpenAI 官方网站了解有关 GPT-Live-1 的更多信息。


Read More