Copied


OpenAI 的 GPT-Live 通过全双工模型重新定义语音 AI

realtime news   Aug 06, 2026 20:54 1 Min Read


OpenAI 推出了 GPT-Live,这是一种突破性的语音 AI 架构,能够实现持续的实时交互。于 2026 年 7 月 8 日宣布,GPT-Live 用全双工语音模型取代了传统的回合制系统,使其可以同时倾听和说话。此项发展旨在让与 AI 的对话感觉如与人交流般自然。

以往的语音系统依赖回合检测器来决定 AI 何时响应,这常常导致尴尬的延迟或中断。GPT-Live 通过实时向模型同时输入和输出音频,消除了这一瓶颈。该架构不仅改善了对话流程,还可以无缝委派给诸如 GPT-5.5 这样的高级模型进行复杂推理或工具使用,而不会中断交互。

“流式推理是 GPT-Live 的核心,”OpenAI 的工程师解释道。系统持续处理音频帧,保持流畅的对话循环。诸如异步处理和基于 WebRTC 的传输等增强功能确保了亚秒级的响应性,即使在后台处理上下文管理或工具调用等任务时也不受影响。

对于用户来说,这意味着 ChatGPT Voice 的体验更加动态。功能包括实时确认(例如“嗯哼”)以及通过 ChatGPT 桌面应用程序执行命令或协调操作的能力。OpenAI 还强调,GPT-Live 的架构具有可扩展性,即使会话上下文增长或模型动态切换,也能实现长时间的无中断对话。

GPT-Live 的重要性

语音 AI 一直以来在延迟和笨拙的交互模型上存在困难,这些问题往往无法复制人类语言交流的无缝来回。GPT-Live 的全双工方法解决了这些问题,为语音应用中的自然语言处理设定了新基准。通过消除对回合检测器和级联系统的依赖,OpenAI 创建了一个语音模型,能够实时处理重叠语音、停顿,甚至是反馈响应。

随着 AI 在各行各业的应用日益增长,这项创新尤为重要。从客户服务到个人助手,与 AI 进行流畅自然的对话的能力可能会重新定义用户期望,并扩大语音应用的范围。

生产规模部署

OpenAI 已经开始在其 ChatGPT Voice 产品中部署 GPT-Live。据公司称,GPT-Live-1 是新系统的一个变体,现已向 ChatGPT Pro 用户提供,取代了先前的回合制高级语音模式。OpenAI 的工程师进行了严格的生产测试,包括静默影子部署,以确保系统能够在真实流量下运行而不会出现延迟激增或服务中断。

为了实现这一里程碑,解决了许多工程挑战。例如,OpenAI 开发了一种新的 WebRTC 简化往返协议(WARP),将连接设置时间从六次网络往返减少到仅一次,确保用户开始对话时的即时响应。此外,系统架构将媒体流与应用逻辑分离,从而在不影响实时性能的情况下实现定制化。

展望未来

GPT-Live 不仅支持 OpenAI 的 ChatGPT Voice,还为更广泛的实时交互平台奠定了基础,包括即将推出的 GPT-Live API。通过让开发者将此技术集成到其自身的应用中,OpenAI 正在将自己定位为语音 AI 解决方案的领导者。

随着语音交互成为数字体验中越来越重要的一部分,GPT-Live 提供类人响应能力的能力可能推动 AI 在各个领域的更广泛采用。该技术的潜在用例涵盖虚拟助手、客户支持、辅助工具等多个领域。目前,OpenAI 的最新突破代表了在实现真正实时 AI 对话方面迈出的重要一步。


Read More