OpenAI 发布了新的语音模型 GPT-Live。如果只能从发布公告中挑出一句核心表述,那就是:“同时听和说的全双工架构。”到目前为止,语音 AI 无论变得多快,仍然像对讲机:一方必须说完,另一方才能开口。GPT-Live 将这一结构本身变成了电话。下面从架构角度总结它改变了什么,以及为什么重要。
先简单看看新的语音对话是如何开始的。
▶ GPT-Live 语音对话开始界面(OpenAI 官方)
从级联式到基于轮次,再到全双工
语音 AI 的架构经历了三个阶段。
早期的 ChatGPT 语音对话采用级联式架构。语音识别模型将语音转换为文本,语言模型生成回答,文本转语音模型再将其转换回声音,形成三个模型之间的接力。能够用语音与前沿模型对话本身就是一次突破,但每次跨越模型之间的边界都会丢失信息,响应也会变慢。语音中的细微语气在转换为文本的瞬间消失,也是这种架构的结构性局限。
以 Advanced Voice Mode 为代表的基于轮次的模型,将这些功能合并到了一个模型中。直接处理并生成语音后,延迟降低了,表达也更自然了。但对话仍然按轮次处理。系统会等用户说完再回应,而问题在于它通过静默来判断“说完了”。用户只是为了整理思路而短暂停顿,就可能触发打断;周围噪声也可能被误判为对话结束,从而产生尴尬时刻。
GPT-Live 摒弃了“轮次”这一概念本身。它在生成响应的同时持续处理用户输入,每秒多次判断是该说话、继续听、暂时停顿、打断,还是使用工具。这种架构让 backchannel 成为可能:对方说话时用“嗯”“好的”做出回应;实时口译也因此成为可能。这个差异,听声音确认比读文字更快。我也会一并放上 OpenAI 公布的两段演示视频。
▶ 自然对话演示(OpenAI 官方)
▶ 同时听和说:实时口译演示(OpenAI 官方)
第二种设计:分离对话与思考
除了全双工,角色分工也值得关注。GPT-Live只负责不中断的交互;需要搜索或深度推理的问题,则交给后台的前沿模型。按发布时的安排,该角色由GPT-5.5担任;未来推出新的前沿模型后会进行替换。
这种架构聪明之处有两点。首先是用户体验:即使繁重任务在后台运行,GPT-Live仍能继续对话。不必沉默等待搜索结果,对话流程也能保持。其次是升级路径:由于对话和思考彼此分离,只需替换后端模型,就能保留语音体验并提升智能。这与代理系统中分离协调器和工作者的设计思路相同。
性能数据也支持这一架构。根据OpenAI公告,GPT-Live-1在评估专家级科学推理的GPQA、评估代理式网络搜索的BrowseComp,以及评估电信支持环境多轮语音任务的τ³-Voice Telecom中,结果均优于高级语音模式。在5至10分钟的实际使用对比评测中,它在轮流对话、插话和对话流程等项目上也获得了更高偏好。后台委托的实际运行方式,可以在下方演示中看到。
▶ 更智能的回答:后台推理演示(OpenAI官方)
哪些功能可以使用,哪些还不行
目前的提供方式如下。GPT-Live-1和GPT-Live-1 mini两个版本正在向全球用户陆续推出,支持iOS、Android和ChatGPT.com。Go、Plus、Pro套餐默认使用GPT-Live-1,Free默认使用mini。还可以选择推理级别:快速响应选择Instant;需要深入回答时选择Medium或High,后台便会运行GPT-5.5 Thinking。
对话中谈到天气、股票或体育等主题时,系统会同步显示视觉卡片;搜索、记忆、图片和文件上传也都能直接在语音对话中使用。据称,它在背景噪声中专注于用户声音的能力也有所提升。这两项功能都有官方演示。
▶ 对话中的视觉卡片演示(OpenAI官方)
▶ 背景噪声中的对话演示(OpenAI 官方)
安全措施也针对语音进行了重新设计。语音对话是实时的,因此设置了即使在输出回复期间也能运行的保护机制;风险较高时可以结束对话。涉及自残的对话会提供危机咨询热线;青少年账号可由家长设置是否允许使用语音对话,高风险情况下也可能向家长发送通知。此外,为防止模仿真实人物的声音,明确只提供预先定义的9种声音。
还有一些功能尚不可用。面向开发者的 API “即将支持”,目前只能登记发布提醒。语音对话与视频、屏幕共享结合使用的功能在刚发布时也不支持;如果需要这些功能,就必须使用现有的语音模式。语言优化也主要面向常用语言,因此部分语言的语调可能不自然。
总结
- GPT-Live 是能同时听和说的全双工语音模型。过去依靠沉默判断轮次所产生的不自然感,已从架构层面消失。
- GPT-Live 负责对话,后台的 GPT-5.5 负责搜索和推理,这是分离式设计。在保持对话体验的同时,可以持续升级后端智能。
- ChatGPT 将从现在开始逐步应用,但 API 还没有。正在准备语音界面的开发者,不妨以这种架构为前提重新审视设计,而不是采用阶梯式流水线。
据说每周有1.5亿人通过语音与 ChatGPT 对话。在语音从辅助输入变成默认界面的趋势下,取消轮次可能会成为比想象中更大的转折点。

