OpenAI 發布了新的語音模型 GPT-Live。若只能挑出發布公告中的一句核心文案,就是這句:「同時聆聽與說話的全雙工架構。」過去的語音 AI 再怎麼變快,終究還是像對講機:一方必須說完,另一方才能開口。GPT-Live 將這個結構本身改造成電話。以下從架構的角度,整理它改變了什麼,以及為什麼重要。
先快速看看新的語音對話是如何開始的。
▶ GPT-Live 語音對話開始畫面(OpenAI 官方)
從串接式到輪次制,再到全雙工
語音 AI 的架構經歷了三個階段。
早期的 ChatGPT 語音對話採用串接式架構。語音辨識模型將語音轉成文字,語言模型產生回答,文字轉語音模型再把文字轉回聲音,形成三個模型接力。能以語音和前沿模型對話本身就是首次突破,但每次跨越模型之間的邊界都會流失資訊,回應也變得緩慢。語音中的細微語氣在轉成文字的瞬間消失,也是這種架構的根本限制。
以 Advanced Voice Mode 為代表的輪次制模型,將這些功能整合成一個模型。直接處理並生成語音後,延遲降低,表達也更自然了。然而,對話仍然以輪次為單位處理。系統會等使用者說完才回應,而問題在於它透過沉默判斷「說完了」。使用者只是為了整理思緒而短暫停頓,就可能被打斷;周遭噪音也可能被誤認為對話結束,造成尷尬時刻。
GPT-Live 捨棄了「輪次」這個概念本身。它在生成回應的同時持續處理使用者輸入,每秒多次判斷要說話、繼續聆聽、暫停片刻、插話,還是使用工具。對方說話時可以用「嗯」「好的」回應的回應聲,也就是 backchannel,以及即時口譯,都是這種架構帶來的能力。這個差異,實際用聲音確認會比讀文字更快理解。我也會一併放上 OpenAI 公開的兩支示範影片。
▶ 自然對話示範(OpenAI 官方)
▶ 同時聆聽與說話,即時口譯示範(OpenAI 官方)
第二種設計:分離對話與思考
除了全雙工之外,角色分工也值得關注。GPT-Live只負責不中斷的互動;需要搜尋或深度推理的問題,則交給背景中的前沿模型。依發布時程,該角色由GPT-5.5擔任;未來推出新的前沿模型後,便會替換它。
這種架構聰明之處有兩點。首先是使用者體驗:即使繁重工作在背景執行,GPT-Live仍能持續對話。不必沉默等待搜尋結果,對話流程也能維持。其次是升級路徑:對話與思考分離後,只要替換後端模型,就能保留語音體驗並提升智慧。這與代理系統中分離協調器與工作者的設計理念相同。
效能數據也支持這種架構。根據OpenAI公告,GPT-Live-1在評估專家級科學推理的GPQA、評估代理式網路搜尋的BrowseComp,以及評估電信支援環境多輪語音工作的τ³-Voice Telecom中,結果都優於進階語音模式。在5至10分鐘的實際使用比較評測中,它在輪流交談、插話和對話流程等項目也獲得更高偏好。背景委派的實際運作方式,可在下方示範中查看。
▶ 更智慧的回答:背景推理示範(OpenAI官方)
哪些功能可用,哪些仍未開放
目前的提供方式如下。GPT-Live-1與GPT-Live-1 mini兩個版本正陸續向全球使用者推出,支援iOS、Android與ChatGPT.com。Go、Plus、Pro方案預設使用GPT-Live-1,Free則預設使用mini。也可以選擇推理程度:快速回應選Instant;需要深入回答時選Medium或High,背景便會執行GPT-5.5 Thinking。
對話中談到天氣、股票或體育等主題時,系統會同步顯示視覺卡片;搜尋、記憶、圖片與檔案上傳也都能直接在語音對話中使用。據稱,它在背景噪音中專注於使用者聲音的能力也有所提升。這兩項功能都有官方示範。
▶ 對話中的視覺卡片示範(OpenAI官方)
▶ 背景噪音中的對話示範(OpenAI 官方)
安全防護也針對語音重新設計。語音對話是即時進行,因此配置了即使在回應輸出期間也能運作的保護機制;風險程度較高時,可以結束對話。涉及自我傷害的對話會提供危機諮詢專線;青少年帳號可由家長設定是否能使用語音對話,高風險情況下也可能通知家長。此外,為避免模仿真實人物的聲音,明確限定只提供預先定義的9種聲音。
仍有一些功能尚未支援。開發者 API「即將支援」,目前只接受上市通知登記。語音對話在剛推出時也無法搭配影片或畫面分享;若需要這些功能,必須使用現有的語音模式。語言最佳化目前以主要語言為主,也已說明部分語言的語調可能不自然。
總結
- GPT-Live 是能同時聆聽與說話的全雙工語音模型。以沉默判斷對話輪次的傳統方式所帶來的不自然感,已在架構層級消除。
- GPT-Live 負責對話,背景中的 GPT-5.5 負責搜尋與推理,採用分離式設計。這讓系統能在維持對話體驗的同時,持續升級背後的智慧。
- ChatGPT 將從現在起陸續套用,但 API 尚未支援。正在準備語音介面的開發者,不妨以這種架構為前提,重新檢視設計,而不是採用階梯式管線。
據稱每週有1億5,000萬人透過語音與 ChatGPT 對話。在語音從輔助輸入轉變為基本介面的趨勢下,對話輪次的消失可能會成為比想像中更重大的轉捩點。

