OpenAI 發佈 GPT-Live 語音交互系統 解決 AI 對話延遲問題

OpenAI 正式推出經過全面重構的語音交互系統 GPT-Live,此係統旨在解決 AI 語音助手長期存在的對話停頓及回合切換生硬等核心痛點。該公司工程師 Justin Uberti 與 Zahan Malkani 在技術博文中詳細披露了這一歷時六個月的底層架構改造。OpenAI 傳統的 AI 語音交互採用回合制模式,依賴「回合檢測器」來判斷用户何時結束發言。

然而,這種機制存在明顯缺陷:檢測過早會打斷用户説話,檢測過晚則造成不自然的沉默等待。

GPT-Live 徹底摒棄了這一方案,轉而採用全雙工架構,能夠在接收用户語音的同時生成回覆。系統每秒多次自主決策,應該傾聽、發言、暫停還是允許用户打斷。為實現流暢對話,OpenAI 將系統拆分為兩個獨立層級。音頻流通過專用低延遲快速通道在用户設備與 GPT-Live 模型之間傳輸,而網絡搜索、代碼執行、調用 GPT-5.5 等前沿模型進行深度推理等重負載任務則在異步邊界之外的後台路徑完成。

這意味著即使複雜查詢需要額外數秒處理,語音層仍能保持自然對話,不會出現掉幀、卡頓或連接凍結。

OpenAI 透過 GPT-Live 改善語音交互體驗

在傳輸層優化方面,OpenAI 將原有的 Python asyncio 代碼替換為 Go 語言,為超過 1.5 億周活躍用户實現更穩定的幀傳輸。針對連接建立延遲,團隊開發了名為 WARP(WebRTC Abridged Roundtrip Protocol)的開放規範,配合 Instant Connect 功能,將傳統 WebRTC 需要六次網絡往返的啟動流程壓縮至單個數據包,使用户幾乎可以瞬間發起實時語音會話。

GPT-Live 的推出標誌著 AI 語音交互從「對講機模式」向自然人機對話的跨越。通過分離即時語音與重型計算任務,OpenAI 構建的語音界面在體驗上更接近人際交流,為大規模商用語音 AI 服務樹立了新的技術基準。

想睇更深入嘅 AI 模型與工程科技報道?
前往 The Base Principle 繁體中文 AI 新聞 →
Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)