2026-07-11
22457a2c 0906 41b3 9369 D69b1d6b1037

2026年7月8日,OpenAI正式發布了其新一代語音模型,命名為GPT-Live-1和GPT-Live-1 mini,旨在使與人工智能的對話更加自然和流暢。這些模型的特點是具備全雙工能力,意味著用戶可以在與AI交互時,實現同時發聲與聆聽的功能,這使得用戶可以自然打斷AI,並啟用即時翻譯等功能。

新的語音模型取代了之前的高級語音模式,並預設為ChatGPT的默認設定。選擇付費版本的用戶將能夠獲得較大型的GPT-Live-1模型。而之前的語音模型則結合了語音轉錄、語言生成和文本轉語音等多個模型,方式雖然可行,但實際表現卻不夠流暢。

在記者會上,OpenAI表示這些新型模型成功解決了傳統語音交互中遇到的困難,例如在用戶講話時意外中斷,以及無法即時回答的智能不足。新的GPT-Live模型會將用戶的查詢傳送到最新的文字模型如GPT-5.5,進一步進行搜索、推理等功能,並同時維持對話的流暢進行。

值得注意的是,這些模型不僅可以在多種語言間進行對話,還能在用戶需要思考時保持安靜,吸收對話的上下文。此外,開發商強調,GPT-Live的設計旨在促進更長時間的對話,產品負責人Atty Eleti指出,他經常在散步時使用這些語音功能,並進行30至40分鐘的討論。

無論是日常生活中需求的即時幫助,還是語言學習、似乎簡單的聊天,超過1.5億人正利用ChatGPT的語音和文字功能,享受更加人性化的人工智能體驗。OpenAI的設計理念是將語音作為未來的主要計算界面,使人機互動更加自然,不過該公司同時強調,新的語音模式並不是要成為一種AI伴侶,而是將安全性設計融入其中,以確保回應適合年齡的青少年使用者。

新模式的發布在市場中釋放了強烈的訊息,OpenAI預見到語音將成為人機互動的主要接口,這樣的藍圖在未來或會引入更多硬體支持,包括針對語音優化的耳機等產品,但具體的硬體計劃目前尚未公佈。根據公司的報告,隨著AI運算成本的降低,這一切變得可行,並將向免費用戶開放。

然而,在使用這種語音模式時,OpenAI存儲音頻30天以獲得上下文信息,雖然用戶可隨時刪除或導出數據,但自動關閉用戶查詢後的模型訓練,確保用戶隱私得以保障。

這次新技術的推出不僅關乎單一語音模型的進步,更是人工智能在日常生活中的深層次融合與存在,顯示了未來面向語音交互的潛力和影響力。這勢必將改變我們與數位助手的互動方式,並讓機器的反應更加靈活。

OpenAI Voice Model
圖片來源: Axios

如欲取得更詳細的報導,可以參考以下來源的連結:
1. OpenAI releases new voice models for more natural live conversations | TechCrunch
2. Introducing GPT-Live | OpenAI
3. OpenAI bets voice will become AI’s primary interface with new models | Axios

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *