GPT-Live 登場:ChatGPT 語音模式全面升級指南
2026-07-10GPT-Live 是什麼?
GPT-Live 是 OpenAI 於 2026 年 7 月 8 日推出的新一代語音模型,現已成為 ChatGPT 語音功能的核心。它採用全雙工(full-duplex)架構,能夠同時聆聽與說話,你可以隨時打斷它、停頓思考,甚至與它同時開口,就像與真人對話一樣。目前推出兩個版本:付費用戶使用 GPT-Live-1,免費用戶使用 GPT-Live-1 mini。
我用同一個五分鐘的腦震盪練習,分別測試了舊版 Advanced Voice Mode 與新版 GPT-Live。舊版在我停頓思考時打斷了我四次;新版則安靜等待,偶爾以「嗯哼」回應表示在聽,直到我主動詢問才給出意見。
這個差異聽起來很小,實際上卻決定了語音功能是「示範一次就放棄」還是「真正融入日常工作」。
根據 OpenAI 公佈的數據,每週已有超過 1.5 億人透過語音和聽寫功能與 ChatGPT 對話。GPT-Live 將全面取代舊有語音系統,這是 OpenAI 歷來影響範圍最大的一次語音升級。
GPT-Live 與 Advanced Voice Mode 有什麼分別?
Advanced Voice Mode 屬於回合制:它靠偵測靜音來判斷你是否說完,因此對話節奏僵硬,經常在你思考時貿然插話。GPT-Live 則持續處理你的語音輸入,同時生成回應,每秒作出多次互動決策。在 OpenAI 的 5 至 10 分鐘真人對照評測中,測試者在輪流發言、打斷處理和對話流暢度上都強烈偏好 GPT-Live。
要理解這次升級的意義,先看 ChatGPT 語音的三個世代,每一代都有不同的致命傷:
--- 串聯式語音(2023 年):三個模型接力運作。語音轉文字模型先轉錄你的話,語言模型撰寫回覆,再由文字轉語音模型讀出。資訊在每個環節流失,而且每次回應都要等待良久。
--- 回合制語音(Advanced Voice Mode,2024 至 2026 年):單一模型直接處理音訊,延遲大減。但它以「靜音」判斷你說完了沒有,你停頓兩秒思考,它就急著給出你根本未想要的答案。
--- 全雙工語音(GPT-Live,現在):模型同時聆聽與說話,每秒多次決定應該開口、保持安靜、輕聲回應還是調用工具。停頓不再被當作「你講完了」。
你最快察覺的行為改變:它會在你說話途中輕聲說「明白」,你叫它安靜它就真的安靜,你打斷它的回答它也能自然接住。OpenAI 同時為九把 ChatGPT 聲音重新調校了音質。
GPT-Live 如何一邊對話一邊處理複雜問題?
GPT-Live 將「對話」與「深度運算」分離。當你的問題需要搜尋網絡、深入推理或多步驟處理時,它會在背景將任務交給 GPT-5.5,對話照常進行,結果完成後再自然帶回對話之中。你可以在設定、語音、智能程度中選擇 Instant、Medium 或 High 三個推理深度。
這個「委派」設計是大多數人忽略的關鍵。語音模型本身保持輕量快速,以毫秒級速度回應;真正的重型思考交給背景的前沿模型處理。OpenAI 表示,隨著新模型推出,背景模型會持續更換升級。
根據 OpenAI 公佈的評測,GPT-Live-1 在 GPQA(專家級科學推理基準)上大幅領先 Advanced Voice Mode,在 BrowseComp(測試網絡搜尋難找資訊的能力)上亦有顯著進步。方向很明確:語音回答不再是文字回答的「降級版」。
此外還有視覺層:談到天氣、股價或體育賽事時,畫面會即時顯示視覺卡片,對話不會中斷。語音模式同時支援搜尋、記憶、圖片和檔案上載,你可以把 PDF 丟進對話,然後繼續用說話討論它。
如何取得 GPT-Live?怎樣確認自己用的是哪個版本?
將 iOS 或 Android 的 ChatGPT 應用程式更新至最新版本,或直接開啟 chatgpt.com,點按訊息欄的語音圖示即可開始對話,毋須按住說話。GPT-Live-1 將成為 Go、Plus 和 Pro 方案的預設語音模型,免費用戶則預設使用 GPT-Live-1 mini。全球推送由 2026 年 7 月 8 日開始,屬漸進式,未見到的話請等待數天。
確認方法:開啟設定、語音,如果看到智能程度選項(Instant、Medium、High),代表你已經在付費方案上用到 GPT-Live。
實用提示:Instant 模式背後使用 GPT-5.5 Instant,Medium 和 High 則調用 GPT-5.5 Thinking 進行更深推理。快問快答用 Instant 最順暢;涉及策略思考或複雜比較的對話,開始前先切換至 Medium,體驗會截然不同。
GPT-Live 在實際工作中可以怎樣用?
真正的實用價值在於過往被僵硬輪流發言毀掉的免提工作流程:通勤時邊行邊口述草稿、與一個懂得自然插話的對手排練簡報、跨語言會議的即時傳譯,以及一邊討論一邊在背景執行的委派式資料搜集。
工作流程一:通勤草稿。在港鐵上花十分鐘,把明天的活動構思、報告大綱或一封難寫的電郵完整說一遍。GPT-Live 容忍長時間停頓,你可以邊想邊說而不被打斷。結尾說一句「把我剛才所講整理成結構化大綱」,坐低打開對話紀錄,大綱已經在等你。
工作流程二:排練對手。叫它扮演一位懷疑的客戶,在你簡報途中隨時提出質疑。回合制語音做不到真正的「插話」,全雙工可以。這是 AI 至今最接近真人角色扮演的體驗。
工作流程三:即時傳譯。持續處理架構令它能在雙方說話的同時進行近乎即時的翻譯。香港人日常的中英夾雜會議、與內地團隊的電話會議,正是這功能的主場。
工作流程四:邊講邊查。提出一個需要網絡資料的問題後繼續討論,背景搜尋完成後,答案會自然融入對話。你保持思考狀態,而不是望著載入圈發呆。
GPT-Live 目前有什麼不足?
推出初期,GPT-Live 不支援視像或螢幕分享,需要這些功能的話,舊版 Standard 和 Advanced Voice Mode 仍然保留。OpenAI 亦明言部分語言可能出現非母語口音或流暢度不足。此外,語音本質上不適合精準輸出:逐字文案、表格或任何需要原文照抄的內容,請回到文字介面。
三個實際使用時要留意的位置:
--- 語言支援不平均。OpenAI 優先優化 ChatGPT 最多人使用的語言,並公開承認其他語言有流暢度落差。如果你的工作語言是廣東話混英文,先私下測試,不要直接在客戶面前使用。
--- 語音輸出不是最終文案。數字、人名和措辭在口語轉換中可能出現偏差。把對話當作思考過程,結尾要求它在對話紀錄中輸出書面摘要,然後在文字上修改。
--- 背景委派需要真實時間。一條 High 推理深度的問題可能在背景執行好一陣子。如果兩分鐘後就要開會,直接打字提問更穩妥。
立即測試:一段驗證全雙工聆聽的口述提示
開啟 ChatGPT 語音模式,把以下提示讀出來。它測試 GPT-Live 與所有舊版語音模式的三個關鍵分野:聽從指令保持安靜、容忍思考停頓,以及把口述內容轉化為書面產出。
試試這段提示(用說的):
「我想用五分鐘圍繞【你的主題】出聲思考。你的任務是聆聽。除非我說『意見』兩個字,否則請保持安靜。當我說『意見』,請在三十秒內給我三個最強烈的反應,然後繼續聆聽。如果我沉默,請等我,不要插話。最後當我說『總結』,請把我全部內容整理成一份可以在對話紀錄閱讀的結構化大綱。」
如果它守住沉默、聽從觸發詞、最後交出清晰大綱,你用的就是新模型。如果它在你第一次長停頓就插話,你仍在舊語音系統上,請檢查設定、語音。
結語:語音正式成為工作介面
GPT-Live 是第一個不像對講機、更像同事的語音模式:它邊說邊聽,在你思考時等待,並將艱深問題悄悄交給背景的前沿模型。真正從中獲益的實踐者,會建立一兩個可重複的語音工作流程,例如通勤草稿或排練對手,而不是把它當成一次性的新奇示範。
當科技變得這樣自然,它就不再冰冷。懂AI的冷,更懂你的難,UD 同行28年,讓科技成為有溫度的陪伴。
實測你的 AI 實力
新模型與新功能每週登場,「試過」與「用熟」之間的距離,正是你的競爭優勢所在。UD 團隊手把手帶你完成每一步,從工具設定、流程設計到實際部署,讓 AI 真正融入你的日常工作。