先給一句話的判斷:GPT-Live 這次真正的突破,不是讓 AI 更會講話,而是讓它學會閉嘴。
2026 年 7 月 8 日,OpenAI 推出 GPT-Live-1 與 GPT-Live-1 mini,正式取代用了一年多的 Advanced Voice Mode。過去的語音 AI 本質上是一支高級對講機——你講完、放開、它才回;一次只能一個人講,中間那條線是硬的。全雙工把這條線拆掉了:它可以在你還在講的時候同時聆聽與回應,會用「嗯哼」「對啊」即時附和,你叫它安靜聽、它就真的閉嘴等你講完。從「對講機」升級成「對話」,這一步聽起來小,卻是語音 AI 這兩年最關鍵的體驗跨越。
而真正難的、也最容易被低估的,就藏在那句「叫它閉嘴它就閉嘴」裡。
GPT-Live 到底改了什麼
先把事實講清楚,這樣後面的判斷才站得住。
- 架構換成全雙工。 GPT-Live 能同時聆聽與說話,官方稱模型每秒要做多次即時決策:現在該說話、繼續聽、停頓、打斷、還是呼叫工具。這取代了 Advanced Voice Mode 的輪流式對話。
- 自己不硬扛推理,改用委派。 GPT-Live 背後委派前沿模型來處理較深的推理,上線初期用的是 GPT-5.5(即時與 mini 走 GPT-5.5 Instant、中高難度推理走 GPT-5.5 Thinking)。換句話說,語音層負責「節奏與陪伴」,重活外包給更強的腦——這種前沿模型的發牌邏輯,我們在前沿模型的可用性發牌(GPT-5.6 背景)聊過。
- 方案分層。 Go/Plus/Pro 用戶預設 GPT-Live-1,免費用戶預設 mini;iOS、Android 與 ChatGPT.com 全球上線。OpenAI 說已有逾 1.5 億人用過 ChatGPT 的語音或聽寫功能,這次是把那個入口整個換底。
- 缺一塊:影像。 上線暫不支援語音搭配影像或螢幕分享,API 也是「即將推出」。對照 Google 的 Gemini Live 早就同時支援全雙工+鏡頭+螢幕分享,OpenAI 這次是把「講話的節奏」做到位、但「看得見的能力」還沒補上。
順帶把一個常見誤傳擋掉:網路上流傳的「延遲 300ms/1700ms」數字,官方並沒有公布任何延遲毫秒數,那些是第三方對舊架構的估算,別掛在 GPT-Live 頭上。
為什麼說臨界點到了
真正讓人坐直的,是評測數字。
根據 OpenAI 公布、由 the-decoder 判讀官方圖表的結果:在真人 5–10 分鐘的對話裡,GPT-Live-1 被偏好的比例達 75.7%(勝過 Advanced Voice Mode),mini 版也有 69.2%。更值得台灣注意的是另一項——電信客服任務基準 τ³-Voice Telecom(高難度)的完成率約 65%,比前代約 30% 幾乎翻倍。
為什麼這條特別重要?因為 τ³-Voice Telecom 量的正是「電信客服」這件事——查號、改方案、處理帳單、轉接。這剛好是台灣最龐大、也最想省人力的語音現場。台灣的電信商(中華電信、台灣大哥大等)這幾年已經陸續在推 AI 語音客服,過去卡在「半雙工聽起來就是機器人、你搶話它就亂」;全雙工把這個體感天花板抬高了。當一個通用語音模型在電信客服基準上直逼六成五完成率,這就是它從「玩具」跨向「上線工具」的臨界點。想把這條落到實際導入,可搭配我們的AI 客服導入指南一起看——但要先說,這裡只停在判斷框架,實作 SOP 不在本文。
反諷的護城河:贏在節奏,也會輸在節奏
這是我們最想講的一段觀點。
過去大家以為語音 AI 的護城河是辨識準度、是口音聽不聽得懂、是回得夠不夠快。GPT-Live 把賽道換了:當技術到位後,真正的勝負手變成社交分寸——知道該附和時附和、該閉嘴時閉嘴。 這是很反直覺的,因為「會停頓」聽起來不像技術突破,但要模型在每秒做出「現在插話會不會很煩」的判斷,比多背幾個知識點難多了。
而護城河的反諷之處在於:同一個節奏能贏,也能輸。 GPT-Live 上線首日,社群就已經在嫌它的『嗯哼』『對啊』附和太熱情、很煩(此為社群反應、屬二手意見)。這不是打臉,反而是最好的證明——當使用者開始嫌一個 AI「附和太多」,代表技術層的「會不會講」已經不是問題,剩下的全是分寸。太冷淡像機器人,太熱情像討好,這條線每個文化、每種情境還都不一樣。語音對話又會回流成訓練資料、形成飛輪(這種資料飛輪的競爭邏輯見 Grok 4.5 與資料飛輪),所以誰先把「分寸感」調到讓人忘記在跟 AI 講話,誰就拿下這一局。
兩個必須誠實講的風險
技術到位了,就更該把話講白。
第一,它一直在聽。 全雙工沒有「按住才說話」的機制,模型持續聆聽本來就是這套體驗成立的前提。OpenAI 在 App 內給了一個「背景對話」開關、而且預設關閉,青少年這邊也配了家長控制、高風險情境可通知家長、自傷議題導向求助資源。但「持續聆聽」這個底層設定,本身就值得每個要導入的企業和家庭想清楚:它在你家客廳、你的客服中心,預設是醒著的。
第二,它會讓人依賴。 這不是我們危言聳聽——OpenAI 自己就把「情感依賴」列為需要長期監測的風險項。一個會邊聽邊「嗯哼」、永遠有耐心、永遠不掛你電話的聲音,對台灣獨居長輩來說,可能真的成了「一個說話的伴」。這是機會,也是隱憂:機會在於陪伴與可近性,隱憂在於它太好用、太不會累,反而擠掉了真人互動。這條線該怎麼看、產品團隊與家庭該檢查什麼,我們整理在AI 陪伴機器人的公共健康框架(情感依賴)。
台灣中文體驗:先別急著喊好用
最後回到最實際的問題:它講台灣華語自然嗎?
誠實說,目前查無獨立實測,需要自己試過再下判斷。 唯一站得住的官方鉤子是 OpenAI 自承「部分語言可能出現非母語口音或流暢度落差、會持續改進」——這句話等於官方先打了預防針。全雙工的「附和節奏」是不是能無縫套進華語的語氣詞(我們的「嗯」「對」「然後呢」跟英文的 mhmm 節奏並不一樣),更是查無資料、只能實測。
所以我們的建議很簡單:台灣的客服、語音導覽、長照陪伴團隊,現在就該拿真實情境去壓測它的華語分寸,而不是看到 75.7% 就直接簽約。技術的臨界點到了,但「它懂不懂閉嘴」這件事,換到中文語境要重新驗一次。
常見問題
GPT-Live 和舊的 Advanced Voice Mode 差在哪?
最大的差別是「全雙工」。Advanced Voice Mode 是輪流式的——你講完它才回,一次只能一方說話;GPT-Live 可以同時聆聽與說話,會在你講話時即時「嗯哼」附和,你叫它安靜聽它就會等你講完。官方稱模型每秒要做多次「說話/繼續聽/停頓/打斷」的決策。體驗上,就是從「對講機」變成「對話」。
GPT-Live 免費用戶可以用嗎?台灣用得到嗎?
可以。免費用戶預設用 GPT-Live-1 mini,Go/Plus/Pro 用戶預設用完整的 GPT-Live-1,並已在 iOS、Android 與 ChatGPT.com 全球上線。台灣可跟著全球一起使用。但要提醒:它講台灣華語自不自然、附和節奏順不順,目前查無獨立實測,OpenAI 也自承部分語言可能有口音或流暢度落差,建議用真實情境自己壓測後再下判斷。
GPT-Live 會一直在聽嗎?隱私上要注意什麼?
全雙工沒有「按住才說話」的機制,模型持續聆聽本來就是這套體驗成立的前提。OpenAI 在 App 內提供「背景對話」開關、且預設關閉,青少年這邊也有家長控制、高風險情境可通知家長等防護。企業或家庭導入前,應先想清楚「預設醒著的麥克風」放在客服中心或客廳代表什麼,並把「持續聆聽」納入資料治理評估。
它能取代台灣的電信客服嗎?
正在逼近臨界點,但還不到「直接換人」。OpenAI 公布的電信客服基準 τ³-Voice Telecom(高難度)完成率約 65%、比前代約 30% 幾乎翻倍,加上全雙工解決了「搶話就亂」的體感問題,讓它從玩具走向可上線工具。不過六成五完成率意味著仍有大量情境需要真人接手,且台灣華語的實際表現尚待實測。合理的路是「AI 打前線、真人處理複雜與情緒」,而不是全面替換。