回到頂部
深色聲學環中,雙向語音波形一側發光、一側沉入靜默,象徵 GPT-Live 邊聽邊說與懂得停頓的分寸

ChatGPT 語音大改版 GPT-Live:它終於會邊聽邊講、還會『嗯哼』附和,但難的是讓它懂得閉嘴

OpenAI 7/8 推出全雙工語音 GPT-Live,能邊聽邊說、即時『嗯哼』附和,取代 Advanced Voice Mode,5–10 分鐘對話偏好度 75.7%。真正跨過的門檻不是辨識準度,而是社交節奏——懂得閉嘴。這是取代台灣客服的臨界點,但也帶來『一直在聽』與情感依賴風險。

內容查核: 來源查核:

先給一句話的判斷:GPT-Live 這次真正的突破,不是讓 AI 更會講話,而是讓它學會閉嘴。

2026 年 7 月 8 日,OpenAI 推出 GPT-Live-1 與 GPT-Live-1 mini,正式取代用了一年多的 Advanced Voice Mode。過去的語音 AI 本質上是一支高級對講機——你講完、放開、它才回;一次只能一個人講,中間那條線是硬的。全雙工把這條線拆掉了:它可以在你還在講的時候同時聆聽與回應,會用「嗯哼」「對啊」即時附和,你叫它安靜聽、它就真的閉嘴等你講完。從「對講機」升級成「對話」,這一步聽起來小,卻是語音 AI 這兩年最關鍵的體驗跨越。

而真正難的、也最容易被低估的,就藏在那句「叫它閉嘴它就閉嘴」裡。

GPT-Live 到底改了什麼

先把事實講清楚,這樣後面的判斷才站得住。

順帶把一個常見誤傳擋掉:網路上流傳的「延遲 300ms/1700ms」數字,官方並沒有公布任何延遲毫秒數,那些是第三方對舊架構的估算,別掛在 GPT-Live 頭上。

為什麼說臨界點到了

真正讓人坐直的,是評測數字。

根據 OpenAI 公布、由 the-decoder 判讀官方圖表的結果:在真人 5–10 分鐘的對話裡,GPT-Live-1 被偏好的比例達 75.7%(勝過 Advanced Voice Mode),mini 版也有 69.2%。更值得台灣注意的是另一項——電信客服任務基準 τ³-Voice Telecom(高難度)的完成率約 65%,比前代約 30% 幾乎翻倍。

為什麼這條特別重要?因為 τ³-Voice Telecom 量的正是「電信客服」這件事——查號、改方案、處理帳單、轉接。這剛好是台灣最龐大、也最想省人力的語音現場。台灣的電信商(中華電信、台灣大哥大等)這幾年已經陸續在推 AI 語音客服,過去卡在「半雙工聽起來就是機器人、你搶話它就亂」;全雙工把這個體感天花板抬高了。當一個通用語音模型在電信客服基準上直逼六成五完成率,這就是它從「玩具」跨向「上線工具」的臨界點。想把這條落到實際導入,可搭配我們的AI 客服導入指南一起看——但要先說,這裡只停在判斷框架,實作 SOP 不在本文。

反諷的護城河:贏在節奏,也會輸在節奏

這是我們最想講的一段觀點。

過去大家以為語音 AI 的護城河是辨識準度、是口音聽不聽得懂、是回得夠不夠快。GPT-Live 把賽道換了:當技術到位後,真正的勝負手變成社交分寸——知道該附和時附和、該閉嘴時閉嘴。 這是很反直覺的,因為「會停頓」聽起來不像技術突破,但要模型在每秒做出「現在插話會不會很煩」的判斷,比多背幾個知識點難多了。

而護城河的反諷之處在於:同一個節奏能贏,也能輸。 GPT-Live 上線首日,社群就已經在嫌它的『嗯哼』『對啊』附和太熱情、很煩(此為社群反應、屬二手意見)。這不是打臉,反而是最好的證明——當使用者開始嫌一個 AI「附和太多」,代表技術層的「會不會講」已經不是問題,剩下的全是分寸。太冷淡像機器人,太熱情像討好,這條線每個文化、每種情境還都不一樣。語音對話又會回流成訓練資料、形成飛輪(這種資料飛輪的競爭邏輯見 Grok 4.5 與資料飛輪),所以誰先把「分寸感」調到讓人忘記在跟 AI 講話,誰就拿下這一局。

兩個必須誠實講的風險

技術到位了,就更該把話講白。

第一,它一直在聽。 全雙工沒有「按住才說話」的機制,模型持續聆聽本來就是這套體驗成立的前提。OpenAI 在 App 內給了一個「背景對話」開關、而且預設關閉,青少年這邊也配了家長控制、高風險情境可通知家長、自傷議題導向求助資源。但「持續聆聽」這個底層設定,本身就值得每個要導入的企業和家庭想清楚:它在你家客廳、你的客服中心,預設是醒著的。

第二,它會讓人依賴。 這不是我們危言聳聽——OpenAI 自己就把「情感依賴」列為需要長期監測的風險項。一個會邊聽邊「嗯哼」、永遠有耐心、永遠不掛你電話的聲音,對台灣獨居長輩來說,可能真的成了「一個說話的伴」。這是機會,也是隱憂:機會在於陪伴與可近性,隱憂在於它太好用、太不會累,反而擠掉了真人互動。這條線該怎麼看、產品團隊與家庭該檢查什麼,我們整理在AI 陪伴機器人的公共健康框架(情感依賴)

台灣中文體驗:先別急著喊好用

最後回到最實際的問題:它講台灣華語自然嗎?

誠實說,目前查無獨立實測,需要自己試過再下判斷。 唯一站得住的官方鉤子是 OpenAI 自承「部分語言可能出現非母語口音或流暢度落差、會持續改進」——這句話等於官方先打了預防針。全雙工的「附和節奏」是不是能無縫套進華語的語氣詞(我們的「嗯」「對」「然後呢」跟英文的 mhmm 節奏並不一樣),更是查無資料、只能實測。

所以我們的建議很簡單:台灣的客服、語音導覽、長照陪伴團隊,現在就該拿真實情境去壓測它的華語分寸,而不是看到 75.7% 就直接簽約。技術的臨界點到了,但「它懂不懂閉嘴」這件事,換到中文語境要重新驗一次。

常見問題

GPT-Live 和舊的 Advanced Voice Mode 差在哪?

最大的差別是「全雙工」。Advanced Voice Mode 是輪流式的——你講完它才回,一次只能一方說話;GPT-Live 可以同時聆聽與說話,會在你講話時即時「嗯哼」附和,你叫它安靜聽它就會等你講完。官方稱模型每秒要做多次「說話/繼續聽/停頓/打斷」的決策。體驗上,就是從「對講機」變成「對話」。

GPT-Live 免費用戶可以用嗎?台灣用得到嗎?

可以。免費用戶預設用 GPT-Live-1 mini,Go/Plus/Pro 用戶預設用完整的 GPT-Live-1,並已在 iOS、Android 與 ChatGPT.com 全球上線。台灣可跟著全球一起使用。但要提醒:它講台灣華語自不自然、附和節奏順不順,目前查無獨立實測,OpenAI 也自承部分語言可能有口音或流暢度落差,建議用真實情境自己壓測後再下判斷。

GPT-Live 會一直在聽嗎?隱私上要注意什麼?

全雙工沒有「按住才說話」的機制,模型持續聆聽本來就是這套體驗成立的前提。OpenAI 在 App 內提供「背景對話」開關、且預設關閉,青少年這邊也有家長控制、高風險情境可通知家長等防護。企業或家庭導入前,應先想清楚「預設醒著的麥克風」放在客服中心或客廳代表什麼,並把「持續聆聽」納入資料治理評估。

它能取代台灣的電信客服嗎?

正在逼近臨界點,但還不到「直接換人」。OpenAI 公布的電信客服基準 τ³-Voice Telecom(高難度)完成率約 65%、比前代約 30% 幾乎翻倍,加上全雙工解決了「搶話就亂」的體感問題,讓它從玩具走向可上線工具。不過六成五完成率意味著仍有大量情境需要真人接手,且台灣華語的實際表現尚待實測。合理的路是「AI 打前線、真人處理複雜與情緒」,而不是全面替換。

參考來源

№ · further reading

延伸閱讀