ChatGPT Voice 過往已經支援廣東話,但聲調、用字及停頓方式經常帶有「外地人講廣東話」的感覺,部分用戶更形容帶點「譚仔姐姐」口音。OpenAI 近日推出新一代語音模型 GPT-Live,希望令用戶與 AI 的交流更接近真人對話。
更新後的 ChatGPT,廣東話能力到底有多大進步?今次我們從日常對話、面試模擬、情緒回應及廣東話急口令四方面,測試 GPT-Live 的理解能力、語氣變化、臨場反應及發音表現。
測試結果顯示,GPT-Live 在插話反應、持續聆聽及語氣表達方面都有明顯進步。它能夠根據回答繼續追問,亦懂得因應情緒改變聲線和語速。不過,廣東話仍然夾雜書面語、普通話句式及不穩定口音,距離地道港式表達仍有一段距離。
GPT-Live 更新了甚麼?
OpenAI 於 2026 年 7 月 8 日公布 GPT-Live,首批推出 GPT-Live-1 及 GPT-Live-1 mini 兩個版本。GPT-Live-1 會逐步成為付費用戶的主要語音模型,免費用戶則主要使用 GPT-Live-1 mini。
GPT-Live 最大改變,是採用「全雙工」(Full-duplex)架構。模型可以一邊說話、一邊繼續聆聽用戶,並根據停頓、語氣及對話內容,即時判斷應該繼續聽、暫停回答,還是直接回應。
用戶毋須等 ChatGPT 完整說完,便可以隨時插嘴、追問或轉換話題。模型亦會用「嗯」、「明白」等短句表示自己仍在聆聽;當用戶停下來思考時,它會嘗試等待,減少因短暫沉默而過早回答或打斷對話。
遇上網頁搜尋、深入推理或較複雜問題時,GPT-Live 可以將任務交由更強模型處理,再把結果帶回語音對話,同時維持即時互動。OpenAI 亦重新調整 ChatGPT 內九款預設聲線,改善模型處理停頓、背景聲音及用戶插話時的表現。
廣東話實測
1)日常對話:插話後即時修改建議
第一項測試,我們設定了一個日常聚餐情境:
「我今日升職,收工想約朋友喺旺角食飯慶祝,Budget 500 蚊左右,同我傾下食咩好。」
在 ChatGPT 回答期間,我們突然加入新條件:
「等陣,我朋友食素,同埋我哋想坐耐少少。」
GPT-Live 能夠停止原本的回答,接收素食、旺角、預算及希望坐得較久等新條件,再重新整理建議。整個過程毋須等模型完整說完,插話後亦不用重新交代最初要求,反映它仍然掌握對話背景。
這種即時修正能力,是 GPT-Live 相較上一代較明顯的進步。過往 Voice Mode 有時會在用戶插話後繼續完成原本句子,新版本則較快讓出說話空間,對話節奏更接近真人交流。
模型的廣東話仍然帶有書面語痕跡,部分句式較似把普通話或書面中文直接轉成廣東話,與香港人日常討論食飯地點的自然說法仍有距離。
2)面試模擬:懂得根據答案持續追問
第二項測試要求 GPT-Live 扮演 Unwire.hk 記者職位的面試官,並以廣東話進行模擬面試。
模型先要求應徵者自我介紹及解釋應徵原因。當應徵者提到曾跟進九巴政策及訪問市民後,GPT-Live 沒有直接跳到下一條預設題目,而是沿着答案繼續追問:
「有冇遇到啲咩阻滯,例如啲人未必個個都願意受訪?」
當應徵者提到部分市民不願意出鏡,模型便繼續詢問如何與受訪者溝通,以及怎樣邀請更多人接受訪問。其後,問題再由現場採訪延伸至資料核實,詢問應徵者如何確認受訪者說法,以及怎樣平衡官方資料與市民的實際感受。
整段模擬由採訪經驗、現場溝通,一路推進至資料核實及報道角度,問題之間有清楚關聯。模型能夠捕捉回答中的重點,再生成下一條問題,臨場感高於單純逐題讀出預設問題。
GPT-Live 亦會以「明白」、「聽起來很有現場感」等短句承接答案。不過,部分問題一次包含太多重點,句子較長;「確保資料是可信的」、「兩邊的角度有出入」等表達亦偏書面。
整體而言,GPT-Live 已經適合用來練習回答及適應面試追問,但語感仍未完全貼近香港面試官的說話方式。
3)情緒回應:能夠承接焦慮,語氣較柔和
在測試過程中,我們亦加入情緒測試,向 GPT-Live 表示:
「我 DSE 考衰咗,依家好驚入唔到大學,點算啊?」
GPT-Live 採用較慢、較柔和的語氣回應。它先承接用戶的害怕及無助,再逐步拆解升學、工作及被朋友拋離等焦慮。
當用戶提到朋友都升讀大學,自己可能只能修讀副學士或高級文憑時,模型回應:
「好似大家向前走,你留低。」
這句回應顯示模型能夠理解用戶的孤單及比較心態,沒有只集中講解升學制度。其後,它亦提出等待 JUPAS 結果、修讀副學士或高級文憑,以及考慮自資學士課程等選擇。
GPT-Live 能夠透過語速、停頓及聲線變化表達關心,情緒反應較自然。不過,「我明白」、「你真的很害怕」等句式重複較多,安慰方式略為公式化。
部分升學建議亦在未充分了解考生成績、興趣及家庭情況前提出,因此只能作初步參考,未能取代專業升學輔導。
4)廣東話急口令:發音表現意外地好
最後,我們以兩句廣東話急口令測試 GPT-Live 的發音表現,包括:
「郵差叔叔送信純熟,迅速送出。」
「一蚊一斤雞,一蚊一斤龜,佢話龜貴過雞,我話雞貴過龜,咁究竟龜貴過雞定係雞貴過龜?」
GPT-Live 的發音表現相當出色。即使要求加快速度,仍能流暢完成整句,咬字清晰,相近聲母及韻母之間的轉換亦相當準確,幾乎沒有卡頓或含糊情況。
有趣的是,GPT-Live 讀急口令時的廣東話表現,甚至比一般對話更加自然。日常交流期間偶爾會出現鄉音、書面語或語調不穩,但讀急口令時節奏明確、發音集中,整體穩定程度意外地高。
不過,急口令亦反映模型在聆聽和複述方面仍有改善空間。當它未能完全掌握原句內容時,有機會自行調整用詞及句式,再流暢地讀出修改後的版本。
單以發音表現而言,急口令是今次測試中最令人驚喜的一環;若涉及逐字複述,內容準確度仍需要用戶自行核對。
實測結果與主要發現
1)插話反應更接近真人對話
GPT-Live 可以在用戶說話時停止原本回答,接收新條件後即時改變內容。日常對話中,用戶毋須重複背景資料,模型仍能掌握先前提及的地點、預算及要求。
相比過往較明顯的輪流說話模式,新版本讓用戶更容易隨時追問或轉換話題,對話毋須等待模型完成整段答案。
2)上下文理解及追問能力有所提升
面試測試顯示,GPT-Live 能夠由應徵者的回答抽取關鍵內容,再延伸至下一條問題。由市民訪問、出鏡意願、資料核實到報道角度,問題之間具有一定邏輯和連貫性。
這種表現令 GPT-Live 除了可以朗讀預設問題,亦能提供較有互動感的面試及口語練習。
3)語氣變化自然,但回應仍有模板感
面對 DSE 焦慮情境時,GPT-Live 會放慢語速、增加停頓及使用較柔和的聲線。它亦能夠辨認用戶真正擔心的內容,包括升學失敗、就業前景及被朋友拋離的感受。
不過,模型經常重複使用「我明白」、「你真的很害怕」等句式,部分安慰內容帶有輔導模板的感覺。當問題涉及升學、心理壓力或重要人生選擇時,模型提供的內容較適合作為初步整理。
4)廣東話流暢度提升,地道程度仍不穩定
GPT-Live 說話期間增加了換氣、停頓及抑揚頓挫,間中亦會加入「明白」、「等我幫你諗一諗」等承接語,整體聽感比過往自然。
不同情境及聲線之間的表現仍有落差。有時口音和節奏相當自然,有時則會出現鄉音、書面語或普通話式用詞。當對話時間延長及上下文增加後,測試期間亦曾遇到聲線質素下降、短暫卡頓及未能即時回應的情況。
OpenAI 官方亦表示,GPT-Live 目前主要針對部分常用語言作優化,某些語言仍可能出現非母語口音或流暢度不足。背景噪音、較長停頓及其他人的說話聲,亦可能影響 Voice 判斷用戶是否正在對它說話。
少了「譚仔姐姐」味,但未到地道港式廣東話
GPT-Live 今次的提升,主要集中在插話反應、對話節奏、持續聆聽及語氣表達。它開始能夠像真人一樣承接答案、根據內容追問,也能在用戶突然轉換話題時迅速跟上。
用來日常聊天、模擬面試或練習表達,GPT-Live 已經比過往自然不少。尤其在面試測試中,模型能夠由採訪經驗一路追問至資料核實及報道角度,反映它具備一定上下文理解及臨場反應能力。
廣東話方面,模型仍然混合書面中文、普通話句式及香港口語。不同聲線及不同對話之間的表現亦未完全一致,偶爾會出現鄉音、語調改變及反應不穩定等問題。
急口令測試則帶來意外驚喜。GPT-Live 即使加快速度,仍能保持清晰發音及穩定節奏,表現甚至比普通對話更加自然。
新版 ChatGPT 的確少了一點「譚仔姐姐」味,對話亦更像真人;要做到地道、穩定兼準確的香港廣東話,目前仍有一段距離。