Google AI語音大幅躍進 高擬真聲線支援多國語言助產業創新

280eccc3 9ac0 4899 a2d8 c8f2e2989cb6
圖/示意圖

商傳媒|何映辰/台北報導

Google 近期在人工智慧(AI)語音功能方面取得顯著進展,不僅推出一系列全新的文字轉語音(text-to-speech,簡稱 TTS)模型,更發表可進行即時對話的虛擬分身技術,有望提升人機互動的自然度與應用廣度。

Google 於 9 月 23 日推出 Gemini 3.8 TTS 及 Gemini 3.8 Flash-Lite TTS 等新模型,旨在為開發者、內容創作者及企業提供更高品質、更具表現力的人工語音。其中,Gemini 3.8 Flash TTS 能夠透過自然語言提示,在遊戲、有聲書、Podcast 及互動媒體等多種應用場景中,從零開始創造全新語音,並能自訂角色、口音及聲音特徵,支援超過 100 種語言及方言。至於 Gemini 3.8 Flash-Lite TTS 則專為音訊配音、內容創作及語音助理等用途設計。

此外,Google 也發表了 Gemini 3.8 Live 版本,並導入「Live Avatar」(即時虛擬分身)功能,讓使用者能與具備唇形同步與臉部表情的動畫虛擬人進行即時對話。Live Avatar 不僅支援 97 種語言間的無縫轉換,且畫面品質不減損,還能在說話時同步顯示螢幕資訊。為確保內容真實性,Live Avatar 的產出會內嵌隱形 SynthID 浮水印。

在實際應用方面,Google 正於美國 Pixel 11 手機上推出一項「早期實驗」功能,讓用戶能委託 Gemini 代為撥打商家電話。這項功能今日(週四)起陸續推出,Gemini 能處理預約、查詢商品庫存或更改行程等任務。過程中,使用者可即時查看對話逐字稿,並隨時接管對話。儘管 ElevenLabs 和 Baseten 等業者已提供類似的語音技術,Futurum Group 分析師 Bradley Shimmin 認為,Google 的新模型透過專注於特定應用場景,為遊戲及娛樂市場開創了新機會。Modulate 執行長 Carter Huffman 也指出,將語音功能整合至單一、全面的模型,能大幅提升效率。

這些技術的演進,對於台灣的語音助理、有聲內容創作及數位娛樂產業而言,有望提升人機互動的真實感與效率,為未來的語音應用開啟更多可能性。

280eccc3 9ac0 4899 a2d8 c8f2e2989cb6