Google DeepMind 於 2026 年 9 月 24 日推出 Gemini 3.8 Live with Live Avatar,為即時對話模型加入具備同步口型與表情的虛擬人像。此功能把低延遲串流影片與語音對話原生結合,讓企業的數碼代理擁有可見的視覺形象。官方表示,人像能同時理解畫面與聲音輸入,並以近即時的影音回應使用者。
Google DeepMind 於 2026 年 9 月推出 Gemini 3.8 Live,為即時對話模型加入同步口型與表情的虛擬人像,支援 97 種語言切換,現時僅限企業客戶。
過去一年,即時語音模型的競爭集中在延遲、打斷處理與工具呼叫能力,視覺呈現則被視為次要環節。Live Avatar 把影片生成拉進對話迴路,改變了這項判斷。當代理需要面對客戶時,一張能夠對上嘴型、隨語言調整表情的臉,往往比單純的語音輸出更能建立信任。
Gemini 3.8 Live with Live Avatar 是什麼?
它是 Google DeepMind 為 Gemini 即時對話模型加入的視覺化功能,以近即時影片生成配合語音同步,讓人工智能以虛擬人像形態對話,適用於企業客服導覽。
官方部落格指出,人類對話本質上屬於多模態行為,交談時會聆聽、觀看、說話並使用面部表情。Live Avatar 正是把這些元素移植到企業代理身上,讓它以虛擬形象同時接收視覺與音訊輸入。其定位並非娛樂性質的生成工具,而是面向企業服務的對話介面。
虛擬人像可以做到哪些事情?
虛擬人像具備精準口型同步、自然表情與流暢的發言輪替,能在對話期間於背景觸發工具呼叫並取得資料,使交流不中斷,亦可在說話時於畫面上顯示相關資訊。
在官方示範中,人像處理酒店入住登記等複雜任務時,會在對話持續進行的同時於背景呼叫工具並取得所需資料。這種安排把工具執行與語音對話並行處理,避免使用者因等待系統查詢而中斷交流。除口型與表情外,人像亦可在說話期間於畫面上顯示資訊。
97 種語言切換對企業有什麼價值?
Live Avatar 支援原生語音對語音同步,能在 97 種語言之間動態調整口型與表情,官方稱切換時不會降低影片保真度,單一代理即可服務多語市場。
官方說明,人像的口型與表情會依語言動態調整,並可在一段對話中無縫切換語言。Google 發布的示範影片顯示,人像以英語與日語交談時,嘴部動畫均與發音保持對齊。這種原生同步方式有別於先合成語音再另行驅動嘴型的做法,可減少切換語言時的視覺斷裂。
自訂人像與安全機制如何運作?
除預設人像庫外,企業可上傳參考圖生成專屬人像,保留參考人物樣貌與品牌風格。自訂人像需經允許名單開放,所有影音輸出均嵌入不可見水印以標示 AI 生成內容。
官方表示,組織可依品牌需要自訂人像,從參考圖生成具備反應能力的動畫形象,同時保留參考人物的相似度或角色識別。自訂人像的建立目前僅透過企業允許名單提供。為維持內容透明度,Google 在音訊與影片輸出中嵌入不可見水印,讓生成內容可被偵測,以降低錯誤訊息與誤植歸屬的風險。
目前要如何使用這項功能?
此功能自 2026 年 9 月 24 日起僅提供予 Gemini Enterprise 客戶,一般消費者與開發者暫未能使用,自訂人像亦需另行申請允許名單。
這項功能現階段僅向 Gemini Enterprise 客戶開放,並未提供個人版或公開 API 的接入途徑。有意採用的企業需先評估自身是否已納入該方案,以及自訂人像的允許名單申請流程。Google 尚未說明價格調整或全面開放的時間表,相關安排有待官方後續公布。
出處連結有哪些?
本文資訊來源為 Google DeepMind 官方部落格於 2026 年 9 月 24 日發布的公告,以及 The Verge 於同日的報導。
來源:Google DeepMind 官方公告、The Verge 報導
總結:虛擬人像的下一步是什麼?
即時對話模型正由純語音走向具備視覺呈現的代理形態。企業是否採用,取決於跨語言服務的一致性與品牌形象的掌控程度,而自訂人像與水印機制將成為評估重點。
Live Avatar 把視覺呈現納入對話代理的核心設計,反映企業級人工智能的競爭焦點正由模型能力轉向使用者體驗。功能目前僅限企業客戶,實際採用成效與公開時間表,將是觀察視覺化對話代理能否普及的關鍵指標。