Google 推出 Gemini 3.8 Live 及其 Live Avatar 功能

Google 官方宣布推出 Gemini 3.8 Live 及其 Live Avatar 功能,為 Gemini 的對話式人工智能帶來即時視覺存在。通過將即時對話能力與低延遲的串流視頻結合,Live Avatar 能夠為企業及其用戶提供更自然、更直觀的對話體驗。

Live Avatar 功能提升對話體驗

根據 Google 的說法,Live Avatar 功能為 Gemini 的原生即時對話模型帶來了近乎即時的視覺存在。這項功能通過將近乎即時的視頻生成與語音結合,創造出一種能夠聽、看及說的動態視覺角色。

「Live Avatar 使企業能夠以更具互動性的方式擴展其虛擬產品,無論是提供吸引人的客戶服務還是進行互動式演示,都能將數位交流轉化為更豐富、更易於接觸的體驗。」

Google

多模態對話的自然性

對話本質上是多模態的:我們透過聆聽、觀察、說話及使用面部表情來交流。Live Avatar 將這些能力引入企業代理。通過同時處理視覺和音頻輸入,該功能生成豐富的對話,提供更全面的體驗。

「Gemini 3.8 Live with Live Avatar 能夠近乎即時地接收視覺和聽覺信息,並以表現豐富的音頻和視頻作出回應,實現更自然的對話。」

Google

支持全球規模的對話體驗

Live Avatar 的對話存在感應該是自然的,而不受語言限制。該功能具備原生的多語言語音到語音同步能力,能夠在 97 種語言之間無縫切換,而不會降低視頻質素或引入視覺漂移。

「Live Avatar 能夠在對話過程中切換語言,並且其唇同步和表情能夠在 97 種語言之間無縫適應。」

Google

品牌需求的定制化 Live Avatar

許多組織需要獨特的視覺身份來符合其品牌。除了提供多樣化的預設虛擬角色庫外,組織還可以自定義其 Live Avatars。開發者可以從高質量的參考圖像生成完全動畫的響應型虛擬角色,同時保留參考的相似性、品牌風格或角色身份。

信任與透明度的核心

Google 在開發 Live Avatar 時,設計了嚴格的保障措施,以尊重身份並保持 AI 生成內容的透明度。所有由其 AI 產品生成的輸出均帶有 SynthID 水印,這種不可察覺的水印直接嵌入音頻和視頻輸出中,幫助確保 AI 生成的內容保持可檢測性,以減少錯誤信息和錯誤歸屬。

Gemini 3.8 Live with Live Avatar 現已在 Gemini Enterprise 中推出。開發者可參考 API 文檔以開始使用。

資料來源:Google 官方公告

十斗
十斗

十斗是 TechRitual Hong Kong 科技記者,擁有計算機科學與工程學位,專注報導 AI 人工智能、Google、機器學習及數據科學領域。持續追蹤全球 AI 產業動態,為讀者提供深入淺出的科技分析。

友情網站:國際版 / TechRitual WorldThe Base Principle(AI・工程)