Google 官方宣布推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,這是其最具表現力的音頻生成模型。用戶可以通過 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids 創建自定義角色聲音和直接場景對話。
新模型提升音頻生成能力
這兩個新模型使創作者、開發者和企業能夠創建更豐富、更具表現力的音頻體驗,並改善 Gemini Notebook 和 Google Vids 等產品的用戶體驗。
「今天,我們推出了兩個新的語音合成模型,將語音生成從靜態預設轉變為動態創意工作室。」
Google
自定義聲音和控制性能的能力
Gemini 3.8 Flash TTS 模型允許用戶從零開始創建自定義聲音,並通過自然語言提示來控制角色的表現。用戶可以逐行指導音頻的節奏、情感,甚至是現實對話的聲音。
「用戶可以從 30 種原創聲音擴展到無限的聲音庫,無論是需要全新角色聲音或一致的品牌代言人,Gemini 3.8 Flash TTS 模型都能提供支持。」
Google
內建安全工具確保音頻安全
為了確保生成的音頻安全,Google 在這些模型中加入了內建的安全工具,如水印技術。這些措施能夠幫助防止不當使用,並確保用戶能夠負責任地使用這些聲音。
「我們的系統利用同意驗證,確保在創建聲音之前,使用者必須提供與參考講者匹配的聲音擁有者的口頭同意錄音。」
Google
支持多語言的高品質音頻生成
Gemini 3.8 Flash TTS 和 Flash-Lite TTS 支持超過 100 種語言,並在多語言音頻體驗的構建上具有強大的能力。這些模型在 Hume AI 的聲音設計基準中獲得了第一名,並在多個全球語言的盲測評估中表現出色。
「這些模型使創作者、開發者和企業能夠構建高品質的多語言聲音體驗。」
Google
資料來源:Google 官方公告

