Google 宣布推出 Gemini 3.8 語音合成模型

Google 官方宣布推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,這是其最具表現力的音頻生成模型。用戶可以通過 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids 創建自定義角色聲音和直接場景對話。

新模型提升音頻生成能力

這兩個新模型使創作者、開發者和企業能夠創建更豐富、更具表現力的音頻體驗,並改善 Gemini Notebook 和 Google Vids 等產品的用戶體驗。

「今天,我們推出了兩個新的語音合成模型,將語音生成從靜態預設轉變為動態創意工作室。」

Google

自定義聲音和控制性能的能力

Gemini 3.8 Flash TTS 模型允許用戶從零開始創建自定義聲音,並通過自然語言提示來控制角色的表現。用戶可以逐行指導音頻的節奏、情感,甚至是現實對話的聲音。

「用戶可以從 30 種原創聲音擴展到無限的聲音庫,無論是需要全新角色聲音或一致的品牌代言人,Gemini 3.8 Flash TTS 模型都能提供支持。」

Google

內建安全工具確保音頻安全

為了確保生成的音頻安全,Google 在這些模型中加入了內建的安全工具,如水印技術。這些措施能夠幫助防止不當使用,並確保用戶能夠負責任地使用這些聲音。

「我們的系統利用同意驗證,確保在創建聲音之前,使用者必須提供與參考講者匹配的聲音擁有者的口頭同意錄音。」

Google

支持多語言的高品質音頻生成

Gemini 3.8 Flash TTS 和 Flash-Lite TTS 支持超過 100 種語言,並在多語言音頻體驗的構建上具有強大的能力。這些模型在 Hume AI 的聲音設計基準中獲得了第一名,並在多個全球語言的盲測評估中表現出色。

「這些模型使創作者、開發者和企業能夠構建高品質的多語言聲音體驗。」

Google

資料來源:Google 官方公告

十斗
十斗

十斗是 TechRitual Hong Kong 科技記者,擁有計算機科學與工程學位,專注報導 AI 人工智能、Google、機器學習及數據科學領域。持續追蹤全球 AI 產業動態,為讀者提供深入淺出的科技分析。

友情網站:國際版 / TechRitual WorldThe Base Principle(AI・工程)