Meta 推出 Muse Voice Transcribe 實時語音轉錄模型 支援 Mac 系統級聽寫

Meta 正式推出旗下首個即時音訊感知模型 Muse Voice Transcribe,將多語言串流轉寫功能帶到 Meta AI for Mac、Muse Code,以及透過 Meta Model API 開放予開發者使用。Muse Voice Transcribe 同時為 Mac 平台提供全系統層級的語音輸入支援。

Muse Voice Transcribe 整合串流辨識與說話者分離技術

Meta Superintelligence Labs 表示,Muse Voice Transcribe 將串流式自動語音辨識(ASR)、說話者日誌化(speaker diarization)及端點偵測(endpointing)整合於單一模型之中。實際應用上,系統能夠在說話進行期間即時生成文字,在錄音中區分多達 20 個以上的說話者,並判斷個別語句何時結束,整個過程毋須額外的後製處理。

該模型以逾 70 種語言的數據進行訓練,發佈時已有 25 種語言完成驗證,支援長度超過一小時的音訊,並可在同一句子內或句子之間進行原生層級的語碼轉換(code-switching)。此外,模型亦支援語言、關鍵字及情境偏置(biasing)功能,進一步提升辨識準確度。Meta 並未採用固定的速度與準確度權衡設定,而是由模型自行決定每次輸出文字前需聆聽的音訊長度,Meta 將此機制命名為「自適應延遲」(adaptive delay)。

系統能夠在處理較容易的語句時迅速輸出,面對困難詞彙時則參考更長的音訊上下文以提升準確度。

定價與排名表現

Meta 指出,截至 9 月 1 日,Muse Voice Transcribe 於 Artificial Analysis 串流語音轉文字排行榜名列第一。Muse Voice Transcribe 今日起透過 Meta Model API 提供使用,定價為每 1,000 分鐘音訊 US$3 (約 HK$23),即每小時 US$0.18 (約 HK$1)。

該模型亦已同步支援 Meta AI for Mac 及 Muse Code 內的語音輸入功能。

在 Mac 平台,用戶只需按住 Fn 鍵即可於任何應用程式內進行語音輸入。Meta 近期亦持續擴展 Meta AI 對 Apple 平台的支援,包括有限的 CarPlay 整合,以及專為 Mac 推出的 Meta AI 與 Muse Code 應用。

項目規格
支援語言數量逾 70 種(訓練數據)/25 種(發佈時驗證)
說話者分離上限20 個以上
音訊長度支援超過 1 小時
語碼轉換支援句內及句間原生切換
偏置功能語言、關鍵字、情境偏置
延遲機制自適應延遲(adaptive delay)
API 定價US$3 (約 HK$23) / 1,000 分鐘(約 HK$23.4)
每小時成本US$0.18 (約 HK$1)
Mac 啟動快捷鍵按住 Fn 鍵

Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)