小米發佈工業級目標說話人語音識別大模型 Xiaomi-CocktailASR-1

小米正式發佈並開源工業級目標說話人語音識別大模型 Xiaomi-CocktailASR-1,該消息於 9 月 11 日公佈。根據小米技術官方微博的資料,該模型專門針對多人同時說話的複雜語音場景,重點解決語音識別中的「雞尾酒會」難題,即在嘈雜環境下從多名說話者中識別並轉錄指定目標用戶的語音內容。

據小米介紹,Xiaomi-CocktailASR-1 採用端到端 LLM 架構,利用目標說話人的一段參考音頻作為聲紋提示,在多人重疊發言的情況下,能夠提取並僅轉錄目標說話人的內容。官方指出,該模型基於大規模多說話人數據訓練,並在 AliMeeting、AMI、LibriMix 等多個主流多說話人測試集上達到最佳性能。

Xiaomi-CocktailASR-1 具備多說話人語音識別能力

同時,其在單說話人場景下的識別表現也可與主流單人 ASR 模型相媲美,能夠通過同一模型兼顧單人與多人場景,無需在不同語音識別模型之間切換。此外,該模型還具備負樣本拒識能力,對於音頻中不存在目標說話人的情況,模型可輸出空文本,以降低非目標語音帶來的誤識別和誤觸發風險。

小米同時提到,Xiaomi-CocktailASR-1 支持思維鏈推理模式,能為識別結果提供具備可解釋性的推理過程。目前,Xiaomi-CocktailASR-1 的模型權重與推理代碼已經開源。

Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)