千問新一代原生全模態模型 Qwen 3.8-Omni-Flash 已於 9 月 18 日正式上線。據瞭解,此模型支持文本、圖像、音頻及影片輸入,並可處理長達 1M 的上下文,能夠在理解內容的基礎上自主規劃任務、調用工具並完成創作與交付。
Qwen 3.8-Omni-Flash 提升音影片處理能力
從功能上看,Qwen 3.8-Omni-Flash 在延續編程、文本處理及 GUI 操作能力的同時,進一步擴展了音影片相關任務的處理能力。針對長音影片的理解,該模型可面對數小時的影片內容,從問題出發決定關注的畫面和聲音資訊,並通過多輪取證定位關鍵內容。結合工具後,模型還可從會議中提煉紀要、待辦事項與風險資訊,並繼續執行發送郵件、寫代碼或檢索多模態資料生成報告等後續任務。
在音影片創作方面,該模型可應用於音樂影片製作、短劇翻譯及長電影解說等場景。例如,在音樂影片創作中,模型能夠理解歌曲結構、節奏及情緒,輸出帶時間戳的句級歌詞;在短劇翻譯中,能夠完成角色識別、口語化翻譯、配音克隆、音軌重混與成片質檢;在長電影處理中,則可完成情節提煉、解說規劃、配音配樂、剪輯渲染及最終質檢。
此外,該模型還可將長影片內容轉化為可重用的資訊資產,包括自動梳理知識點、拆解步驟,生成圖文對應的 PDF 筆記,並進一步轉化為經過校驗和評測的 Agent Skill。實時交互版本 Qwen 3.8-Omni-Flash-Realtime 則可在音影片流輸入過程中同步完成感知與響應,適用於口語陪練、空間音頻感知及智能客服等場景。
在配套方面,官方同步擴展了 Qwen-MM-Plugins,新增面向音影片理解與創作的多項能力,並開源 Qwen-Live Harness,用於持續、實時的音影片交互與任務執行。根據官方數據,在累計 30 項評測中,Qwen 3.8-Omni-Flash 相比上一代 Qwen 3.5-Omni-Plus 平均得分提升超過 26%;同時,API 每小時音頻輸入價格降幅超過 98%,每小時音影片輸入價格降幅超過 93%。
目前,該模型已上線千問 AI 平台。

