阿里千問 AI 平台推出 Qwen3-Max-Flash 模型 採用全新混合注意力架構

阿里旗下千問 AI 平台於 8 月 27 日正式推出 Qwen3-Max-Flash 模型,定位為多模態混合專家(MoE)架構,主打極致性價比。官方公佈的最新定價為:輸入每百萬 Tokens 收費 RMB¥0.80 (約 HK$0)、輸出每百萬 Tokens 收費 RMB¥2.70 (約 HK$2)、快取命中每百萬 Tokens 收費 RMB¥0.10 (約 HK$0)。

Qwen3-Max-Flash 採用全新混合注意力架構

Qwen3-Max-Flash 採用與過往千問大型模型截然不同的下一代(Next)架構,總參數量達千億級別,但每次推論僅激活 60 億(6B)參數,號稱刷新全球模型效率基準。在注意力機制方面,模型引入獨創的 QSA(Qwen Sparse Attention)稀疏注意力機制,與 GDN 形成高效融合的混合注意力架構,於高快取命中、1M Tokens 長上下文場景下,運算速度較傳統方案提升 8 倍以上,同時兼顧準確度。

在內部分層通訊方面,模型採用自研 Gated Residual 方法,把傳統 Transformer 單一資訊主通道拆分成 4 條獨立通道,讓模型按需求動態決定讀寫路徑,資訊傳遞更高效,訓練穩定性亦同步提升。此設計改變了過往單一通道造成的瓶頸,使大規模訓練時的梯度流通更為順暢。

51B N-gram Embedding 提升參數擴展效率

在參數擴展層面,模型額外引入 51B 的 N-gram Embedding 參數,為 Transformer 主幹提供高效的查表定位功能。該參數在每次 Token 計算時無需即時激活,僅以極低資源消耗「外掛」一個大規模記憶指南手冊,大幅提升模型參數擴展效率,並降低訓練成本。透過這種解耦設計,模型得以在維持推論速度的同時,把更多世界知識預載至靜態參數之中。

調參方面,Qwen3-Max-Flash 採取模型結構與後期優化協同推進的策略,令收斂效率及訓練吞吐量均顯著提升。綜合上述技術,新模型在編程、Agent 等真實任務場景中,能以更低單價提供高效推理服務,為企業級應用提供更具成本效益的選項。

項目規格
架構類型多模態混合專家(MoE)
總參數量千億級
激活參數60 億(6B)
N-gram Embedding 參數51B
注意力機制QSA 稀疏注意力 + GDN 混合架構
長上下文速度提升高快取命中 1M Tokens 場景下提升 8 倍以上
輸入價格RMB¥0.80 (約 HK$0)
輸出價格RMB¥2.70 (約 HK$2)
快取命中價格RMB¥0.10 (約 HK$0)

Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)