DeepSeek 最近推出了新一代 AI 模型 V4.1-Flash。根據官方介紹,雖然 V4.1-Flash 的總參數規模和激活參數均低於 V4-Pro,但在性能、推理速度和成本控制方面的表現更為突出,特別是在智能體和編程相關任務上,部分基準測試成績超過 V4-Pro 及 GPT-5.6 Sol 等前沿模型。
DeepSeek V4.1-Flash 在性能和成本方面表現優越
DeepSeek 指出,V4.1-Flash 採用專家混合架構,總參數為 5520 億,輸入階段激活參數為 80 億,輸出階段則為 160 億。相比之下,上一代 V4-Flash 總參數為 2840 億,而 V4-Pro 總參數則達到 1.6 萬億。該模型的一項主要改進是大幅壓縮 KV 緩存,緩存佔用降至每個 token 約 890 字節,同時輸出速度達到每秒約 214.4 個 token,首個 token 響應時間為 1.13 秒。
獨立評測機構 AA 給出了「速度顯著較快」的評價。
在性能方面,DeepSeek 表示 V4.1-Flash 在高推理強度設置下,於終端操作、代碼修復和自動化任務等測試中領先於 GPT 5.6 Sol 和 Claude Opus 5。不過,在更廣泛的高難度通用推理任務中,該模型的成績則相對一般。AA 的數據顯示,V4.1-Flash 的綜合智能指數為 40 分,高於多數同類開源權重模型的中位水平,但仍低於頭部前沿模型。
需要注意的是,AA 近期升級了評測體系,整體評分標準明顯收緊,不少高分模型的分數也出現下調。
在價格方面,AA 的數據顯示,V4.1-Flash 每 100 萬輸入 token 價格為 US$0.30 (約 HK$2),每 100 萬輸出 token 價格為 US$1.20 (約 HK$9),綜合成本約 US$0.18 (約 HK$1),低於同檔模型的中位數。若命中緩存,價格可進一步降至每 100 萬 token US$0.01 (約 HK$0)。AA 同時指出,該模型回答偏長,評測中輸出 token 總量明顯高於同類模型,可能對實際使用中的時間和費用帶來影響。
在技術層面,V4.1-Flash 引入名為 CED 的新結構,將 40 層 Transformer 拆分為 20 層因果編碼器和 20 層解碼器,減少傳統交叉注意力帶來的重複計算,並結合 CSA2、FP4 量化等方法壓縮緩存與內存佔用。整體來看,DeepSeek 此次更新重點放在智能體執行、代碼能力和部署成本的優化上。

