中國人工智能模型成本優勢明顯 DeepSeek V4 Flash 成為全球最經濟選擇

中國人工智能模型正以驚人的速度縮小與 OpenAIAnthropic 等前沿模型的性能差距,同時在「性能比」(即任務成本)這一關鍵指標上展現出壓倒性優勢。近日,根據獨立 AI 模型評估平台 Artificial Analysis(AA)發布的數據,在全球前 20 大 AI 模型中,DeepSeek V4 Flash 以單任務僅 3 美分的成本成為最經濟的選擇。

中國 AI 模型在全球市場中取得顯著進展

長期以來,中國 AI 模型以低價策略參與市場競爭。然而,隨著近期月之暗面 Kimi K3、阿里巴巴 Qwen 3.8 Max 等模型的發布,中國模型已批量進入 AA 模型綜合智能指數前 10 名。若將範圍擴大至前 20 名,上月底發布的 DeepSeek V4 Flash 同樣名列其中。在智能指數 60 分以上的頂級模型中,唯一上榜的開放權重模型是月之暗面 Kimi K3(60 分)。Kimi K3 與當前智能指數排名第一的 Claude Opus 5(63 分)僅差 3 分,與 GPT-5.6 Sol 僅差 1 分,而其任務成本僅為 84 美分,在前沿模型中屬於較低水平。

在 AI 模型成本評估中,令牌單價並非全貌。推理模型在回答前會消耗大量內部「思考」令牌,因此即便令牌單價低廉,單任務的總體成本仍可能偏高。「任務成本」更能反映企業實際支出——即完成特定工作所需的總令牌消耗量。DeepSeek V4 Flash 的智能指數為 52 分,與 OpenAI GPT-5.6 Luna(max 模式)持平,而任務成本僅 3 美分,略低於後者的 5 美分。更為關鍵的是,DeepSeek V4 Flash 的首字響應時間(TTFT)為 1.17 秒,端到端響應時間為 19.49 秒;而 GPT-5.6 Luna(max)的 TTFT 長達 135 秒以上。

兩者智能指數和任務成本相近,但 DeepSeek 的響應速度優勢極為顯著。

企業對 AI 模型的需求持續增長

在響應速度的對比中,Claude Opus 5 表現突出:TTFT 為 5.92 秒,端到端響應時間僅 14.68 秒,整體耗時僅為同級模型的四分之一。此外,DeepSeek V4 Flash 為開放權重模型(MIT 許可證),允許企業自行託管;而 GPT-5.6 Luna 僅為 API 專用。這一差異在實際部署中可能對開發者的選擇產生重要影響。

阿里巴巴新發布的 Qwen 3.8 Max 擁有 2.4 萬億參數,智能指數達 58 分,位列第 10,印證了阿里巴巴「歷代最強 Qwen」的説法。但其任務成本為 US$1.13 (約 HK$9),高於同級別競品。在 1 美分任務成本區間,GPT-5.6 Luna(low 模式)、MiMo-V2.5 和 Llama 4 Scout 均位列其中。其中 MiMo-V2.5(智能指數 37 分)在同價位模型中性價比最高。

企業 AI 支出的快速增長正成為行業普遍現象。據《福布斯》5 月報導,Uber 因開發人員對 Anthropic Claude Code 的使用量激增,2026 年全年 AI 預算在 4 月份即全部耗盡。約 5000 名工程師組成的組織中,Claude Code 的快速普及使 AI 支出遠超預期,Uber 隨後為每位員工設定了每月 US$1,500 (約 HK$11,700)的代理式編程工具使用上限。Amazon 也面臨類似困境,其內部 AI 項目利用 Anthropic Claude Sonnet 進行商品列表與作者信息比對,項目成本超出原始預算 860%,達到約 180 萬美元。

更大的問題在於,令牌使用帶來的成本增長在長達 5 個月內未被及時發現。

隨著 AI 模型在企業內部快速擴散,尤其是向代理式功能和推理型任務轉型,AI 令牌成本正急劇攀升。模型開發商紛紛通過降低令牌單價或引入「提示緩存」技術來應對,但緩存命中後仍需付費,且上下文越長累計成本越高。緩存失效(如對話間隔超過 5 分鐘、修改歷史消息)將導致費用按原價重新計算。AA 的智能指數是一個複合指標,綜合了多項評估的加權結果。任務成本則基於每個模型在多項評估中實際消耗的令牌量(含輸入、緩存命中、緩存寫入、推理、輸出)乘以令牌單價計算得出。

需要指出的是,該指標以編碼、數學、科學和代理式任務為基準,不適用於純翻譯、聊天機器人或一般辦公場景。

想睇更深入嘅 AI 模型與工程科技報道?
前往 The Base Principle 繁體中文 AI 新聞 →
Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)