阿里推出 Qwen3.8-Max 目標成為連續工作的 AI 同事

過去兩年,我們判斷一個大型模型的強度,往往會詢問:它能否回答複雜問題,數學推理表現如何,代碼的準確性又如何。然而,隨著模型能力逐漸逼近,新的問題已經轉變為:如果人不再守在旁邊,它是否能夠持續完成一項任務?這不僅僅是生成幾段代碼或提供一份看似完整的方案,而是能夠自行拆解任務、調用工具、檢查結果,並在遇到錯誤後重新調整,最終交付一個真正可用的成果。這正是阿里新一代旗艦模型 Qwen3.8-Max 所要解答的問題。

8 月 3 日,Qwen 團隊正式發布了 Qwen3.8-Max。該模型擁有 2.4 萬億的總參數,是目前規模最大的千問模型;但相比這個驚人的數字,更值得關注的是它將升級重點放在了自主編程、專業工作、科學研究、原生多模態和長週期任務上。換句話説,Qwen3.8-Max 不僅想成為一個更聰明的聊天機器人,還想成為一個能夠持續工作的 AI 同事。

Qwen3.8-Max 採用混合專家架構,即 MoE。儘管模型總參數達到 2.4 萬億,但每次處理任務時,僅會激活其中約 950 億參數,相當於總規模的 4% 左右。這並不意味著剩下的參數沒有作用,而是模型會根據當前內容選擇不同的專家模塊參與計算。相比每次都調用全部參數,這種設計能夠在擴大模型容量的同時,儘可能控制推理成本和響應速度。因此,2.4 萬億代表的是 Qwen3.8-Max 能夠容納的知識與能力規模,而 950 億激活參數則更接近一次實際推理需要動用的計算量。

即便採用 MoE,Qwen3.8-Max 也不是普通用户可以輕易部署在個人電腦上的模型。僅按照 4bit 精度粗略計算,完整權重就需要約 1.2TB 存儲空間,尚未計算運行時產生的額外開銷。未來開放權重後,它主要仍將面向雲服務商、研究機構和擁有大型計算集羣的企業。更適合個人和中小團隊部署的,可能是官方同時預告的 Qwen3.8-27B。

Qwen3.8-Max 的多模態能力與長上下文處理

Qwen3.8-Max 是一款原生多模態模型,能夠同時接收文字、圖片和視頻,並輸出文字結果。它擁有 100 萬 Token 上下文窗口,QwenCloud 公佈的實際規格為最高約 99.1 萬 Token 輸入;開啟思考模式後約為 98.3 萬 Token,單次最多可以輸出約 13.1 萬 Token。這意味著它能夠一次性讀取大型代碼倉庫、數百頁的行業報告、成批的法律文件,甚至較長的視頻內容,而無需頻繁地切割、摘要和重新拼接上下文。

當然,上下文更長並不代表模型會自動記住其中的每一個細節。真正重要的是,它能否在長上下文中找到與當前任務相關的信息,並在多輪操作後維持目標、狀態和約束的一致性。

這也是 Qwen3.8-Max 最核心的一次升級:它不僅能夠讀得更多,還試圖工作得更久。Qwen3.8-Max 還被要求從零復現一篇機器學習論文。官方表示,在沒有現成代碼和實驗流程的情況下,模型連續工作約 125 小時,編寫約 7600 行代碼,完成 1100 多次操作和 33 輪 GPU 訓練。它首先復現了論文中的 6 項主要結論,隨後又花費約 88 小時測試 18 種新思路,最終提出的方法在 AIME24 數學評測上比原論文方案提高了 2.7 個百分點。

另一個芯片設計實驗則持續約 500 輪交互和 71 次評估。模型將一套加密電路從最初的 8298 個邏輯門,逐步壓縮至 678 個邏輯門,並在每一輪中根據仿真、綜合與時序結果調整設計。這些案例共同指向了一種能力:模型不再僅僅根據已有信息給出答案,而是能夠提出假設、執行實驗、獲得反饋,再利用新結果修改下一步行動。這也是「長週期任務」真正困難的地方,一次回答錯誤了,可以重新提問;但一個運行幾百輪的智能體,只要早期出現一個沒有被發現的錯誤,後續所有努力都可能建立在錯誤基礎上。

模型必須學會檢查、回退和重新規劃,而不僅僅是一直向前生成內容。

Qwen3.8-Max 的專業應用與性能測試

“Coding and Cowork” 是 Qwen 團隊為 Qwen3.8-Max 設定的核心方向。這裡的 Cowork 並不是簡單地寫文檔、做總結,而是讓模型進入法律、金融、醫療、設計和數據分析等專業流程,最終交付能夠繼續使用的文件或成果。在這個過程中,Qwen3.8-Max 的視覺能力也不再僅僅是識別一張圖片。例如,在製作網頁、PPT 或三維場景時,模型可以先生成內容,再查看實際渲染結果,識別文字溢出、排版錯位或視覺效果不符合要求的問題,隨後返回代碼和工具進行修改。

視覺由一次性的輸入,變成了貫穿規劃、執行和檢查過程的反饋通道。這可能比單純提高圖片問答分數更加重要。因為人類使用電腦時,本來就是一邊操作、一邊觀察結果,再決定下一步做什麼。只有視覺真正進入行動循環,多模態模型才有機會從「看懂圖片」走向「使用電腦完成工作」。從 Qwen 團隊公佈的測試結果來看,Qwen3.8-Max 已經進入當前第一梯隊,但它並沒有在所有項目上取得第一名。

在考察終端環境操作能力的 Terminal-Bench 2.1 中,Qwen3.8-Max 得到 86.6 分,高於 Claude Opus 4.8 和 Claude Fable 5 的 84.6 分,但仍略低於 GPT-5.6 Sol 的 88.8 分。

在考察論文復現能力的 PaperBench 中,它得到 93.0 分,是官方比較模型中的最高成績;GPQA Diamond 為 92.6 分,也處於第一梯隊。但在更加貼近大型代碼倉庫維護的 SWE-bench Pro 上,Qwen3.8-Max 得到 67.7 分,低於 Claude Fable 5 的 80.0 分;FrontierSWE 成績為 73.5 分,同樣落後於後者的 88.8 分。

這些成績顯示,Qwen3.8-Max 在終端操作、研究復現、工具使用和長週期任務上表現突出,但並不能簡單概括為「全面超過所有模型」。不同測試使用的智能體框架、工具權限、上下文長度和嘗試次數也可能影響最終成績。

模型發布後,Qwen3.8-Max 成為當時排名最高的中國文本模型,並在視覺模型榜單中位列全球第二,僅落後一款 Claude Fable 5 版本。不過公開榜單變化迅速,這更適合作為模型進入全球第一梯隊的證明,而不是永久不變的排名。

Qwen3.8-Max 的定價與開放計劃

在海外 QwenCloud 平台上,Qwen3.8-Max 的 API 價格為每百萬 Token 輸入 US$2 (約 HK$16)、輸出 US$6 (約 HK$47),隱式緩存命中價格為每百萬 Token US$0.25 (約 HK$2)。開發者可以通過 qwen3.8-max 這一模型名稱調用,並使用函數調用、結構化輸出、上下文緩存以及內置搜索工具。普通用户則可以直接通過 Qwen Studio 體驗,Qoder 和 Qwen Code 等編程工具也已經開始接入。

更值得關注的是,Qwen 團隊宣佈將在正式發布後的一週內開放 Qwen3.8-Max 權重,同時還將發布 Qwen3.8-27B 開放權重模型,這將是千問 Max 級旗艦模型首次走向開放權重。但「開放權重」並不完全等同於「完全開源」。模型權重可以下載,但並不意味著訓練數據、完整訓練流程和所有工程代碼都會公開。截至 8 月 4 日,Qwen3.8-Max 的具體許可證和最終模型卡仍有待正式發布。

Qwen3.8-Max 真正值得關注的地方,不是 2.4 萬億參數,也不是某一張跑分表上的第一名。它代表著大型模型競爭正在發生一次轉向。過去,我們希望 AI 能把一道題回答得更好;現在,我們開始要求它接過一個目標,在數百次操作、幾個工具和不斷變化的結果之間,真正完成任務。當然,一次連續 16 天的官方演示,並不意味著企業已經可以放心地將生產系統完全交給 AI。

權限控制、錯誤回滾、過程審計、成本管理和人工確認,仍然決定了一個智能體能否真正投入使用。官方展示的長週期案例和跑分,也需要更多第三方復現與真實業務驗證。

但至少,下一輪競爭的方向已經變得清晰。未來決定一個模型價值的,可能不再只是它在分鐘內能給出多聰明的答案,而是在離開人類的持續提醒後,它還能可靠地工作多久。當 AI 從回答問題走向承擔任務,我們距離真正的「數字同事」,或許又近了一步。

項目規格
總參數2.4 萬億
激活參數950 億
存儲空間約 1.2TB
上下文窗口100 萬 Token
輸入 Token約 99.1 萬 Token
輸出 Token約 13.1 萬 Token
連續工作時間約 125 小時
編寫代碼行數約 7600 行
GPU 訓練輪數33 輪

想睇更深入嘅 AI 模型與工程科技報道?
前往 The Base Principle 繁體中文 AI 新聞 →
Henderson
Henderson

Henderson 是 TechRitual Hong Kong 科技編輯,專注報導智能手機、消費電子產品、SIM 卡及流動通訊市場。自加入 TechRitual 以來,累計撰寫數千篇科技報導及產品評測,內容同步發佈至 SINA 及 Yahoo Tech 等主要平台。

友情網站:日本語版 / TechNipponThe Base Principle(AI・工程)