小米正式發佈並開源 Xiaomi MiMo-V2.6 系列,這是小米在探索 RSI(遞歸自我改進)路徑上的關鍵一步。該系列以可驗證的複雜任務為基礎,規模化擴展強化學習(RL)算力,使模型能在持續的探索與反饋中不斷拓展智能邊界。MiMo-V2.6 系列包含 Pro 和 Flash 兩個原生全模態模型。MiMo-V2.6 得益於 RL 算力的擴展,MiMo-V2.6-Pro 在人工分析智能指數(AA 綜合智能指數)中取得 46 分,超越 Kimi K3 和 Qwen 3.8 Max,成為目前最強的開源模型;
然而,與最強的閉源模型 Claude Fable 5.1 和 GPT-6 Astra 相比,仍有一定差距。
MiMo-V2.6 系列沿用 V2.5 系列的 API 定價,智能提升的同時價格保持不變,進一步推進了“智能-成本”的帕累託前沿。MiMo-V2.6-Pro 刷新了國產模型的性價比紀錄:在同等智能水平下,價格僅為海外模型的 1/20 至 1/60。
MiMo-V2.6 系列在強化學習訓練中表現卓越
在 RL 訓練階段,MiMo-V2.6 可能是目前國產開源模型中投入算力最多的模型之一。經過大規模、多任務的強化學習訓練,MiMo-V2.6-Pro 在多數 Agent Benchmark 上取得了比肩 Claude Opus 5 和 GPT-5.6 Sol 的效果,而 MiMo-V2.6-Flash 則全面超越 MiMo-V2.5-Pro。歷時不到 6 天,MiMo-V2.6-Flash 與 MiMo-V2.6-Pro 的訓練成本分別約為 85 萬與 262 萬美元,各完成 30 步,累計約 75
萬條軌跡;訓練任務的平均通過率分別相對提升 25% 和 12%,樣本外的長程軟件工程評測基準 DeepSWE v1.1 分別提升約 17 分(48.8 → 65.68)和約 14 分(58.4 → 72.57),展現出 RL 更高的樣本效率、持續改進能力和樣本外的泛化能力。
此次訓練主要從三個維度擴展 RL 算力:更大的 Batch 與更高吞吐,結合大 Batch 和全異步架構,單次更新使用 1,568 個樣本,支持 1M 上下文長度訓練,單步訓練 Token 達 2.7 至 3.7B;更多任務與複雜環境,構建覆蓋 Code、General、Visual、Cyber 等方向的多任務訓練體系,並混合多個 Harness;更大的 Grader 算力,通過 Group 內相對比較,為 Long-Horizon RL 任務提供更精確、多樣的獎勵信號,形成模型自我改進閉環。
隨著訓練規模擴大,小米凍結 MoE Router 以抑制專家負載漂移,並建立覆蓋獎勵設計、對抗性評測、異常檢測和驗證器交叉校驗的 Reward Hacking 防線。為支撐大規模混合任務的智能體強化學習,團隊設計了統一的軌跡表示與懲罰機制,支撐多種智能體框架的高並發交互,解耦控制面與數據面以支持海量軌跡的遷移,在混合批次中穩定各任務的樣本配比,並優化訓練與推理引擎的效率及一致性。
小米已開源上述技術成果及配套資源,包括完整技術報告、訓練環境與 RL 代碼。
MiMo-V2.6 融合了 3D 空間推理、多模態感知與計算機操作(CUA)能力,進一步拓展了編程所能觸及的邊界,可將自然語言驅動的編程任務拓展為面向交互世界構建的“Vibe World”。在 3D 開放世界遊戲中,使用者輸入圖片、影片或文字後,MiMo-V2.6 會將需求拆解為多個任務,由多智能體協作完成遊戲 3D 場景搭建、交互邏輯編寫與視覺驗證,並根據渲染結果不斷修正,最終生成符合使用者意圖的可運行交互世界。
在 Blender 3D 建模中,MiMo-V2.6 能夠根據使用者的文字描述或參考圖片,在 Blender 中完成物體與場景的三維建模,生成可用於動畫製作、3D 打印與遊戲開發的 3D 資產。在具身智能方面,MiMo-V2.6 在具身仿真環境中可直接以多視角相機畫面為輸入,持續進行推理與決策,並通過視覺反饋閉環控制 Franka Panda 機械臂,完成物體抓取、顏色匹配與精準放置。
在 Computer Use Agent 方面,MiMo-V2.6 將多模態感知與原生訓練的行動能力相結合,可理解複雜圖形界面,使用常見辦公與生產力工具,完成資訊檢索、編輯和數據處理等任務,並根據視覺反饋檢查結果、排查問題、調整後續行動。
MiMo-V2.6-Pro 協助研究人員完成材料設計與計算篩選,提出了數種金屬有機框架(MOF)材料的設計方案,目標是吸附被稱為“永久性污染物”的全氟和多氟烷基物質(PFAS),並調用開源計算工具開展“幹實驗”,計算設計出的 MOF 材料與 PFAS 之間的結合強度,篩選出最有潛力的候選材料。在形式化數學證明方面,MiMo-V2.6-Pro 協助研究員在 Lean 4 中完成了 Li–Yorke 經典論文《週期三蘊含混沌》原始主定理的完整形式化,項目最終形成 6000 餘行 Lean 代碼,完整證明通過
Lean 核心核驗,無未完成證明佔位。
MiMo-V2.6 系列大幅提升了模型創建精美數字產品的能力,涵蓋前端網頁、Figma 設計稿、幻燈片、SVG、影片、音樂等。在設計評測榜單 Design Arena 上,MiMo-V2.6-Pro 取得了與 Claude Opus 5、GPT-5.6 Sol 相近的水平。MiMo-V2.6 可將簡單指令轉化為完整的前端界面和 PPT,熟練運用 Figma 和圖像/影片生成工具;在影片創作中,能端到端完成視覺設計、鏡頭與動效編排、配樂合成及節奏卡點,並調用 MiMo-V2.5-TTS 合成旁白;在音樂創作中,
MiMo-V2.6-Pro 根據要求創作了一首包含約十種樂器的管絃樂作品,完成樂譜生成後自主將其轉換為 MIDI。
小米全面開源 MiMo-V2.6-Pro、Flash 模型權重與技術報告,同步開放 MiMo-V2.6-Distill-Qwen-9B 及配套 RL 研究資源。開源內容包括:7k+ 高質量 RL 任務環境,覆蓋軟件工程、漏洞複現、知識型工作、網頁設計開發四類智能體任務;端到端 RL 訓練框架,基於 verl、uni-agent 和 mini-swe-agent;輕量可組合的 Harness,開源極簡 mini-harnesses。
使用方面,MiMo Desktop 桌面客戶端及會員訂閱方案同步上線,MiMo-V2.6 系列已上線 Xiaomi MiMo 開放平台,API 價格維持不變。MiMo-V2.6-Pro 於開放平台提供 UltraSpeed 超高速模式可選,提供最高 20 倍的輸出速度。

