編按:本文綜合整理自 Xiaomi MiMo 官方公告、Artificial Analysis Intelligence Index、Hacker News 討論串,並加入 Siami 編輯部觀點與分析。
小米於 9 月 22 日正式開源 MiMo-V2.6 系列模型,這是繼 7 月底 V2.5 後該公司再度端出的旗艦開源作品。這次一口氣推出三個版本:MiMo-V2.6-Pro、MiMo-V2.6-Flash,以及主打「20 倍速」的 MiMo-V2.6-Pro-UltraSpeed,主打把「智慧、效率、成本」的帕雷托前緣再往外推。
官方發布:把 RL 計算規模推到極限
小米在技術報告中強調,MiMo-V2.6 標誌著他們在「可自我改進(RSI)」這條路上的關鍵節點:透過在可驗證的複雜任務上擴展強化學習計算,讓模型能不斷透過探索與回饋來擴張能力邊界。
兩個模型都原生支援全模態(Omni),並用同一套 V2.6 訓練骨幹:
- MiMo-V2.6-Pro:旗艦級,鎖定最高智慧分。
- MiMo-V2.6-Flash:在智慧、效率、成本之間取得最佳平衡。
- MiMo-V2.6-Pro-UltraSpeed:在 Pro 同等品質下,提供最高 20 倍輸出速度,給即時互動或對延遲敏感的工作流使用。
更值得注意的是,小米選擇全程直播訓練過程:MiMo-V2.6-Flash 與 MiMo-V2.6-Pro 在 6 天內各自完成 30 步 RL 訓練,約 75 萬條軌跡,成本分別是 0.85M 美元與 2.62M 美元。訓練任務的平均通過率相對提高 12%–25%,在 DeepSWE v1.1(長程軟體工程基準)上,Pro 從 58.4 上升到 72.57,整整多 14 個百分點。
為什麼這件事重要
這次發布的核心訊息不只是「再多一個開源旗艦」,而是小米展示了三件過去中國開源模型少見的事情:
- 價格凍漲、智商漲。小米明確表示 API 價格維持 V2.5 設定不變,但 Pro 在 Artificial Analysis Intelligence Index v4.3 上拿到 46.32 分,超越 Kimi K3 與 Qwen3.8 Max,成為目前最強的開源模型。
- 參數效率變態。根據 HN 評論,MiMo-V2.6-Pro 大約只有 1 兆參數,卻在多項基準上與同日推出的 Grok 4.7(2 兆參數)持平或更強。對一個需要把模型塞進部署成本的時代,這是極重要的工程訊號。
- 直播 RL 訓練。把整個訓練過程放上網路直播,包含軌跡、grader 設計、防 reward hacking 的審查機制,讓外部研究者可以直接審視,這是中國 AI 實驗室罕見的開放態度。
「把 RL 訓練全程直播」不只是公關操作,它等於告訴全世界:我們沒有在基準上作弊,這就是我們怎麼訓練的。
RL 訓練的三條擴展軸線
小米把 RL 計算沿三個軸線同時放大:
- 更大批次與更高吞吐:全非同步架構下,每次更新用 1,568 條樣本,支援到 1M context 上下文,每步消耗 35–37B tokens。
- 更多任務與更豐富環境:跨程式設計、視覺、網路安全的多任務訓練套件,讓一個能力的進步帶動另一個。
- 更多 grader 計算:透過群組內相對比較,讓長程 RL 拿到更精準、更多元的獎勵訊號,模型會傾向「更短路徑、更少 token」。
為了避免 reward hacking,他們還做了四層防禦:獎勵設計、對抗式評估、異常偵測、跨驗證器交叉檢查。對 agentic RL 在異質任務上的支援,則是用「統一軌跡表示 + 懲罰機制」+「多代理框架的高併發互動」+「控制面 / 資料面解耦」三件套來撐住。
從 Vibe Coding 到 Vibe World
MiMo-V2.6 把「程式設計能力」從純軟體工程延伸出來,主打一個新概念「Vibe World」:給定目標、腳手架與時間,模型自己建構、測試、出貨,最後產生經濟價值。原文是:
「把自然語言驅動的程式設計,從『寫軟體』延伸到『建世界』。」
具體應用場景包含:
- 遊戲開發:給一張圖、一段影片或一句話,MiMo-V2.6 把任務拆解成多個子任務,協調多個 agent 建 3D 場景、寫互動邏輯、做視覺驗證,再依渲染結果迭代修正,最後產出可跑的互動世界。
- 3D 建模:能用文字或參考圖在 Blender 生成 3D 物件與場景,供動畫、3D 列印、遊戲開發使用。
- 機器人模擬:在 embodied 環境中,模型直接吃多視角相機輸入做閉迴路決策,控制 Franka Panda 機械手臂做物件抓取、顏色配對與精準放置。
- 視覺與設計:一句話生成完整前端介面或簡報投影片,與 Figma、圖片 / 影片生成工具整合,自動保持字體、色彩、版型一致。
- 音樂創作:能寫出 demo 等級的作品,已能從 MIDI 自動轉成樂譜。
數據解讀:真的有這麼神嗎
把官方數字放進獨立驗證的框架看,可以得到幾個值得注意的觀察:
- AA Intelligence Index 46.32:確實是目前開源模型最高分,但同一份排行榜上 Opus 5 / GPT-6 Astra 都更高,差距大約 10 分以上。HN 評論對「46.32」這個分數也有人質疑,懷疑 DeepSeek-V4.1-Flash 的 39 分被低估。
- DeepSWE v1.1 +14 點:這是長程軟體工程的關鍵指標,Pro 從 58.4 上升到 72.57,這個進步幅度對工程團隊最有感。
- 價格維持 V2.5:Flash 輸入 $0.14/M、輸出 $0.28/M,Pro 是 $0.435/M 與 $0.87/M(USD per million tokens)。在開源旗艦中算親民,但有評論提醒:據傳小米對 cache hit 沒有折扣,對長 prompt 工作流可能不利。
HN 上 dom96 跑自己的 KillSwitch-Bench 1.0,拿到 Pro = 38.8 分,雖然比不上 Opus 5 的 66.9,但比 Muse Spark 1.3 的 36.5 略高。整體來看,真實工程基準比官方基準更接近現實,但也證明 MiMo-V2.6-Pro 並非「完美碾壓同級距開源模型」。
怎麼用:API、桌面、平台全線上線
MiMo-V2.6-Pro 與 MiMo-V2.6-Flash 同步在以下通路開放下載與使用:
- Xiaomi AI Studio 與 MiMo Code
- MiMo Desktop:首次正式版出 early access,預載 Pro 與 Flash;UltraSpeed 模式最高 20 倍速。
- MiMo API Platform(小米開放平台):API 價格與 V2.5 相同;Pro 也能用 UltraSpeed 模式。
- OpenRouter:已上架 Flash / Pro 兩個版本。
Token Plan 適合高用量可預測成本的使用者。Cache 寫入在限定時間內免費,人民幣計價在大陸地區另列。詳細價格與基準見官方 appendix 頁面。
Siami 觀點
這次 MiMo-V2.6 之所以引發 HN 大規模討論,關鍵不是「又一個開源模型」,而是三件事同時發生:價格不變、能力提升、訓練過程透明。當 Anthropic、xAI 還在閉門做基準檢核時,把 RL 訓練全程直播的中國實驗室反而給了社群一個「我可以親自查」的機會。
對開發者來說,最值得關注的不是 Pro 的 46.32,而是 Flash 在 $0.14/M 輸入價位上的實際表現——它代表「每天可以跑 100 萬 tokens 不用心疼」這個心理門檻再次被中國開源模型推低。對企業決策者,參數效率這件事比「誰分數最高」更值得長期追蹤:1 兆參數能做到 2 兆的效果,這條曲線若持續下去,硬體部署成本會快速下降。
最後要提醒:任何開源旗艦的真正價值,都要在真實工作流裡跑 30 天才知道。AA Index 是單一視角,HN 上 dom96 與 user43928 已經丟出了自己跑的數據——這些比官方附錄更值得讀。
網友熱門留言 (5)