編按:本文綜合整理自 WSJ / Morningstar、South China Morning Post、阿里巴巴 Qwen 官方部落格,並加入 Siami 編輯部觀點與分析。
阿里巴巴週二(6/16)正式推出 Qwen-Robot Suite——這是該公司第一個專為機器人設計的「實體 AI(Embodied AI)」基礎模型套件,把 AI 從聊天視窗推進真實世界。這套模型由阿里巴巴旗下 AI 研究單位 通義實驗室(Tongyi Lab) 開發,已在精選的阿里雲企業客戶端進入實機試點階段。
為什麼這件事重要
對 Siami 編輯部來說,Qwen-Robot Suite 的發布有三個值得關注的層面:
第一,這是中國大型科技公司在 Physical AI(物理 AI)領域的正式表態。過去一年「embodied intelligence」(具身智慧)這個詞在矽谷從論文 buzzword 變成資本市場關鍵字,NVIDIA 用 Alpamayo、Google 用 Gemini Robotics,特斯拉 Optimus、Figure 都在搶同一塊餅。阿里巴巴這次直接把「手、腳、腦」拆成三個獨立模型,等於宣告:中國大模型廠不只跟你拚 chatbot,也要跟你拚實體機器人。
第二,整套模型都用 Qwen 3.5-4B 作為骨幹。也就是說,整個 embodied AI 棧跟阿里巴巴既有的語言模型家族綁在同一棵樹上,這對開發者意味著「同一套 fine-tune 工具鏈、同一套推論基礎設施」可以延伸到機器人應用。
第三,Alibaba 的雲端 CEO 吳泳銘(Eddie Wu) 今年稍早已公開表示,AI 相關產品營收將成為雲端部門的主要成長引擎。Qwen-Robot Suite 的客戶端試點基本上是 「拿機器人客戶當驗證場」,未來要把整套方案打包賣給製造業、倉儲、汽車、無人機這些實體產業。
整套套件的三大核心模型
Qwen-Robot Suite 把機器人智慧拆成三層互聯的子模型:
- Qwen-RobotManip — 視覺-語言-動作(VLA)模型,負責精細操控,直接把自然語言指令轉成動作軌跡輸出,讓機械手臂在非結構化環境中突破操作天花板。底層架構是 Qwen3.5-4B。
- Qwen-RobotNav — 視覺-語言導航(VLN)模型,負責空間感知與路徑規劃,強化移動型機器人的空間理解與決策迴圈。
- Qwen-RobotWorld — 影片世界模型,模擬「接下來物理場景會怎麼變」,讓機器人在實際行動前先在內部跑一次「預演」。
官方部落格用了一個很直覺的比喻:這套組合等於給機器人 「靈巧的手(Manip)、找路的腳(Nav)、會思考的腦(World)」。Qwen-RobotWorld 的關鍵設計是 自然語言動作介面——把視覺-語言表徵空間橋接到世界動態模型,單一世界模型就能預測操作、駕駛、導航三種場景下「物理上合理」 的未來。
數據解讀
這次發布的 規模訊號 值得拆開來看:
- 官方釋出 90+ 段展示影片(操作、駕駛、導航三大類),單一世界模型支援 20+ 種硬體形態——這個跨硬體抽象層次,比 NVIDIA Alpamayo 還要廣。
- Pilot testing 對象是「精選阿里雲企業客戶」——不是開源、不是對外公開 API。跟 Qwen3 系列那種「Apache 2.0 + Hugging Face + ModelScope」三平台齊發完全不同調。
- 整套硬體跑在 NVIDIA Jetson Thor 上,dev kit 從 3,000 美元起跳。這等於把開發者門檻壓在邊緣運算市場的中高階,但離「消費級家庭機器人」還有距離。
- HN 討論度 200 分、37 則留言,比 SpaceX-Cursor 600 億美元併購案的討論熱度明顯低——但留言品質偏技術工程導向,多則來自真正在做機器人的開發者,這種「安靜但扎實」的關注度往往是產業落地的前兆。
質疑
Qwen-Robot Suite 的技術敘事很漂亮,但 Siami 編輯部看到至少三個 真正的問號:
第一,模型沒開源。Qwen3 系列(LLM、VLM、Coder)幾乎都走 Apache 2.0 + GitHub 公開,但 Qwen-Robot Suite 目前看起來是 封閉權重 + 企業客戶試點。如果通義實驗室要走「跟 NVIDIA 一樣的硬體 + 模型垂直整合」商業模式,那開發者社群能從中得到什麼?只有 SDK 沒有 fine-tune 權重,本質上是把整個機器人 AI 棧綁在阿里雲上。
第二,沒給真實部署的失敗案例。官方 90 段影片都是 「成功 demo」——機械手臂夾草莓、RobotNav 走迷宮、世界模型預測下一秒的物理變化。但這類影片從 Boston Dynamics 到特斯拉 Optimus 大家都會拍,「真實世界的 1% 失敗率怎麼處理」才是 production 的關鍵,官方完全沒提。
第三,TAM 敘事 vs 現實差距。HN 留言講到「機器人市場比寫程式大 10 倍」聽起來很爽,但別忘了 2026 年的家用機器人本體成本還是 1.5 萬美元起跳。就算 Qwen 模型再強,硬體、電池、感測器、組裝、維修的成本結構,沒有任何一家 AI 公司能單獨解決。「AI 改變世界」的說法,跟「明年你家就有掃地機器人以外的機器人」之間,差了至少 5-8 年的硬體迭代週期。
戰略意義
把 Qwen-Robot Suite 放回更大的地緣脈絡看:
- 中國大模型廠(阿里、字節、騰訊、Moonshot、MiniMax)在 語言模型 戰場已經打成紅海,接下來 18 個月的決勝點就是 誰能把模型塞進物理裝置。
- 美國這邊 NVIDIA + Google + Tesla + Figure 各自有盤算,沒有任何一家有「完整 LLM → VLA → VLN → World Model」四層一條龍——這是 Qwen 系列的差異化機會。
- 對台灣讀者來說,最值得追蹤的是 「Qwen-Robot 會不會開始對接台灣的機械手臂、AGV、AMR 廠商」。上銀、台達電、達明、研華、凌華這些本來就做機器人關鍵零組件的公司,未來 12 個月內會不會變成阿里通義實驗室的硬體合作夥伴,將是觀察重點。
後續觀察清單
- 是否在 Hugging Face / ModelScope 開源權重(跟 Qwen3 系列同等待遇)
- 是否有台灣機械手臂 / AMR 廠商進入 pilot 客戶名單
- NVIDIA Jetson Thor dev kit 的供貨狀況(會不會跟 DGX Spark 一樣搶不到)
- 阿里雲有沒有把 Qwen-Robot 包成 「含硬體的 Qwen-Robot-as-a-Service」 月租方案
- 中國政府監管(特別是「具身智慧」在《生成式 AI 服務管理辦法》下的合規路徑)
延伸閱讀:
網友熱門留言 (4)