← 返回 Siami 首頁

阿里巴巴 Qwen-Robot Suite 亮相:三模型齊發,要把 AI 從聊天框搬進現實世界

▲ 174 💬 37
阿里巴巴 Qwen-Robot Suite 亮相:三模型齊發,要把 AI 從聊天框搬進現實世界

編按:本文綜合整理自 WSJ / MorningstarSouth China Morning Post、阿里巴巴 Qwen 官方部落格,並加入 Siami 編輯部觀點與分析。

阿里巴巴週二(6/16)正式推出 Qwen-Robot Suite——這是該公司第一個專為機器人設計的「實體 AI(Embodied AI)」基礎模型套件,把 AI 從聊天視窗推進真實世界。這套模型由阿里巴巴旗下 AI 研究單位 通義實驗室(Tongyi Lab) 開發,已在精選的阿里雲企業客戶端進入實機試點階段。

為什麼這件事重要

對 Siami 編輯部來說,Qwen-Robot Suite 的發布有三個值得關注的層面:

第一,這是中國大型科技公司在 Physical AI(物理 AI)領域的正式表態。過去一年「embodied intelligence」(具身智慧)這個詞在矽谷從論文 buzzword 變成資本市場關鍵字,NVIDIA 用 Alpamayo、Google 用 Gemini Robotics,特斯拉 Optimus、Figure 都在搶同一塊餅。阿里巴巴這次直接把「手、腳、腦」拆成三個獨立模型,等於宣告:中國大模型廠不只跟你拚 chatbot,也要跟你拚實體機器人。

第二,整套模型都用 Qwen 3.5-4B 作為骨幹。也就是說,整個 embodied AI 棧跟阿里巴巴既有的語言模型家族綁在同一棵樹上,這對開發者意味著「同一套 fine-tune 工具鏈、同一套推論基礎設施」可以延伸到機器人應用。

第三,Alibaba 的雲端 CEO 吳泳銘(Eddie Wu) 今年稍早已公開表示,AI 相關產品營收將成為雲端部門的主要成長引擎。Qwen-Robot Suite 的客戶端試點基本上是 「拿機器人客戶當驗證場」,未來要把整套方案打包賣給製造業、倉儲、汽車、無人機這些實體產業。

整套套件的三大核心模型

Qwen-Robot Suite 把機器人智慧拆成三層互聯的子模型:

  • Qwen-RobotManip — 視覺-語言-動作(VLA)模型,負責精細操控,直接把自然語言指令轉成動作軌跡輸出,讓機械手臂在非結構化環境中突破操作天花板。底層架構是 Qwen3.5-4B
  • Qwen-RobotNav — 視覺-語言導航(VLN)模型,負責空間感知與路徑規劃,強化移動型機器人的空間理解與決策迴圈。
  • Qwen-RobotWorld — 影片世界模型,模擬「接下來物理場景會怎麼變」,讓機器人在實際行動前先在內部跑一次「預演」。

官方部落格用了一個很直覺的比喻:這套組合等於給機器人 「靈巧的手(Manip)、找路的腳(Nav)、會思考的腦(World)」。Qwen-RobotWorld 的關鍵設計是 自然語言動作介面——把視覺-語言表徵空間橋接到世界動態模型,單一世界模型就能預測操作、駕駛、導航三種場景下「物理上合理」 的未來。

數據解讀

這次發布的 規模訊號 值得拆開來看:

  • 官方釋出 90+ 段展示影片(操作、駕駛、導航三大類),單一世界模型支援 20+ 種硬體形態——這個跨硬體抽象層次,比 NVIDIA Alpamayo 還要廣。
  • Pilot testing 對象是「精選阿里雲企業客戶」——不是開源、不是對外公開 API。跟 Qwen3 系列那種「Apache 2.0 + Hugging Face + ModelScope」三平台齊發完全不同調。
  • 整套硬體跑在 NVIDIA Jetson Thor 上,dev kit 從 3,000 美元起跳。這等於把開發者門檻壓在邊緣運算市場的中高階,但離「消費級家庭機器人」還有距離。
  • HN 討論度 200 分、37 則留言,比 SpaceX-Cursor 600 億美元併購案的討論熱度明顯低——但留言品質偏技術工程導向,多則來自真正在做機器人的開發者,這種「安靜但扎實」的關注度往往是產業落地的前兆

質疑

Qwen-Robot Suite 的技術敘事很漂亮,但 Siami 編輯部看到至少三個 真正的問號

第一,模型沒開源。Qwen3 系列(LLM、VLM、Coder)幾乎都走 Apache 2.0 + GitHub 公開,但 Qwen-Robot Suite 目前看起來是 封閉權重 + 企業客戶試點。如果通義實驗室要走「跟 NVIDIA 一樣的硬體 + 模型垂直整合」商業模式,那開發者社群能從中得到什麼?只有 SDK 沒有 fine-tune 權重,本質上是把整個機器人 AI 棧綁在阿里雲上。

第二,沒給真實部署的失敗案例。官方 90 段影片都是 「成功 demo」——機械手臂夾草莓、RobotNav 走迷宮、世界模型預測下一秒的物理變化。但這類影片從 Boston Dynamics 到特斯拉 Optimus 大家都會拍,「真實世界的 1% 失敗率怎麼處理」才是 production 的關鍵,官方完全沒提。

第三,TAM 敘事 vs 現實差距。HN 留言講到「機器人市場比寫程式大 10 倍」聽起來很爽,但別忘了 2026 年的家用機器人本體成本還是 1.5 萬美元起跳。就算 Qwen 模型再強,硬體、電池、感測器、組裝、維修的成本結構,沒有任何一家 AI 公司能單獨解決。「AI 改變世界」的說法,跟「明年你家就有掃地機器人以外的機器人」之間,差了至少 5-8 年的硬體迭代週期

戰略意義

把 Qwen-Robot Suite 放回更大的地緣脈絡看:

  • 中國大模型廠(阿里、字節、騰訊、Moonshot、MiniMax)在 語言模型 戰場已經打成紅海,接下來 18 個月的決勝點就是 誰能把模型塞進物理裝置
  • 美國這邊 NVIDIA + Google + Tesla + Figure 各自有盤算,沒有任何一家有「完整 LLM → VLA → VLN → World Model」四層一條龍——這是 Qwen 系列的差異化機會。
  • 對台灣讀者來說,最值得追蹤的是 「Qwen-Robot 會不會開始對接台灣的機械手臂、AGV、AMR 廠商」。上銀、台達電、達明、研華、凌華這些本來就做機器人關鍵零組件的公司,未來 12 個月內會不會變成阿里通義實驗室的硬體合作夥伴,將是觀察重點。

後續觀察清單

  • 是否在 Hugging Face / ModelScope 開源權重(跟 Qwen3 系列同等待遇)
  • 是否有台灣機械手臂 / AMR 廠商進入 pilot 客戶名單
  • NVIDIA Jetson Thor dev kit 的供貨狀況(會不會跟 DGX Spark 一樣搶不到)
  • 阿里雲有沒有把 Qwen-Robot 包成 「含硬體的 Qwen-Robot-as-a-Service」 月租方案
  • 中國政府監管(特別是「具身智慧」在《生成式 AI 服務管理辦法》下的合規路徑)

延伸閱讀

網友熱門留言 (4)

#1 HN@w10-1 0
機器人的 TAM(可觸及市場)比寫程式或服務大太多了,單看製造業跟軍工就戰略價值爆表。Qwen 這套『手、腳、腦』分層設計看起來很工程化,外部人看來今年就能開始拼整合系統,明年有簡單產品問世也不意外。但奇怪的是,HN 上 SpaceX-Cursor 600 億美元併購有幾百則討論,這篇卻沒什麼人嚴肅評估。
#2 HN@martythemaniak 0
這架構跟我自己在做的除雪機器人思路一模一樣:一個通用 LLM 看場景拆任務,然後把 RobotNav、RobotManip 當工具呼叫,harness 負責管理 context 跟迴圈。差別是他們沒開源權重也沒給訓練腳本,根本沒辦法直接用。而且模型對邊緣硬體還是太大太貴,光資料蒐集、HITL、微調、評測就要再花幾個月,更別說還得加一層安全系統才敢上線。
#3 HN@trilogic 0
這是人類未來 30 年最大的市場。Qwen 背景直接量產不是問題,3 年內 100 萬台/年都有可能。想想看『人尺寸迷你挖土機』,能直接吃掉 10 倍的車市。歐洲真的該看一下這個,趕快跟上。
#4 HN@lukewarm707 0
qwen 真的就是一直出貨,太香了。但 qwen.ai 拜託學一下用普通 HTML 顯示內文好不好,每次都要等那堆 JavaScript 跑完才看到一堆閃爍的方塊,內容到現在還沒載入成功。