← 返回 Siami 首頁

MiniMax H3 開源權重 Day-0 登陸 ComfyUI 2K 立體聲影片 RTX 3060 也能跑

▲ 208 💬 62
MiniMax H3 開源權重 Day-0 登陸 ComfyUI 2K 立體聲影片 RTX 3060 也能跑

編按:本文綜合整理自 ComfyUI Newsletter 官方文章Reuters 報導Hacker News 討論串,並加入 Siami 編輯部觀點與分析。

事件總覽:MiniMax H3 正式開源,ComfyUI 同步支援中國 AI 公司 MiniMax 於 8 月 3 日正式開源旗下第三代影片生成模型 H3 的權重,ComfyUI 也在當天上午立刻推出 Day-0 原生支援。這是 MiniMax 繼 Hailuo 01、Hailuo 02 後的第三款影片模型,也是該公司首次以開源權重形式釋出。與以往最大的差異在於:H3 同時接受文字、圖片、影片、音訊四種輸入,並在同一個推論過程裡同時生成 2K 解析度、最長 15 秒的影片以及原生立體聲音效。模型權重已在 Hugging Face 上架(Comfy-Org/MiniMax-H3),官方提供 I2V、R2V、T2V 三套 ComfyUI 工作流。


模型能力亮點

  • Text-to-video:純文字提示生成影片。
  • Image-to-video:把單張靜態圖「動起來」。
  • First-and-last-frame:指定開頭幀與結尾幀,模型自動補完中間過場。
  • Reference-to-video:輸入參考圖、影片或音訊,把主體、動作或聲音延伸到新片段。最高可輸出 2K 解析度、最長 15 秒;音訊跟影片在同一個推論階段生成,採原生立體聲,不是後期疊加

為什麼這件事重要這是開源社群首次能在消費級顯卡上跑出 2K 立體聲影片。從技術角度看,H3 把原本分散在五個獨立模型的任務——文生影、圖生影、首尾幀補間、動作遷移、音訊生成——壓回同一個模型。對獨立創作者與小型工作室而言,這代表不再需要把工作流串在 Stable Diffusion、Wan2.2、LTX-Video、Stable Audio 之間。從產業格局看,MiniMax 是繼 DeepSeek 之後又一家把頂級模型開源出來的中國 AI 公司。Reuters 7 月 31 日的報導指出,MiniMax 預計 H3 開源後會對封閉式商用模型帶來明顯的價格壓力。Hacker News 上 @ArtificialAnlys 的測試數據顯示,H3 在 Video Editing 評比已經衝上第一、Text-to-Video 與 Image-to-Video 都進入前三。

「這是開源模型首次把『多模態 + 立體聲 + 2K』三個條件同時滿足,而且能在 RTX 3060 上跑。」 — Siami 編輯部


ComfyUI 的工程優化:怎麼把模型塞進消費級顯卡要把 H3 跑順在消費級硬體上並不容易。ComfyUI 團隊做了一連串底層調整:

  1. Modulation 權重查表化:模型約 40% 的參數是 modulation weights(用於依 timestep 動態調整層規範化的係數),這些可以切片成固定離散區間並改用查表(LUT)儲存。對擴散模型來說這是無損壓縮,但對 LLM 不適用。
  2. int8 convrot 量化:權重在出貨時就附帶高精度的 int8 卷積旋轉量化版本。
  3. 自訂 kernel + 動態 VRAM 卸載:降低推論時的峰值 VRAM 使用。整體效果:總記憶體用量從全精度 123.6 GB 降到 42.5 GB(-66%),搭配動態卸載後能在 RTX 3060(12GB VRAM)上跑。

數據解讀與質疑幾個值得留意的點:

  • 生成速度仍是瓶頸:vblanco 在 4070 Ti Super(16GB)上跑 10 秒 480p 影片要 10 分鐘;pkroll 指出 sageattention 可提速約 33%,但距離商用即時生成還有距離。
  • 首尾幀的 prompt 遵從度不穩:fwip 實測後指出,ComfyUI 示範 prompt 裡寫的「WHIP PAN」過場,模型直接忽略改用 cut。可見 prompt 工程在多鏡頭敘事上還不成熟。
  • 授權限制仍存在:H3 對 EU、UK、南韓、美國的 AI 監管有聲明,用戶須簽署 Hugging Face 上的授權承諾(不能拿去做可能得罪 Disney 等大型 IP 的內容)。
  • 是否侵權的爭議:trwhite 等創作者擔心訓練資料來源不透明,認為「這些成果本質上是拿別人作品練出來的」。這是開源影片模型普遍要面對的法律與倫理難題。

怎麼開始玩

  1. 把 ComfyUI 升級到 0.30.0 以上版本,或直接用 Comfy Cloud。
  2. 到 template library 下載 MiniMax H3 的 I2V、R2V、T2V 工作流。
  3. 按照 workflow 內附的說明,把模型權重放到正確的 model 目錄。
  4. 寫 prompt、接好參考輸入,按下執行。權重下載:Comfy-Org/MiniMax-H3

參考資料

網友熱門留言 (6)

#1 vblanco ▲ 38
我用 4070ti super(16GB VRAM)跑這個模型,10 秒鐘的 480p 影片要花 10 分鐘,但生成出來的結果非常驚艷。
#2 Maxious ▲ 22
我用 RTX 5080 16GB 跑同樣的工作流,10 秒鐘 480p 只要 3 分鐘。把 megpixels 調到 2.0(1920×1088)就要 5 分鐘以上,目前看來還有優化空間。
#3 echelon ▲ 18
這還是比 Seedance 2.0/2.5 落後大約一年半,但它代表開源模型會對頂級商用模型帶來降價壓力,也讓平台的安全審查無法一鍵封殺創作工作流。
#4 sheesdev ▲ 14
滑鼠那段 demo 影片出乎意料地好,跟目前的 SOTA 模型相比是明顯的跳階。唯一看起來不對的是飲料廣告開罐那段,還是有那種『AI 滑順感』。
#5 storus ▲ 11
Reference-to-video 模式補齊了獨立電影製作最後一塊拼圖——以前沒辦法在不改太多場景的前提下把不同鏡頭無縫接在一起。
#6 pkroll ▲ 9
reddit 上有人已經實測了 sageattention 可以讓渲染速度提升 33%。而且這才是第一天,很快就會有人蒸餾出 4-8 step 的 LoRA。