編按:本文綜合整理自 Black Forest Labs 官方公告、The Decoder 報導、AlphaSignal 分析 以及 Hacker News 討論串,並加入 Siami 編輯部觀點與分析。
Black Forest Labs(BFL)在 10 月 1 日正式推出 FLUX 3 Image,這是 FLUX 3 多模態模型家族中專門負責影像生成與編輯的子模型。它的核心賣點不是「畫得更漂亮」,而是「每一個像素都能精準控制」:用戶用 bounding box 把每個元素框在畫布上,之後不管做幾輪修改,沒被動到的部分會完全保持原樣。
從零開始構圖:bounding box 就是你的版型
FLUX 3 Image 的畫布是 0 到 1000 的雙軸座標網格,不論選什麼長寬比都通用。流程是三步:
- 選長寬比(aspect ratio)
- 為每個重要元素拖出一個 bounding box,並寫下這個元素是什麼
- 寫一句話把整個場景串起來
模型接著就會把每個元素放進它對應的 box 裡渲染。這個做法跟傳統「給一段 prompt 就生成一張圖」完全不同,生成之前你就知道每個東西會落在哪裡。
如果用戶懶得手動拉 box 也沒關係:只要給一句話加長寬比,FLUX 3 內部的 prompt upsampler 會把簡短描述擴寫成模型訓練用的密集 caption,並幫忙規劃版面。手動畫的所有 box 都會原封不動送到模型,upsampler 多加的東西則要使用者點頭才會生效。
多輪編輯卻不污染其他區域
過去做局部修改最大的痛點是「換 A 結果 B 也跟著歪掉」。FLUX 3 Image 把每個 box 變成可獨立操作的單位,可以重新描述、整個換掉、或者搬位置,沒被動到的部分保證不變。BFL 官方展示裡的典型案例包括:
- 把衝浪者的黑色防寒衣換成亮紅色,但巨大的浪花和陰天完全沒動
- 把場景中那隻穿著道袍的小狼換成一隻狗,但竹葉、樹幹、結霜的地面、石燈籠都不變
- 把白紙上的炭筆素描換成水彩插畫,但底圖、卡片、線圈、文字都保留
這等於把「局部 Inpainting」從手工 mask 升級成語意化的可定址編輯。
最多 10 張參考圖組合
另一個重點是 reference 系統:用戶可以上傳最多 10 張參考圖,每張依加入順序拿到一個 token(從 ref_image_0 開始),然後寫一句話描述要做什麼並用 token 引用每張參考。FLUX 3 會決定每張參考放在哪、佔多大,再渲染整個畫面。
典型用例包括:「在時代廣場拍一組時尚街拍,用 ref_image_0 到 ref_image_5」、「用 ref_image_0 蓋一個雞舍:ref_image_1 是牆壁、ref_image_2 是窩、ref_image_3 是地板…」。這把過去要靠 ComfyUI 拼貼或 ControlNet 拼節點的工作流,收斂成一句自然語言。
4K 原生輸出,連招牌字都看得清
FLUX 3 Image 直接原生輸出 2K 與 4K 解析度,不靠事後 upscale。官方展示裡的 Soba shop 是 5456 × 3072 pixels 全程從模型生成。100% 解析度下來,招牌上手寫字大約 225 px 高、紙燈籠內透光的字、玻璃後面食客手中的筷子都清楚可見。
BFL 共同創辦人 Robin Rombach 在 X 平台發文時就以「Control every pixel. Make precise multi-turn edits without changing any other pixel.」作為這次的主軸訴求。
🚨 為什麼這件事重要
FLUX 3 Image 不是「又一個文字生圖模型」,它把生成式影像從「開盲盒」推進到「可定址工程物件」。當每個元素都有語意 ID、座標、獨立可編輯的權限,AI 影像才真正能進入生產工作流——設計師可以反覆修同一張圖、攝影師可以批次換模特身上的單品、行銷團隊可以鎖定某塊區域做 A/B 版本。
更深一層,這個設計選擇揭示了 BFL 對「Agentic 影像」的想像:官方頁面有「Designed for agents」整個章節,明確示範 Swan Lake 從側幕看過去那張圖,只要給 agent 一句 prompt 加長寬比,後面所有版面(caption、element table、box)就由 LLM 自動規劃,人只負責最後微調 box。這代表 FLUX 3 想成為「agent 寫完就出圖」這條鏈上的視覺層。
另一個產業訊號是 BFL 不是美中實驗室。Hacker News 留言區有使用者特別標註「欣慰能看到美中之外的 AI 實驗室端出好模型」——BFL 總部位於德國弗萊堡(Freiburg),從 Stable Diffusion 時代的核心團隊出來,現在是歐洲少數能跟閉源巨頭打對台的開源派代表。
🚨 數據解讀與質疑
正面訊號:
- HN 主討論串在 17 小時內衝到 310 分、67 則留言(多數圍繞 UX 與 bounding box 的可行性)
- AlphaSignal 報導確認 BFL 已宣布將在「未來數週」釋出開源權重版 FLUX 3 Image,定價與時程尚未公開
- The Decoder 報導點出 BFL 主打「multi-step edits that leaves the rest of your picture alone」——這是 2026 年主流生圖模型普遍還沒解乾淨的痛點
質疑與待觀察:
- HN 用戶
numlock86直接開酸:「那個印在 T 恤上的展示範例糟到我無法想像有人看過之後說『我們把它放到 showcase 吧』」。官方 showcase 並非每張都精緻,這跟 FLUX.2 時代被嫌「塑膠皮膚、AI 味重」的批評一脈相承 - 開源權重釋出時程仍不確定;對想自己地端跑、或商用微調的開發者來說,目前只有 API 與商用授權兩條路
- BFL 在 9 月底才剛開源了 FLUX 3 Action(7B 機器人動作模型),加上這次 FLUX 3 Image,多模態擴張速度很快,但每一條線都還沒看到大規模第三方 benchmark。ThetaSignal 與 Artificial Analysis 等第三方排行榜的 FLUX 3 Image 分數還沒出來
- 標榜「4K 原生」,但官方展示的 4K 範例都是結構簡單的場景(食物、招牌),複雜構圖的 4K 細節保留能力還沒被壓力測試過
常見問題
FLUX 3 Image 是什麼? FLUX 3 是 BFL 的多模態模型,涵蓋影片、音訊、影像、動作。FLUX 3 Image 是其中負責影像生成與編輯的子模型。你用 bounding box 把每個元素放到畫布上,之後可以一個 box 一個 box 地編輯完成圖。
Bounding box 怎麼運作? 為每個重要元素拖一個 box,描述裡面是什麼。寫一句話把場景串起來,FLUX 3 就會把每個元素渲染到對應的 box 裡。不論選什麼長寬比,畫布都是 0 到 1000 的雙軸座標網格,box 用該座標系寫成 [y_min, x_min, y_max, x_max]。
Layout prompt 長什麼樣? 兩段式。一段全域 caption 描述整張圖,一個 element table 接在後面,是 JSON 陣列,每列一個元素,欄位有 id、bounding box、描述。caption 用 id(如 animal_1)引用每個元素。
一定要自己畫 box 嗎? 不一定。給 agent 一句話加長寬比,LLM 會幫你規劃版面,寫好 caption 跟 element table,box 跟語意 id 都會自動給。你不喜歡的可以手動搬,剩下 FLUX 3 照 agent 排的版面渲染。
可以編輯已經生成的圖嗎? 可以,而且可以一次多處編輯。每個 box 都可以重新描述、整個換掉、或搬位置。沒被動到的部分保證完全不變,多輪修改下整張圖都還能 hold 住。
FLUX 3 會改我畫的 box 嗎? 不會。Prompt upsampler 只負責把你的簡短描述擴寫成模型訓練用的密集 caption,可能會圍繞既有 box 寫 caption 或建議更多元素,但你手動畫的所有 box 都原封不動送到模型,id 跟座標都不變。Upsampler 多加的東西要你點頭才生效。
哪些場景適合 bounding box? 多元素且彼此有明確空間關係的構圖。例如排版混搭照片、拼貼、分格漫畫、編輯跨頁,或一張人很多的場景但每張臉都有固定位置。
哪裡可以試? 在 BFL Playground 直接手動畫 box,或透過 BFL API 送 layout prompt。Playground 對外開放。
網友熱門留言 (6)