編按:本文綜合整理自 Roboflow 部落格 的實測報告、OpenAI 官方 GPT-5.6 Sol 預告、Roboflow Playground 排名頁、DataCamp 評測 與 Hacker News 討論串,並加入 Siami 編輯部觀點與分析。
事件總覽:OpenAI 把「視覺」補回來了
OpenAI 於 7 月 9 日正式推出 GPT-5.6 系列三款模型:Sol(旗艦)、Terra(日常平衡款)、Luna(高速低價款)。在發表會上官方主軸放在「電腦使用」(computer use)與 UI agent 的 3D 視覺化展示,但這些功能背後都依賴更強的視覺理解能力。
為了驗證真正的視覺表現,電腦視覺公司 Roboflow 把他們即將公開的 VLM 基準拿來跑 GPT-5.6 三兄弟,涵蓋物件偵測、物件計數、OCR 與資料萃取四大常見任務,並與 GPT-5.5、Claude Fable 5、Gemini 3.5 Flash 等競爭模型同台比較。
GPT-5.6 系列定價與定位
| 模型 | 定位 | 輸入價(每百萬 token) | 輸出價(每百萬 token) |
|---|---|---|---|
| Sol | 旗艦,最大推理能力 | $5 | $30 |
| Terra | 日常平衡款 | $2.50 | $15 |
| Luna | 高速低價,量大自動化 | $1 | $6 |
官方數據:Terra 性能與 GPT-5.5 相當但價格只要一半;Luna 提供「最低價位的強能力」。GPT-5.6 也改進了 prompt cache,新增明確的 cache breakpoint 與 30 分鐘最短快取生命週期;cache 寫入按 1.25 倍計價,讀取繼續享 9 折。
對一般開發者:日常開發先用 Terra,需要衝刺時上 Sol,需要高吞吐量自動化用 Luna。
實測一:物件偵測(從 13.8 拉到 46.2 mAP)
這次 GPT-5.6 進步最明顯的項目。
- GPT-5.5 在 Roboflow 基準只有 13.8 mAP@50
- GPT-5.6 Sol 直接拉到 46.2 mAP@50
- Terra 與 Luna 緊追在後:44.7 與 43.3
等於把物件偵測從「過去 GPT 系列的主要弱點」推進到「可用等級」。文件版面偵測是 Sol 的強項之一,標題、段落、表格、圖片、簽名都能正確標註,這對文件數位化、發票辨識、合約解析等工作流是直接受惠。
兩大使用眉角
- 座標格式很重要:叫 Sol 回傳絕對像素的 XYXY 格式分數最高。Gemini 3.5 Flash 用 0–1000 標準化的 YXYX 比較強。用錯座標格式讓 Sol 掉了約 15 mAP。
- 大圖要先縮:Sol 在約 2000×2000 像素以上的圖上會變得不穩定(尤其低推理 effort 時),回傳的框會出現在不合理的隨機位置。提高 reasoning effort 可改善但會吃 token 與時間。官方建議:送進 API 前先 resize 或 crop。
這條對實務很重要:VLM 不是「丟一張大圖就搞定」,它對輸入尺寸與 prompt 細節非常敏感。
實測二:物件計數(從 64.9% 拉到 73.0%)
物件計數是另一個明顯進步的領域:
| 模型 | 計數正確率 |
|---|---|
| GPT-5.5 | 64.9% |
| GPT-5.6 Sol | 73.0% |
| GPT-5.6 Terra | 67.6% |
| GPT-5.6 Luna | 66.2% |
Luna 是系列中最便宜的,但計數表現仍勝過 GPT-5.5。Roboflow 測了一些刁鑽案例:
- 重疊金屬支架:能正確數出來,傳統偵測器與 VLM 都很難
- 彈孔計數(限定區域):能理解「只算某個區域內的彈孔」這條規則
不過 泡殼包裝(blister pack) 對 Sol 來說仍很硬:反光、填裝/空格的細微差異會讓模型同時在「算空格」「算藥錠」兩個 prompt 都翻車。
實測三:OCR 與資料萃取(小幅退步)
OCR 方面 Sol 拿到 90.7% 平均相似度,僅落後 GPT-5.5 的 91.2% 不到 1 分;Terra 88.8%、Luna 88.4%。但在目標式資料萃取上 Sol 從 87.6% 退到 82.5%,Luna 與 Terra 為 81.4% 與 79.4%。
兩個亮點
- 手寫筆記轉錄:Sol 在手寫場景表現穩健,能完整抄寫一份筆記,也能照指令抽出特定日期。
- 曲面上的文字:能讀出磨損輪胎側面印的輪胎規格字樣。
- 即時比分:從冰球轉播畫面抽出當下比分並按指定格式回傳。
一個明顯失誤
Sol 沒辦法讀出泡殼包裝上印的有效日期——字太小、直書、低對比、又疊反光。這是「看起來簡單但其實很難」的典型案例。
成本與速度的取捨
Sol 強歸強,但每一張圖要花將近 10 秒、平均 2.5 美分。量大的時候帳單會很痛。
| 模型 | 平均延遲 | 平均每張成本 |
|---|---|---|
| Sol | 約 10 秒 | $0.025 |
| Terra | 約 6 秒 | 約 $0.01 |
| Luna | 約 5 秒 | <$0.005 |
| Gemini 3.5 Flash(對照組) | — | $0.008 |
Luna 在延遲與品質間的平衡最好,接近 Gemini 3.5 Flash 的速度,但偵測與計數仍勝過 GPT-5.5。
Gemini 3.5 Flash 在 Roboflow 基準上每張只要 0.8 美分,卻仍在偵測與計數領先——這讓它在資料密集型工作仍是首選。
為什麼這件事重要
GPT-5.6 Sol 是 OpenAI 第一次把「視覺」拉到接近專門 VLM 的水準。
過去 GPT 系列一直被詬病「會寫會聊但看圖很弱」——文件 OCR 漏字、表格讀錯、UI 截圖辨識差。這對企業實際部署是硬傷,因為大多數真實工作流不是純文字聊天,而是截圖 + 文件 + 多模態混合輸入。
Sol 的進步意義有三層:
- UI agent 真的能跑了:OpenAI 在發表會展示的「操作電腦軟體」需要模型能看懂螢幕畫面、按鈕位置、表格內容。沒有強視覺,computer use 就只是 demo。
- 文件自動化門檻降低:企業內部大量「掃描合約 / 發票 / 表單」的工作流,現在可以用一個 API 取代串接多個專門模型。
- VLM 市場進入軍備競賽:Gemini 3.5 Flash 仍在偵測/計數領先但成本只有三分之一,Claude Fable 5 在 OCR 第一但極貴。OpenAI 用 Sol 把戰線拉到自己主場(推理 + 視覺整合),逼 Google 與 Anthropic 必須同時回應。
但社群反應也指出 Sol 的「完成度」仍有落差——它在模糊判斷、需要取捨的場景會掉鏈,工程師實際跑 agent loop 會遇到「做 20 分鐘說完成但漏了三件事」的挫折。這對企業部署是真正的試金石。
數據解讀與質疑
質疑 1:「Sol 是 OpenAI 史上最強視覺模型」這話只對了一半
原文是 Roboflow 自家基準下的結論,但同一份基準上 Gemini 3.5 Flash 在偵測與計數仍贏,OCR 冠軍是 Claude Fable 5。也就是說「OpenAI 史上最強」不等於「市場最強」。原文標題與結論其實刻意迴避了這個對比,這也是 HN 上 HarHarVeryFunny 412 推留言批評「Gemini 3.5 Flash 在所有視覺基準上都打敗 Sol,且只要 1/3 成本」的原因。
質疑 2:每張圖 2.5 美分真的能用嗎?
對企業級影像批次處理(幾萬到幾十萬張)來說,Sol 的單價會把 budget 直接打穿。Luna < 0.5 美分看起來便宜,但對應到的是模型能力大幅縮水。真正的成本甜蜜點是 Gemini 3.5 Flash(0.8 美分/張)——這也是為什麼 Roboflow 在結論裡建議「高吞吐量場景繼續選 Gemini」。
質疑 3:座標格式掉 15 mAP 暴露 VLM 的脆弱性
同一個模型換個 prompt 寫法就掉 15 分,這對任何想把 VLM 放進正式管線的團隊都是警告:VLM 不是丟圖就會自己 work。座標格式、推理 effort、圖片大小、prompt 結構都會大幅影響輸出。這也是為什麼「基準數字」與「實際部署表現」往往差異極大。
質疑 4:2D 物件偵測的「座標回歸」真的適合 VLM 做嗎?
這次評測凸顯一個根本問題:VLM 用文字生成座標,物件一多就容易漏、重複、座標亂掉。專門偵測器(YOLO、DETR 等)天生就是回傳座標。在大量小物件、密集場景下,VLM 是否真的比專門模型划算,仍是個值得懷疑的命題。
Siami 編輯部觀點
OpenAI 把視覺補回來是大事,但市場的下一波競爭不是「誰基準第一」,而是「誰能在成本甜蜜點上把品質撐住」。
三件事值得繼續追蹤:
- GPT-5.6 Sol Ultrafast(Cerebras 加速版):8/13 預告,輸出速度 750 tokens/秒。視覺任務吃 token 極快,如果 Ultrafast 版能壓低延遲到 1-2 秒,computer use 與 UI agent 才會真正進入生產。
- Gemini 3.6 Flash / Flash-Lite 的回應:Google 19 天前已經在 Roboflow Playground 上刷榜把 Fable 5 擠到第 20 名,下一波 Flash 會更便宜或更快,戰況只會更激烈。
- OpenAI Astra(8/9 公布的下一代模型):Astra 是 OpenAI 第一次「自 2024 年以來重刷 base model」的版本。Sol 是過渡,Astra 才是真正決戰 Frontier 的武器。
對開發者:先用 Terra 跑 production,高價值任務上 Sol,大規模影像掃描仍留給 Gemini 3.5 Flash。
網友熱門留言 (5)