編按:本文綜合整理自 OpenAI 官方文章、The New Stack、VentureBeat、Artificial Analysis、ZDNet,並加入 Siami 編輯部觀點與分析。
OpenAI 於 9 月 22 日正式推出 GPT-6 家族的兩款新成員:GPT-6 Sol 與 GPT-6 Luna。這是繼 9 月初旗艦模型 GPT-6 Astra 之後,OpenAI 把「前沿智能」下放到中階與輕量階的兩款產品線。Sol 與 Luna 不只能力升級,API 價格直接砍半,在自動化、商業流程、程式碼產生、電腦操作等多個基準測試上,把 Anthropic 的 Opus 5 與 Fable 5 打得措手不及。
價格腰斬:Sol 從 4 美元掉到 2 美元、Luna 從 0.20 美元掉到 0.10 美元
這次最震撼的不是「模型變強」,而是 OpenAI 直接把所有 GPT-6 中階以下的價格砍半。對照 GPT-5.6 系列的促銷定價:
| 模型 | Input (per 1M tokens) | Output (per 1M tokens) | 降幅 |
|---|---|---|---|
| GPT-5.6 Sol → GPT-6 Sol | $4 → $2 | $20 → $10 | 50% |
| GPT-5.6 Luna → GPT-6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% |
對開發者來說,這個降幅等於過去要花兩塊錢才能做的事,現在一塊錢就搞定。如果再搭配 prompt caching 的折扣(命中快取的輸入 token 享 9 折),長對話與 agent 應用的成本還能再壓更低。
Sol 與 Luna 的命名延續了 GPT-5.6 的「三層模型家族」策略:Sol 是中階主力、Luna 是輕量階。Astra 則是頂規旗艦。
能力對決:Sol 對上 Opus 5,成本只剩 9%
OpenAI 在官方文章中釋出了多項基準測試數據,展現 Sol 與 Luna 在「同價位能力」與「同能力價格」兩個維度上,都把對手遠遠甩開。
AutomationBench:商務流程自動化
在這個橫跨業務、行銷、運營、客服、財務、人資共 47 種工具的自動化基準上,GPT-6 Sol 在 xhigh 出力下得分 33.2%、單任務成本 $0.27;Claude Opus 5 在 max 出力下得分 26.9%、單任務成本是 Sol 的 11.1 倍。
即使是搭配 Opus 5 fallback 的 Claude Fable 5.1(得分 31.4%),單任務成本依然超過 Sol 的 8.9 倍。這意味著企業自動化場景,Sol 是目前性價比最高的選擇。
DeepSWE:真實程式碼倉庫任務
在評估 AI agent 處理「可合併程式碼」的 DeepSWE v1.1 上,GPT-6 Sol 在 max 出力下得分 68.8%,跟 Claude Fable 5 xhigh 出力下的 69.9% 幾乎打平,但成本只有 Fable 5 的約 20%。
更值得注意的是 GPT-6 Luna:它在 max 出力下得分 66.6%,已經達到 Claude Opus 5 與 Fable 5 中等出力水準,成本卻只要 Opus 5 的 7%、Fable 5 的 4%。
FrontierCode:可合併率
在另一個評估 AI 寫程式碼「能不能直接 merge 進主分支」的 FrontierCode 1.1 上,GPT-6 Sol 大幅超越 GPT-5.6 Sol,並能以更低成本匹配 Claude Fable 5.1 xhigh 出力。
OSWorld 2.0:電腦操作能力
在電腦操作基準 OSWorld 2.0 上,GPT-6 Sol 在 xhigh 出力下得分 60.5%,幾乎追平 Claude Opus 5 中等出力的 60.3%,但成本只有約 20%。
事實性:Sol 錯誤率砍半,Luna 達到 GPT-5.6 Sol 等級
OpenAI 內部的事實性評估是基於真實 ChatGPT 對話中使用者標記「這個答案有錯」的紀錄。GPT-6 Sol 的錯誤率大約只有 GPT-5.6 Sol 的一半,逼近 Astra 等級的可靠度,但成本低得多。
GPT-6 Luna 也大幅改善;在較高出力下,它的表現已經能匹配 GPT-5.6 Sol,成本卻只要 GPT-5.6 Sol 的大約百分之一。
Prompt Caching 全面升級:agent 與長對話成本再壓低
這次 Sol 與 Luna 同步升級了 prompt caching:
- 預設更高的快取命中率:agent 可以重複使用更多上下文、回應更快、命中快取的輸入 token 享 9 折
- 新增 Prompt Caching Dashboard:讓開發者即時監控快取使用狀況
- 新增 diagnostics 工具:診斷錯失的快取機會
- 調整推理出力與工具時不破壞快取:開發者可以動態切換 reasoning effort 或開關工具,不會讓之前的快取失效
- 新增 explicit breakpoints:讓開發者明確指定快取前綴的結束位置,掌握控制權
GitHub 報告指出,這些改進讓他們在 OpenAI 模型上的「需要重新處理的 prompt token 比例」半年內降低了 50% 以上,讓 Copilot 回應更快。
為什麼這件事重要
Sol 與 Luna 的推出,不只是「GPT-5.6 升級版」這麼單純。它代表 OpenAI 的策略已經從「拚頂級基準分數」轉向「讓前沿智能走進日常應用」。
過去一年,企業導入 LLM 的最大瓶頸不是「模型不夠強」,而是「模型太貴」。一個 agent 跑一輪自動化要 $0.30、跑一千次就是 $300,對中小型企業來說根本吃不消。Sol 把這個成本壓到 Opus 5 的 9%、Luna 壓到 1%,等於把 AI 自動化的單位成本從「企業級」拉到「消費級」。
對 Anthropic 來說,這是更直接的壓力。Claude Opus 5 與 Fable 5 在基準上還有領先,但「每個任務 11 倍成本」的差距,會讓企業在做 ROI 計算時直接選 Sol。Sam Altman 在 X 上的發言也證實了這個定位:GPT-6 Sol 與 Luna 是「在前一代基礎上大幅提升智能、對齊、工作輸出、程式碼、電腦操作」的版本。
對開發者社群來說,Luna 是真正的「工作馬」角色 — 它用百分之一的成本達成 GPT-5.6 Sol 等級的事實性,在重複性高、量又大的應用(內容審核、客服初篩、資料清洗、測試案例產生)上,幾乎是無腦首選。
數據解讀:這些基準分數要不要照單全收?
這裡有幾個值得留意的點:
1. Claude Fable 5.1 的成本被低估了:OpenAI 在 AutomationBench 的附註中明說,Fable 5.1 的成本數字「沒算 Opus 5 fallback 的成本」,而 fallback 在 40% 的任務中都會觸發。也就是說,真實的 Fable 5.1 成本是 8.9 倍,不是 4-5 倍。這個比較對 OpenAI 比較有利。
2. GPT-6 Sol 的數據沒跟 Astra 直接比:VentureBeat 直接點出,OpenAI 釋出的基準沒有包含 GPT-6 Sol 跟 Astra 的比較,所以「Sol 跟 Opus 5 同級」這句話並不直接代表「Sol 跟自家旗艦 Astra 同級」。事實上,OpenAI 在文章開頭就強調 Astra 才是「全方位最強」的選擇。
3. 自我評估的偏誤:基準分數是 OpenAI 自己測的,測試環境用的是 OpenAI 自己的研究環境或 API,跟生產環境 ChatGPT 的 system prompt、可用工具可能有差異。競爭對手分數則是引用「公開可取得的報告」,基準設定可能不完全對等。
4. 出貨節奏是漸進的:OpenAI 明說「為保持服務穩定,Sol 與 Luna 會在 ChatGPT Work 與 Codex 逐步上線,當天沒看到的話請稍候再試」。這跟 9 月初 GPT-6 Astra 推出時「混亂 rollout」事件遙相呼應 — 大規模上新模型對 OpenAI 來說依然是工程挑戰。
可用性與定價
GPT-6 Sol 與 GPT-6 Luna 9 月 22 日起在 ChatGPT Work 與 Codex 上線,所有 Plus、Pro、Business、Enterprise、Edu 用戶都可使用。Free 與 Go 用戶可在桌面 App 使用 GPT-6 Luna(尚未在 Chat 推出)。API 端可透過 gpt-6-sol 與 gpt-6-luna 兩個模型名稱呼叫。
Sam Altman 在 X 上同步發布,強調這是「大幅提升智能、對齊、工作輸出、程式碼、電腦操作」的版本,並把價格砍半作為配套。
延伸閱讀:
網友熱門留言 (5)