← 返回 Siami 首頁

OpenAI 推出 GPT-6 Sol 與 Luna:API 價格直接腰斬、Sol 在 AutomationBench 與 Claude Opus 5 同級但成本只剩 9%

▲ 916 💬 483
OpenAI 推出 GPT-6 Sol 與 Luna:API 價格直接腰斬、Sol 在 AutomationBench 與 Claude Opus 5 同級但成本只剩 9%

編按:本文綜合整理自 OpenAI 官方文章The New StackVentureBeatArtificial AnalysisZDNet,並加入 Siami 編輯部觀點與分析。

OpenAI 於 9 月 22 日正式推出 GPT-6 家族的兩款新成員:GPT-6 SolGPT-6 Luna。這是繼 9 月初旗艦模型 GPT-6 Astra 之後,OpenAI 把「前沿智能」下放到中階與輕量階的兩款產品線。Sol 與 Luna 不只能力升級,API 價格直接砍半,在自動化、商業流程、程式碼產生、電腦操作等多個基準測試上,把 Anthropic 的 Opus 5 與 Fable 5 打得措手不及。

價格腰斬:Sol 從 4 美元掉到 2 美元、Luna 從 0.20 美元掉到 0.10 美元

這次最震撼的不是「模型變強」,而是 OpenAI 直接把所有 GPT-6 中階以下的價格砍半。對照 GPT-5.6 系列的促銷定價:

模型Input (per 1M tokens)Output (per 1M tokens)降幅
GPT-5.6 Sol → GPT-6 Sol$4 → $2$20 → $1050%
GPT-5.6 Luna → GPT-6 Luna$0.20 → $0.10$1.20 → $0.5050%

對開發者來說,這個降幅等於過去要花兩塊錢才能做的事,現在一塊錢就搞定。如果再搭配 prompt caching 的折扣(命中快取的輸入 token 享 9 折),長對話與 agent 應用的成本還能再壓更低。

Sol 與 Luna 的命名延續了 GPT-5.6 的「三層模型家族」策略:Sol 是中階主力、Luna 是輕量階。Astra 則是頂規旗艦。


能力對決:Sol 對上 Opus 5,成本只剩 9%

OpenAI 在官方文章中釋出了多項基準測試數據,展現 Sol 與 Luna 在「同價位能力」與「同能力價格」兩個維度上,都把對手遠遠甩開。

AutomationBench:商務流程自動化

在這個橫跨業務、行銷、運營、客服、財務、人資共 47 種工具的自動化基準上,GPT-6 Sol 在 xhigh 出力下得分 33.2%、單任務成本 $0.27;Claude Opus 5 在 max 出力下得分 26.9%、單任務成本是 Sol 的 11.1 倍

即使是搭配 Opus 5 fallback 的 Claude Fable 5.1(得分 31.4%),單任務成本依然超過 Sol 的 8.9 倍。這意味著企業自動化場景,Sol 是目前性價比最高的選擇

DeepSWE:真實程式碼倉庫任務

在評估 AI agent 處理「可合併程式碼」的 DeepSWE v1.1 上,GPT-6 Sol 在 max 出力下得分 68.8%,跟 Claude Fable 5 xhigh 出力下的 69.9% 幾乎打平,但成本只有 Fable 5 的約 20%

更值得注意的是 GPT-6 Luna:它在 max 出力下得分 66.6%,已經達到 Claude Opus 5 與 Fable 5 中等出力水準,成本卻只要 Opus 5 的 7%、Fable 5 的 4%

FrontierCode:可合併率

在另一個評估 AI 寫程式碼「能不能直接 merge 進主分支」的 FrontierCode 1.1 上,GPT-6 Sol 大幅超越 GPT-5.6 Sol,並能以更低成本匹配 Claude Fable 5.1 xhigh 出力。

OSWorld 2.0:電腦操作能力

在電腦操作基準 OSWorld 2.0 上,GPT-6 Sol 在 xhigh 出力下得分 60.5%,幾乎追平 Claude Opus 5 中等出力的 60.3%,但成本只有約 20%


事實性:Sol 錯誤率砍半,Luna 達到 GPT-5.6 Sol 等級

OpenAI 內部的事實性評估是基於真實 ChatGPT 對話中使用者標記「這個答案有錯」的紀錄。GPT-6 Sol 的錯誤率大約只有 GPT-5.6 Sol 的一半,逼近 Astra 等級的可靠度,但成本低得多。

GPT-6 Luna 也大幅改善;在較高出力下,它的表現已經能匹配 GPT-5.6 Sol,成本卻只要 GPT-5.6 Sol 的大約百分之一


Prompt Caching 全面升級:agent 與長對話成本再壓低

這次 Sol 與 Luna 同步升級了 prompt caching:

  • 預設更高的快取命中率:agent 可以重複使用更多上下文、回應更快、命中快取的輸入 token 享 9 折
  • 新增 Prompt Caching Dashboard:讓開發者即時監控快取使用狀況
  • 新增 diagnostics 工具:診斷錯失的快取機會
  • 調整推理出力與工具時不破壞快取:開發者可以動態切換 reasoning effort 或開關工具,不會讓之前的快取失效
  • 新增 explicit breakpoints:讓開發者明確指定快取前綴的結束位置,掌握控制權

GitHub 報告指出,這些改進讓他們在 OpenAI 模型上的「需要重新處理的 prompt token 比例」半年內降低了 50% 以上,讓 Copilot 回應更快。


為什麼這件事重要

Sol 與 Luna 的推出,不只是「GPT-5.6 升級版」這麼單純。它代表 OpenAI 的策略已經從「拚頂級基準分數」轉向「讓前沿智能走進日常應用」。

過去一年,企業導入 LLM 的最大瓶頸不是「模型不夠強」,而是「模型太貴」。一個 agent 跑一輪自動化要 $0.30、跑一千次就是 $300,對中小型企業來說根本吃不消。Sol 把這個成本壓到 Opus 5 的 9%、Luna 壓到 1%,等於把 AI 自動化的單位成本從「企業級」拉到「消費級」

對 Anthropic 來說,這是更直接的壓力。Claude Opus 5 與 Fable 5 在基準上還有領先,但「每個任務 11 倍成本」的差距,會讓企業在做 ROI 計算時直接選 Sol。Sam Altman 在 X 上的發言也證實了這個定位:GPT-6 Sol 與 Luna 是「在前一代基礎上大幅提升智能、對齊、工作輸出、程式碼、電腦操作」的版本。

對開發者社群來說,Luna 是真正的「工作馬」角色 — 它用百分之一的成本達成 GPT-5.6 Sol 等級的事實性,在重複性高、量又大的應用(內容審核、客服初篩、資料清洗、測試案例產生)上,幾乎是無腦首選。


數據解讀:這些基準分數要不要照單全收?

這裡有幾個值得留意的點:

1. Claude Fable 5.1 的成本被低估了:OpenAI 在 AutomationBench 的附註中明說,Fable 5.1 的成本數字「沒算 Opus 5 fallback 的成本」,而 fallback 在 40% 的任務中都會觸發。也就是說,真實的 Fable 5.1 成本是 8.9 倍,不是 4-5 倍。這個比較對 OpenAI 比較有利。

2. GPT-6 Sol 的數據沒跟 Astra 直接比:VentureBeat 直接點出,OpenAI 釋出的基準沒有包含 GPT-6 Sol 跟 Astra 的比較,所以「Sol 跟 Opus 5 同級」這句話並不直接代表「Sol 跟自家旗艦 Astra 同級」。事實上,OpenAI 在文章開頭就強調 Astra 才是「全方位最強」的選擇。

3. 自我評估的偏誤:基準分數是 OpenAI 自己測的,測試環境用的是 OpenAI 自己的研究環境或 API,跟生產環境 ChatGPT 的 system prompt、可用工具可能有差異。競爭對手分數則是引用「公開可取得的報告」,基準設定可能不完全對等。

4. 出貨節奏是漸進的:OpenAI 明說「為保持服務穩定,Sol 與 Luna 會在 ChatGPT Work 與 Codex 逐步上線,當天沒看到的話請稍候再試」。這跟 9 月初 GPT-6 Astra 推出時「混亂 rollout」事件遙相呼應 — 大規模上新模型對 OpenAI 來說依然是工程挑戰。


可用性與定價

GPT-6 Sol 與 GPT-6 Luna 9 月 22 日起在 ChatGPT Work 與 Codex 上線,所有 Plus、Pro、Business、Enterprise、Edu 用戶都可使用。Free 與 Go 用戶可在桌面 App 使用 GPT-6 Luna(尚未在 Chat 推出)。API 端可透過 gpt-6-solgpt-6-luna 兩個模型名稱呼叫。

Sam Altman 在 X 上同步發布,強調這是「大幅提升智能、對齊、工作輸出、程式碼、電腦操作」的版本,並把價格砍半作為配套。

延伸閱讀:

網友熱門留言 (5)

#1 Hacker News 用戶 (HN score 916) ▲ 916
GPT-6 Luna 在多數任務上真的是帕累托最優。我不知道閉源模型怎麼能賣這個價格,但性價比真的離譜。
#2 Hacker News 用戶 (HN 討論串) ▲ 412
把 GPT-6 Sol 拿去跑我的 benchmark,跟其他 open weight 模型比起來,推理跟程式碼都大幅進步。
#3 Reddit r/singularity 用戶 ▲ 287
Luna 在 coding 上完全超出它的價位帶。Sol/Opus 用來處理高難度任務,Luna 拿來做日常清潔剛剛好。
#4 Reddit r/codex 用戶 ▲ 156
我之前用 GPT-5.6 Sol high 從來不會撞到 usage limit,但用 Astra low 30 分鐘就滿了。Sol 跟 Luna 解決了這個問題。
#5 Hacker News 用戶 ▲ 134
Luna 跟 Sol 一個當工作馬、一個當賽馬。我只用 Sol 跟 Astra 處理真正需要深度的任務。