編按:本文綜合整理自 OpenAI 官方部落格、CNBC、VentureBeat、The Verge 與 Hacker News 討論,並加入 Siami 編輯部觀點與分析。
OpenAI 於 2026 年 9 月 22 日正式推出 GPT-6 系列旗下的兩款新模型:GPT-6 Sol 與 GPT-6 Luna。這是繼九月初發表的旗艦級模型 GPT-6 Astra 之後,OpenAI 將頂級能力「向下延伸」的關鍵一步——把同等級的智能水準,以更低的價格提供給更廣泛的工作場景。
API 定價直接砍半
本次最直觀的改變是價格:
- GPT-6 Sol:每百萬 token 輸入 2 美元/輸出 10 美元(原 GPT-5.6 Sol 為 4/20 美元)
- GPT-6 Luna:每百萬 token 輸入 0.10 美元/輸出 0.50 美元(原 GPT-5.6 Luna 為 0.20/1.20 美元)
兩款模型同步降價 50%。OpenAI 表示,這次降價來自快取機制與推論效率的改善,會直接把成本節省回饋給開發者與企業客戶。
專業工作:Coding agent 跑得更久
對企業客戶而言,最大的吸引力在於成本與能力的重新平衡。官方公布的 AutomationBench 數據顯示,GPT-6 Sol 在「xhigh 推理強度」下擊敗 Claude Opus 5 max 強度,但單任務成本只有 Opus 5 的 9%。在「high 強度」設定下,GPT-6 Luna 比前代提升 5.4 個百分點,但單任務成本降低 58%。
換言之,過去只有旗艦模型能負擔的長流程 AI 工作(包含 47 種業務工具、橫跨業務、行銷、營運、客服、財務、人資的端到端工作流),現在可以用一半以下的價格完成。
Coding:逼近 Claude Fable 5,但便宜 80%
Coding 領域是這次的主戰場。在 FrontierCode 基準(評估 AI agent 寫出的程式碼是否能合併進真實 codebase)上,GPT-6 Sol 顯著超越 GPT-5.6 Sol,並能以更低成本匹配 Claude Fable 5.1 xhigh。在 DeepSWE v1.1(真實 codebase 軟體工程任務)上,GPT-6 Sol 在 max 強度得到 68.8%,逼近 Claude Fable 5 的 69.9%(xhigh 強度),但成本只有約 20%。
更具殺傷力的是 Luna——它在 max 強度達到 66.6%,相當於 Claude Opus 5 與 Fable 5 在 medium 強度的表現,但單任務成本只有 Opus 5 的 7%、Fable 5 的 4%。
電腦操作:持平 Opus 5,成本砍 80%
在 OSWorld 2.0(電腦操作能力測試)上,GPT-6 Sol 在 xhigh 強度達到 60.5%,與 Claude Opus 5 medium 強度的 60.3% 幾乎打平,但成本只有後者約 20%。GPT-6 Luna(max)甚至超越 GPT-5.6 Sol(medium),但成本只有十分之一。
快取機制升級:對長對話與 agent 是大利多
除了降價,OpenAI 這次還針對 prompt 快取做了三項改進:
- 預設更高的快取命中率:對重用上下文的情境可享 90% 的輸入 token 讀取折扣。
- 推理強度與工具調整不再破壞快取:開發者可在不丟失快取的情況下動態切換 effort 與可用工具。
- 明確的 prefix 斷點:讓開發者主動指定快取範圍,提升重用率。
GitHub 透露,過去幾個月這些改進讓 prompt token 中需要重新處理的比例降低超過 50%,協助 Copilot 更快回應。
對齊與誠實度
Sol 與 Luna 延續 Astra 的對齊訓練,官方公布的「coding 欺騙」「搜尋損壞」「審查者繞過」「警告規避」「未授權互動」等評估都優於 GPT-5.6 對應版本。內部事實性評估顯示,Sol 犯錯率約為前代的一半,逼近 Astra 等級的可靠性,但成本顯著更低。
上線時程
兩款模型即日於 ChatGPT Work 與 Codex 開放給 Plus、Pro、Business、Enterprise、Edu 用戶。免費與 Go 用戶可在桌面 app 存取 GPT-6 Luna,但暫不支援 Chat。API 端以 gpt-6-sol 與 gpt-6-luna 提供。OpenAI 表示將於當日分批推送以維持服務穩定。
為什麼這件事重要
GPT-6 Sol 與 Luna 的真正意義不在於「多了一個模型」,而是 OpenAI 把 GPT-6 Astra 級別的智能拉到了「可以大規模日常使用」的價格帶。
當 GPT-6 Sol 在 AutomationBench 上以 9% 的成本打敗 Claude Opus 5、GPT-6 Luna 在 Coding 基準上以 7% 的成本達到 Opus 5 等級表現,這意味著企業過去因為成本考量而不敢讓 AI agent 跑長流程、跑大量任務的限制,正在快速消失。
更關鍵的是,這次發布與 Anthropic 同日推出 Claude Opus 5.5(降價約 40%)形成正面對決。兩家廠商同日把價格砍到新低,壓力會直接傳遞到 Google(Gemini)、xAI(Grok)、以及所有開源模型陣營——對開發者而言,2026 年第四季將是 AI 應用成本結構最有利的一段時間。
數據解讀與質疑
官方公布的基準都是 OpenAI 自家版本,但有幾個面向值得進一步觀察:
第一,AutomationBench、FrontierCode、DeepSWE 都是 OpenAI 設計或深度參與的基準,獨立第三方(如 llm-stats、benchlm.ai)需要時間累積足夠樣本才能驗證 Sol 與 Luna 的實際表現。
第二,「50% 降價」是相對於 GPT-5.6 的促銷價格(promotional pricing),並非完整歷史最低;2026 年 7 月底 OpenAI 已對 GPT-5.6 Luna 做過 80% 降價,因此「降價一半」的對比基準需要更精確的脈絡。
第三,「Coding 欺騙率下降」等對齊指標是 OpenAI 內部評估,與生產環境真實表現可能存在落差。Sam Altman 在 Astra 上線時承認「rollout 很亂」,並承諾會持續修正——Sol 與 Luna 是否能避免類似問題,仍需實際部署後觀察。
第四,Claude Opus 5.5 同日發表並降價 40%,兩家廠商幾乎同步降價的時機點,顯示 AI 模型市場已進入價格戰階段;下一波觀察重點將會是 Google Gemini 3 與 xAI Grok 4 是否在年底前跟進。
網友熱門留言 (5)