編按:本文綜合整理自 OpenAI 官方部落格、OpenAI 客服中心、GPT-5.6 Preview System Card、VentureBeat、Handy AI Substack、DataCamp,並加入 Siami 編輯部觀點與分析。
OpenAI 在 6 月 26 日正式宣告 GPT-5.6 系列進入「有限預覽」階段,旗下三款模型同步亮相——Sol 為旗艦、Terra 為中高階、Luna 為高速低價款。值得注意的是,這次發表並非全面開放下載,而是「在美國政府要求下」,先開放給一群經政府備查的「信任合作夥伴」使用。
三款模型的分工與定價
OpenAI 在新版命名規則中,把「世代編號」與「能力等級」拆開:5.6 是整個家族的世代名,而 Sol / Terra / Luna 則是可獨立推進的長期能力位階。對開發者而言,這代表未來不必再死守單一旗艦,可依任務特性選用不同 tier。
| 模型 | 定位 | Input 價格(/1M tokens) | Output 價格(/1M tokens) |
|---|---|---|---|
| Sol | 旗艦,能力最強 | 5 美元 | 30 美元 |
| Terra | 中高階,與 GPT-5.5 同級但更便宜 | 2.5 美元 | 15 美元 |
| Luna | 高速低價,大量任務用 | 1 美元 | 6 美元 |
官方說明:Terra 的能力對標 GPT-5.5,但價格只要一半;Luna 則是用最低成本提供「堪用」等級的表現。
Sol 另支援兩項新功能:max reasoning effort(讓模型有更多時間深度推論)以及 ultra mode(透過 subagent 平行運算來加速複雜工作流)。OpenAI 也宣布 7 月起,Sol 將獨家在 Cerebras 晶片上以最高 750 tokens/sec 的速度運行,主打「超低延遲的旗艦體驗」。
基準成績:擊敗 Claude Mythos Preview、ExploitGym 全面進步
OpenAI 在官方公告中只挑選了自己領先的項目公開,分別對應 coding、生物、資安三大領域:
- Coding:在 Terminal-Bench 2.1(測試命令列工作流的規劃、迭代、工具協調能力)拿下新 SOTA。
- Biology:在 GeneBench v1(長時序基因體與量化生物分析)以更少 token 數擊敗 GPT-5.5。
- Cybersecurity:在 ExploitBench 上,Sol 僅用 Mythos Preview 約 1/3 的 output token 就達到同級成績;在 UC Berkeley 與多家前沿實驗室共同開發的 ExploitGym 上,Sol / Terra / Luna 三款模型都展現出「隨推論強度上升而顯著增強」的趨勢。
備註:OpenAI 強調 Sol「未達」自家 Preparedness Framework 定義的「Cyber Critical」最高風險閾值。在 Chromium 與 Firefox 的測試中,它能找 bug、能抓出 exploit 的「原語」拼圖,但沒有在受測條件下自主端到端跑出完整攻擊鏈。
分層防護堆疊:訓練時拒答、即時分類器、帳號層級監控
這次 Sol、Terra、Luna 三款都被 OpenAI 自評為「高」風險等級(不只 Sol),涵蓋 cyber 與 biological/chemical 兩類,但在 AI self-improvement 評估上仍低於「高」。官方把整套防護拆成六層堆疊:
- 模型層級:訓練時就把禁制的 cyber 協助(包括 jailbreak 嘗試)直接拒絕
- 即時分類器:輸出過程中即時評估,高風險時會先暫停、由更大的 reasoning model 接手審查上下文
- 帳號層級審查:跨對話觀察使用模式,區分「真正的安全研究」與「持續性濫用」
- 差別化存取:高敏感能力預設不全面開放
- 監控與執法:違反條款時觸發
- 持續測試:第三方人肉紅隊 + 自動紅隊雙軌並行
自動紅隊這次用上 超過 70 萬 A100 等效 GPU 小時,專門尋找「跨提示都能通用」的 universal jailbreak。
為什麼這件事重要
這次發表不單純是「新一代模型」,而是一次模型商業模式 + 政府監管的雙重訊號。
第一,OpenAI 自己承認:「我們不相信這種政府准入流程應該成為長期預設」。一句話就把整個「信任合作夥伴名單 + 政府備查」機制的本質講白了——這是短期的政治讓步,不是公司自願的產品設計。對企業用戶而言,這代表未來若美國政府換人、換政策,OpenAI 的高階模型「能見度」可能一夜翻盤。
第二,定價策略是針對開發者市場的。Sol 30 美元/M output 雖然不是業界最貴,但對大量批次任務明顯不划算。Terra 與 Luna 的存在,本質上是把「想用 GPT-5.6 能力但預算有限」的開發者拉進來——這跟 Anthropic 把 Opus / Sonnet / Haiku 拆成三層是完全相同的市場卡位邏輯。
第三,「以 Cerebras 跑 Sol」是硬體綁定訊號。OpenAI 雖然嘴上說靠 NVIDIA,但在 7 月把 Sol 旗艦分出來給 Cerebras 跑,代表他們對 NVIDIA 的依賴正在多元化。這對 NVIDIA 的「exclusive frontier partner」形象是個小裂縫。
對台灣與中文圈開發者最直接的影響:ChatGPT 介面短期內還沒有 GPT-5.6,所有存取都必須透過 API 跟 Codex。所以要試用只能走 API key。Hacker News 上最多人抱怨的也正是這點:「什麼時候才輪到我們這種小寫 code 的用?」
數據解讀與質疑
第一,OpenAI 沒有公開完整 benchmark 對標。官方刻意只挑 Mythos Preview「自己領先」的項目對比,但 Gemini 3.1 Pro、Claude Opus 4.8、Fable 5 等同級對手在 Terminal-Bench 2.1 的分數並未揭露。DataCamp 的分析師就指出,這是典型的「選邊站」式 benchmark 揭露。
第二,「信任合作夥伴」名單至今未公開。OpenAI 說「at the request of the U.S. government」展開有限預覽,但哪 20 家企業拿到 API、標準是什麼、政府備查的內容是什麼——全部沒講。這跟 Anthropic 一週前因美國出口管制令直接下架 Fable 5 與 Mythos 5 的作法,邏輯上是一致的,但透明度更低。
第三,Cerebras 跑 Sol 的延遲數字 (750 tokens/sec) 還沒有獨立驗證。OpenAI 自己寫「in production, the experience will vary」——也就是說,這個數字是實驗室環境下測出來的,不一定等於企業用戶實際接 API 的體驗。對需要 low-latency agent 的場景來說,這是關鍵的不確定性。
第四,prompt cache 計價方式變了。從 GPT-5.6 起,cache write 開始收 1.25× 的費用(過去是免費或優惠),cache read 仍享 90% 折扣。對做長對話、文件問答、RAG 的人來說,這會直接影響成本估算——短期內成本可能微漲。
為什麼開發者要關心命名變更
「撇開 Sol / Terra / Luna 這個史上最糟的命名不談」——Hacker News 留言區最高讚數的吐槽
雖然命名被社群吐得很慘,但 OpenAI 設計這套體系的真正訊號是:模型世代編號跟能力 tier 解耦了。意思是,未來不一定每代都要等旗艦出來才能升級。Terra 可以單獨推進,Luna 也可以單獨推進。
對企業架構師來說,這是個重要訊號:你不能再假設「最新一代 = 最強」。未來部署策略可能會變成「同一世代內依任務特性混搭三個 tier」——例如客服自動化走 Luna、code review 走 Terra、research 走 Sol。這跟現在 AWS 不同 instance type 的選用邏輯已經很接近了。
下一步:搶先體驗的三條路徑
- 企業合作夥伴:OpenAI 與美國政府協調的「信任合作夥伴名單」(未公開)
- Cerebras 客戶:7 月起透過 Cerebras 硬體取得 Sol 的 750 tokens/sec 低延遲版本
- 一般開發者:等 OpenAI 在「未來數週」全面釋出 API、Codex、ChatGPT 三大通路
OpenAI 強調:「我們的目標是在未來數週內廣泛釋出,並持續與政府合作發展 cyber Executive Order 框架,讓未來模型發布有可重複的流程」——言下之意,這次的政治讓步換來的是流程制度化的入場券,不是單次事件。
短期內最值得追蹤的,是 OpenAI 什麼時候把「信任合作夥伴」名單公開,以及 Cerebras 750 tokens/sec 的 Sol 在獨立 benchmark(lmsys、HELM、ExploitGym)上能不能撐住 SOTA。對中文圈開發者而言,最實際的下一步是先把現有 GPT-5.5 程式碼、prompt、agent pipeline 整理好,等 GPT-5.6 全面開放時才能無痛切換。
網友熱門留言 (5)