編按:本文綜合整理自 Cerebras 官方部落格、OpenAI 官方公告、Yahoo Finance / Globe Newswire 公關稿、byteiota 技術分析與 Hacker News 社群討論,並加入 Siami 編輯部觀點與分析。
OpenAI 與 AI 晶片公司 Cerebras 8 月 13 日聯手宣布一項震撼業界的消息:在 OpenAI API 中推出全新的 Ultrafast Mode 服務層級,由 Cerebras 的 Wafer-Scale Engine(WSE)晶片驅動 GPT-5.6 Sol,達到每秒 750 個輸出 token 的驚人速度,比 Standard 處理快上 14 倍。
這個速度不是犧牲品質換來的——Cerebras 官方表示「沒有任何品質妥協」(without any quality compromise),直接挑戰了業界長期以來「速度與智能只能二選一」的天花板。
Ultrafast 是什麼?Cerebras 怎麼做到的?
Ultrafast 並不是新模型,而是 OpenAI API 上一個全新的服務層級。同樣是 GPT-5.6 Sol 模型,但運行在 Cerebras 的客製硬體上,獲得截然不同的延�表現。
Cerebras 的關鍵技術差異在於 Wafer-Scale Engine 架構:
- 單一晶圓級晶片塞入 44 GB SRAM
- 模型權重全部駐留在晶片上(on-chip),不需要在 on-chip 記憶體與 off-chip 儲存間反覆搬運
- Token 在跨晶�的模型層之間不中斷流動
相較之下,傳統 GPU 推理會被記憶體頻寬瓶頸卡住——模型權重必須反覆從 off-chip HBM 搬到 SM 暫存區才能生成下一個 token。Cerebras 把這個資料搬運問題從根本上消除。
「GPT-5.6 Sol on Ultrafast 證明了速度與智能不再是互相排斥的選擇。」—— Andrew Feldman, Cerebras 共同創辦人暨 CEO
數字會說話:HLE 與 GDP-Val 基準測試
Cerebras 在部落格中直接對 Ultrafast 跑了一輪 head-to-head 測試,挑了兩個指標性 benchmark:
Humanity’s Last Exam(HLE)
這份考卷包含 2,500 題通常只有化學、經濟、文學等領域博士才能回答的艱深問題。
| 模型 | 跑完整份 HLE 的時間 |
|---|---|
| GPT-5.6 Sol(Ultrafast) | 11 小時 11 分鐘 |
| Claude Fable 5 | 78 小時 27 分鐘(約 3 天多) |
換句話說,Ultrafast 用一個工作天就跑完人類知識邊界的試卷,而且品質相近——比 Fable 5 快約 7 倍。
註:Cerebras 7 月 10 日用 GPT-5.6 Sol Ultrafast + Codex xhigh reasoning 跑這份測試;7 月 13-15 日用 Claude Fable 5 + Claude Code xhigh reasoning 跑對照組。
GDP-Val(經濟價值知識工作任務)
GPT-5.6 Sol 是 OpenAI 目前在法律訴狀、財務模型、工程報告等高價值任務上表現最好的模型。在 GDP-Val 上,Ultrafast 達到 5.6x end-to-end 速度提升,且沒有品質下降。
註:基準測試由 Cerebras 於 7 月 31 日執行,使用 GPT-5.6 Sol 與 GPT-5.6 Sol Ultrafast 在 Codex 內的 medium reasoning。
與競爭對手的橫向對比
| 比較對象 | Ultrafast 加速倍數 |
|---|---|
| Fable 5 | 11x |
| Opus 4.8(Fast mode) | 5x |
| OpenAI Standard processing | 14x |
🚨 為什麼這件事重要
這個合作不是單純的行銷活動,而是 AI 基礎設施版圖的關鍵位移:
1. Nvidia 的護城河被撬開一角
過去幾年 Nvidia H100/H200 幾乎�斷了大型語言模型的推理市場。Cerebras 用 750 tok/s 對比 H100 集群約 70 tok/s 的對應表現,直接拉出 10x 吞吐量差距。雖然這只是單一模型、單一工作負載的展示,但對「GPU 是 AI 推理唯一選擇」的敘事是一記重擊。
OpenAI 也沒打算把雞蛋放在同一個籃子——1 月時就宣布與 Cerebras 簽下 750 MW 超低延遲 AI 算力的合約,會分批在 2028 年前陸續上線。這代表 OpenAI 內部已經把 Cerebras 視為長期基礎設施合作夥伴,而非短期 demo 夥伴。
2. 推理延遲正式成為「模型選用軸」
過去選模型的標準是品質、價格、上下文窗口。現在 byteiota 的技術分析點出關鍵轉折:推理吞吐量正式成為第一級選用標準。
GPT-5.6 Sol 在 TerminalBench 2.1 拿到 88.8%,比 Claude Opus 4.8 的 78.9% 高出約 10 個百分點。加上 Cerebras 加速後每百萬 token 的價格(輸入 $5 / 輸出 $30)又比 Opus 4.8 便宜,OpenAI 等於在品質 × 速度 × 價格三個維度同時領先。
3. 代理(Agent)工作流將被重塑
OpenAI 研究員 Jeffrey Wang 的引言透露了真正的殺手級應用:
「以前要等幾分鐘才能完成的任務,現在在我來得及切換 context 之前就跑完了。」—— Jeffrey Wang, OpenAI Researcher
意思是說:串瓶頸(serially bottlenecked)的 AI 研究流程現在可以即時互動。傳統 AI agent 工作流被「等模型回應」的延遲切碎成好幾段,當延遲低到人類注意力無法察覺,整個 agent 工作流可以重新設計成「即時對話」。
🚨 數據解讀與質疑
Cerebras 與 OpenAI 給出的數字很亮眼,但有幾個必須冷靜看待的地方:
1. 沒有公開品質基準的細節
Hacker News 上排名第二的質疑(100 個 upvote)很到位:
「兩篇官方公告都沒有直接聲稱 Ultrafast 跟一般 GPT-5.6 Sol 表現完全一樣。」
Cerebras 在 HLE 強調結果品質相近、在 GDP-Val 強調沒有品質下降,但都沒公開分項分數。HLE 是一個結果收斂型 benchmark(2,500 題的最終答案可以對齊),所以「跑完時間」本身不是品質的絕對證明。真正的關鍵是:HLE 上的正確率有沒有掉?
2. 14x 不是「所有情境下」的 14x
OpenAI 部落格用的是「up to 14x」這個保守說法。實務上:
- 不同 prompt 長度會影響加速比(短 prompt 加速更明顯,因為 GPU 瓶頸更純粹)
- reasoning effort 設定會影響加速比(xhigh reasoning 會跑更多 intermediate token,加速比會壓縮)
- Codex vs API 直連的加速比可能不同
所以「14x」應該理解為最佳情境下的峰值,不是保證值。
3. 沒有公開定價
另一位 HN 用戶(50 upvote)點出另一個現實問題:
「沒有公開定價,可能代表『問了也不告訴你』的層級,也可能只是他們還在觀望興趣。」
考慮到 Cerebras 一年前 NASDAQ 上市(CBRS)、股價波動劇烈,加上 OpenAI 與 Cerebras 都對這個服務的商業模式守口如瓶,現在評估對企業客戶的實際成本衝擊還太早。預期會走 premium tier 定價,可能比 Standard 貴上數倍。
4. 750 tok/s 是峰值不是穩態
業界分析師 Bleys Goodson 推測 GPT-5.6 Sol 跨越 70 到 100 顆 Cerebras 晶圓,每層神經網路單獨放在一整顆 wafer 上。這種奢侈部署方式才能撐住 750 tok/s 的峰值,但成本與能耗也同步放大。
長期看,Cerebras 也宣布在歐洲投資數十億美元建 200 MW 資料中心(2027 年底前),代表他們知道目前的部署密度不可持續,正在砸資本支出擴產能。
官方與業界引言整理
「GPT-5.6 Sol on Ultrafast 證明了速度與智能不再是互相排斥的選擇。我們與 OpenAI 一起把前沿智能交到使用者手上,速度前所未見,改變了 AI 能做到的事。」—— Andrew Feldman, Cerebras 共同創辦人暨 CEO
「結合 GPT-5.6 Sol 與 Cerebras 推理技術後,我們正在探索當客戶拿到最強模型智能、搭配顯著降低延遲時的可能性。我們先從一小群客戶開始,了解速度在哪裡創造實質價值,再用這些學習決定如何擴展服務。」—— Sachin Katti, OpenAI VP of Compute Strategy & GPT-Infra
「Cerebras 帶來的速度提升令人印象深刻。它讓模型有了不同的使用方式,也讓開發者能更專注、更有效率地跟他們協作。」—— John Crepezzi, AI Assistants, Jane Street
「Ultrafast 在我們的語音 AI 技術�上無可取代。速度徹底改變了較複雜工作的通話體驗。」—— Courtland Lykins, Product Lead, Voice AI, Podium
怎麼申請使用 Ultrafast?
OpenAI 官方表示 GPT-5.6 Sol on Ultrafast 目前是有限預覽(limited preview),只給部分精選客戶。官方提供「Sign up for updates」按鈕讓開發者訂閱容量開放通知。
實際可用性預計會分階段擴展,跟 Cerebras 750 MW 算力的部署進度掛鉤(多批在 2028 年前上線)。
延伸資源
- Cerebras 官方部落格(本文主要來源)
- OpenAI Ultrafast 預覽公告
- OpenAI × Cerebras 合作公告(2026-01-14)
- GPT-5.6 模型發表(2026-07-09)
- Cerebras 公關稿:Yahoo Finance / Globe Newswire
- byteiota 技術分析:750 tok/s 如何改變 agent 延遲
- Hacker News 原始討論串(307 分、224 評論)
Siami 觀點:這次合作最值得追蹤的不是「速度多快」這個單一數字,而是OpenAI 是不是真的開始把 AI 推理視為「基礎設施市場」而非「模型市場」。當一個前沿模型的瓶頸不再是模型本身、而是底層算力供應鏈時,接下來兩年我們會看到更多「同模型、不同硬體」的服務層級出現。對開發者而言,選模型會從「哪個模型最好」變成「哪個 (模型, 硬體) 組合最划算」的多維度問題。
網友熱門留言 (3)