← 返回 Siami 首頁

Cerebras 與 OpenAI 聯手推出 GPT-5.6 Sol Ultrafast 推理速度衝到 750 tokens/s

▲ 307 💬 121
Cerebras 與 OpenAI 聯手推出 GPT-5.6 Sol Ultrafast 推理速度衝到 750 tokens/s

編按:本文綜合整理自 Cerebras 官方部落格、OpenAI 官方公告、Yahoo Finance / Globe Newswire 公關稿、byteiota 技術分析與 Hacker News 社群討論,並加入 Siami 編輯部觀點與分析。

OpenAI 與 AI 晶片公司 Cerebras 8 月 13 日聯手宣布一項震撼業界的消息:在 OpenAI API 中推出全新的 Ultrafast Mode 服務層級,由 Cerebras 的 Wafer-Scale Engine(WSE)晶片驅動 GPT-5.6 Sol,達到每秒 750 個輸出 token 的驚人速度,比 Standard 處理快上 14 倍。

這個速度不是犧牲品質換來的——Cerebras 官方表示「沒有任何品質妥協」(without any quality compromise),直接挑戰了業界長期以來「速度與智能只能二選一」的天花板。


Ultrafast 是什麼?Cerebras 怎麼做到的?

Ultrafast 並不是新模型,而是 OpenAI API 上一個全新的服務層級。同樣是 GPT-5.6 Sol 模型,但運行在 Cerebras 的客製硬體上,獲得截然不同的延�表現。

Cerebras 的關鍵技術差異在於 Wafer-Scale Engine 架構:

  • 單一晶圓級晶片塞入 44 GB SRAM
  • 模型權重全部駐留在晶片上(on-chip),不需要在 on-chip 記憶體與 off-chip 儲存間反覆搬運
  • Token 在跨晶�的模型層之間不中斷流動

相較之下,傳統 GPU 推理會被記憶體頻寬瓶頸卡住——模型權重必須反覆從 off-chip HBM 搬到 SM 暫存區才能生成下一個 token。Cerebras 把這個資料搬運問題從根本上消除。

「GPT-5.6 Sol on Ultrafast 證明了速度與智能不再是互相排斥的選擇。」—— Andrew Feldman, Cerebras 共同創辦人暨 CEO


數字會說話:HLE 與 GDP-Val 基準測試

Cerebras 在部落格中直接對 Ultrafast 跑了一輪 head-to-head 測試,挑了兩個指標性 benchmark:

Humanity’s Last Exam(HLE)

這份考卷包含 2,500 題通常只有化學、經濟、文學等領域博士才能回答的艱深問題。

模型跑完整份 HLE 的時間
GPT-5.6 Sol(Ultrafast)11 小時 11 分鐘
Claude Fable 578 小時 27 分鐘(約 3 天多)

換句話說,Ultrafast 用一個工作天就跑完人類知識邊界的試卷,而且品質相近——比 Fable 5 快約 7 倍。

註:Cerebras 7 月 10 日用 GPT-5.6 Sol Ultrafast + Codex xhigh reasoning 跑這份測試;7 月 13-15 日用 Claude Fable 5 + Claude Code xhigh reasoning 跑對照組。

GDP-Val(經濟價值知識工作任務)

GPT-5.6 Sol 是 OpenAI 目前在法律訴狀、財務模型、工程報告等高價值任務上表現最好的模型。在 GDP-Val 上,Ultrafast 達到 5.6x end-to-end 速度提升,且沒有品質下降。

註:基準測試由 Cerebras 於 7 月 31 日執行,使用 GPT-5.6 Sol 與 GPT-5.6 Sol Ultrafast 在 Codex 內的 medium reasoning。

與競爭對手的橫向對比

比較對象Ultrafast 加速倍數
Fable 511x
Opus 4.8(Fast mode)5x
OpenAI Standard processing14x

🚨 為什麼這件事重要

這個合作不是單純的行銷活動,而是 AI 基礎設施版圖的關鍵位移:

1. Nvidia 的護城河被撬開一角

過去幾年 Nvidia H100/H200 幾乎�斷了大型語言模型的推理市場。Cerebras 用 750 tok/s 對比 H100 集群約 70 tok/s 的對應表現,直接拉出 10x 吞吐量差距。雖然這只是單一模型、單一工作負載的展示,但對「GPU 是 AI 推理唯一選擇」的敘事是一記重擊。

OpenAI 也沒打算把雞蛋放在同一個籃子——1 月時就宣布與 Cerebras 簽下 750 MW 超低延遲 AI 算力的合約,會分批在 2028 年前陸續上線。這代表 OpenAI 內部已經把 Cerebras 視為長期基礎設施合作夥伴,而非短期 demo 夥伴。

2. 推理延遲正式成為「模型選用軸」

過去選模型的標準是品質、價格、上下文窗口。現在 byteiota 的技術分析點出關鍵轉折:推理吞吐量正式成為第一級選用標準。

GPT-5.6 Sol 在 TerminalBench 2.1 拿到 88.8%,比 Claude Opus 4.8 的 78.9% 高出約 10 個百分點。加上 Cerebras 加速後每百萬 token 的價格(輸入 $5 / 輸出 $30)又比 Opus 4.8 便宜,OpenAI 等於在品質 × 速度 × 價格三個維度同時領先。

3. 代理(Agent)工作流將被重塑

OpenAI 研究員 Jeffrey Wang 的引言透露了真正的殺手級應用:

「以前要等幾分鐘才能完成的任務,現在在我來得及切換 context 之前就跑完了。」—— Jeffrey Wang, OpenAI Researcher

意思是說:串瓶頸(serially bottlenecked)的 AI 研究流程現在可以即時互動。傳統 AI agent 工作流被「等模型回應」的延遲切碎成好幾段,當延遲低到人類注意力無法察覺,整個 agent 工作流可以重新設計成「即時對話」。


🚨 數據解讀與質疑

Cerebras 與 OpenAI 給出的數字很亮眼,但有幾個必須冷靜看待的地方:

1. 沒有公開品質基準的細節

Hacker News 上排名第二的質疑(100 個 upvote)很到位:

「兩篇官方公告都沒有直接聲稱 Ultrafast 跟一般 GPT-5.6 Sol 表現完全一樣。」

Cerebras 在 HLE 強調結果品質相近、在 GDP-Val 強調沒有品質下降,但都沒公開分項分數。HLE 是一個結果收斂型 benchmark(2,500 題的最終答案可以對齊),所以「跑完時間」本身不是品質的絕對證明。真正的關鍵是:HLE 上的正確率有沒有掉?

2. 14x 不是「所有情境下」的 14x

OpenAI 部落格用的是「up to 14x」這個保守說法。實務上:

  • 不同 prompt 長度會影響加速比(短 prompt 加速更明顯,因為 GPU 瓶頸更純粹)
  • reasoning effort 設定會影響加速比(xhigh reasoning 會跑更多 intermediate token,加速比會壓縮)
  • Codex vs API 直連的加速比可能不同

所以「14x」應該理解為最佳情境下的峰值,不是保證值。

3. 沒有公開定價

另一位 HN 用戶(50 upvote)點出另一個現實問題:

「沒有公開定價,可能代表『問了也不告訴你』的層級,也可能只是他們還在觀望興趣。」

考慮到 Cerebras 一年前 NASDAQ 上市(CBRS)、股價波動劇烈,加上 OpenAI 與 Cerebras 都對這個服務的商業模式守口如瓶,現在評估對企業客戶的實際成本衝擊還太早。預期會走 premium tier 定價,可能比 Standard 貴上數倍。

4. 750 tok/s 是峰值不是穩態

業界分析師 Bleys Goodson 推測 GPT-5.6 Sol 跨越 70 到 100 顆 Cerebras 晶圓,每層神經網路單獨放在一整顆 wafer 上。這種奢侈部署方式才能撐住 750 tok/s 的峰值,但成本與能耗也同步放大。

長期看,Cerebras 也宣布在歐洲投資數十億美元建 200 MW 資料中心(2027 年底前),代表他們知道目前的部署密度不可持續,正在砸資本支出擴產能。


官方與業界引言整理

「GPT-5.6 Sol on Ultrafast 證明了速度與智能不再是互相排斥的選擇。我們與 OpenAI 一起把前沿智能交到使用者手上,速度前所未見,改變了 AI 能做到的事。」—— Andrew Feldman, Cerebras 共同創辦人暨 CEO

「結合 GPT-5.6 Sol 與 Cerebras 推理技術後,我們正在探索當客戶拿到最強模型智能、搭配顯著降低延遲時的可能性。我們先從一小群客戶開始,了解速度在哪裡創造實質價值,再用這些學習決定如何擴展服務。」—— Sachin Katti, OpenAI VP of Compute Strategy & GPT-Infra

「Cerebras 帶來的速度提升令人印象深刻。它讓模型有了不同的使用方式,也讓開發者能更專注、更有效率地跟他們協作。」—— John Crepezzi, AI Assistants, Jane Street

「Ultrafast 在我們的語音 AI 技術�上無可取代。速度徹底改變了較複雜工作的通話體驗。」—— Courtland Lykins, Product Lead, Voice AI, Podium


怎麼申請使用 Ultrafast?

OpenAI 官方表示 GPT-5.6 Sol on Ultrafast 目前是有限預覽(limited preview),只給部分精選客戶。官方提供「Sign up for updates」按鈕讓開發者訂閱容量開放通知。

實際可用性預計會分階段擴展,跟 Cerebras 750 MW 算力的部署進度掛鉤(多批在 2028 年前上線)。


延伸資源


Siami 觀點:這次合作最值得追蹤的不是「速度多快」這個單一數字,而是OpenAI 是不是真的開始把 AI 推理視為「基礎設施市場」而非「模型市場」。當一個前沿模型的瓶頸不再是模型本身、而是底層算力供應鏈時,接下來兩年我們會看到更多「同模型、不同硬體」的服務層級出現。對開發者而言,選模型會從「哪個模型最好」變成「哪個 (模型, 硬體) 組合最划算」的多維度問題。

網友熱門留言 (3)

#1 Hacker News 社群 ▲ 533
等了好久,OpenAI 跟 Cerebras 的合作終於端出能讓人驚呼的東西了。
#2 Hacker News 社群(質疑品質) ▲ 100
兩篇官方公告都沒有直接聲稱 Ultrafast 跟一般 GPT-5.6 Sol 表現完全一樣,這點讓人不太放心。
#3 Hacker News 社群(推測用途) ▲ 96
OpenAI 大概會先把這個速度用在內部串瓶頸的研究上,這才是他們對 Cerebras 合作最在意的點。