編按:本文綜合整理自 Cerebras 官方部落格、官方產品頁、GlobeNewswire 官方新聞稿(Manila Times 轉載)、Investing.com 活動實錄、Stock Titan 財經分析,並加入 Siami 編輯部觀點與分析。
Cerebras Systems 於 2026 年 8 月 18 日在加州 Sunnyvale 舉行的 Supernova 2026 大會上,正式發表第四代晶圓級 AI 加速器 CS-4。Cerebras 宣稱 CS-4 是業界最快的 AI 加速器,相較 GPU 系統在推論速度上最快可達 30 倍提升,且是首個採用新一代 Nexus 機櫃級平台架構的產品。首波出貨將在本季(2026 Q3)啟動。
硬體核心:三顆 WSE-3 Turbo 組成
CS-4 機櫃系統的核心是 三顆全新的 Wafer Scale Engine 3 Turbo(WSE-3 Turbo)處理器。WSE-3 Turbo 是 Cerebras 第三代晶圓級引擎的強化版本,每片晶圓整合 4 兆顆電晶體、90 萬個 AI 核心,整片晶圓不切割,整顆當作單一處理器使用。
CS-4 機櫃搭載 3 顆 WSE-3 Turbo 晶圓,官方強調三晶圓之間透過新的 Wafer I/O Module 連接,可在同一機櫃甚至跨機櫃之間不需交換器直接對接,晶�對晶圓延遲壓到 2 微秒。這項設計讓 CS-4 在參數量超過 10 兆的模型上,仍能維持每秒 1,000 tokens 以上的解碼速度,並支援 50 兆參數以上的模型架構。
「把整片 12 吋晶圓當作一顆晶片」這件事,Cerebras 已做了八年。CS-4 的差異不在於「更大」,而在於「整個機櫃從電源、冷卻、I/O 全部重新設計」,讓三顆晶圓能像單一系統一樣運作。
速度與能源效率的官方數據
Cerebras 在記者會上公布的核心數字(與前代 CS-3 對比):
- 推論速度最高可達 GPU 系統的 30 倍
- 相較 CS-3,每晶圓速度最高提升 2 倍
- 每瓦吞吐量最高可達 CS-3 的 10 倍
- 晶�對晶圓互連延遲:2 微秒(對比傳統 GPU 機櫃間通訊延遲通常為數十微秒等級)
Cerebras 同時展示與 OpenAI 合作的 GPT-5.6 Sol Ultrafast 模式,最高可達 750 tokens/秒;以及 GPT-OSS-120B 模型在 CS-4 上跑出每秒 4,400 tokens 以上的單用戶速度。
Nexus 機櫃級平台架構
CS-4 是 Cerebras 新世代 Nexus Platform Architecture 的首款產品。Nexus 把機櫃設計拆成三個基礎模組:
1. Wafer-Scale Backpack(運算背包)
把晶圓、電源轉換、直液冷卻、高速 I/O、控制電子全部摺進一個 3D 封裝模組。Cerebras 強調這個設計比前代少了 50% 的零件數,部署時間從過去的「天」縮短到「小時」。
2. 高密度電源傳輸(Power Delivery)
把電源轉換層做到距離處理器僅 0.5mm(傳統 GPU 主機板約 50mm,差距約 100 倍),幾乎消除主機板層級的功率損耗,因此能輸送 2 倍功率到 WSE-3T,運行頻率更高、token 生成更快。
3. 全新可程式化 I/O 子系統
I/O 頻寬加倍、延遲降低。Wafer I/O Module 讓晶圓可在機櫃內、跨機櫃之間不透過交換器直接互連,這對數兆參數模型的互動式解碼至關重要。
4. Cerebras PowerRack(分離式基礎設施)
Nexus 設計的核心精神:先把穩定的電力、冷卻、網路層安裝好並通過機房驗證,再把運算背包滑入插槽接上。這讓 hyperscale 資料中心能「先建基礎設施、再補運算」,並簡化未來升級。
商業佈局與客戶生態
Cerebras 在 Supernova 2026 同時宣布多項合作與市場動作:
- 與 OpenAI 合作:GPT-5.6 Sol Ultrafast 模式在 Cerebras 硬體上運作,最高 750 tokens/秒
- 與 AMD 合作:AMD Helios 平台 + Cerebras Wafer-Scale Engine,做分離式推論(prefill 在 AMD、decode 在 Cerebras)
- 與 Lovable 合作:Lovable 選用 Cerebras 專屬容量做延遲敏感的軟體開發工作負載
- 與 CrowdStrike 合作:把超高速推論導入資安威脅分析場景
- 2027 年底前預計交付 600 MW 運算容量(CEO Andrew Feldman 公開承諾)
財務面:上週 Cerebras 公布 Q2 營收 1.801 億美元、調整後虧損 690 萬美元,並將 2026 全年核心營收指引上調至 8.8 至 8.9 億美元。
為什麼這件事重要
這是 AI 基礎設施市場近兩年最具體的「非 Nvidia 路徑」實證。過去外界對 Cerebras 的質疑集中在三點:產量(晶圓良率)、生態(只有自家 SDK)、適用場景(記憶體頻�解,但大規模模型仍受限)。
CS-4 試圖一次回答這三個質疑:
- 產量與良率:Nexus 把晶圓封裝成可抽換的「Wafer-Scale Backpack」,並搭配分離式 PowerRack,把過去需要整機搬運部署的工作拆成「先建機房、再補運算」。這直接把 hyperscale 部署時間從天壓到小時,並讓工廠只需製造單一模組,不必一次組裝整機。
- 生態與相容性:CS-4 與 AMD Helios 的合作意味 Cerebras 不再堅持「單一生態」—— 它主動走進異質推論架構。對 hyperscaler 來說,這讓「GPU 做 prefill + Cerebras 做 decode」的混合部署變得可行,擴大了 Cerebras 的客戶池。
- 場景:CS-4 直接瞄準「推理速度決定產品差異化」的應用:即時編碼(Lovable)、即時資安(CrowdStrike)、即時對話(OpenAI GPT-5.6 Sol Ultrafast)。過去這些客戶必須在「用 GPU」與「接受延遲」之間取捨,CS-4 提供第三條路。
更重要的是商業訊號:Cerebras 已上市(NASDAQ: CBRS),且能在 Q2 交出 1.8 億美元營收的同時上調全年指引到 8.8 億美元。對 NVDA 持股者來說,CS-4 並非要取代 GPU,而是要拿走「對延遲最敏感的 10-20% 推論工作負載」這塊高價值市場—— 而這恰好是 2026 年所有 LLM 公司最在意的成本結構。
數據解讀與質疑
幾個數字值得交叉檢驗:
- 「最高 30 倍」:Cerebras 自家 benchmark 與 Artificial Analysis 第三方測試結果一致(Open Llama 3.3 70B 在 CS-3 上已達 2,314 tokens/秒,約為 Bedrock 的 70 倍)。但這個比較是「per-user inference latency」而非「aggregate throughput」,對 batch 場景的優勢會明顯縮水。
- 「2 微秒晶圓互連」:這只在 CS-4 內部三晶�之間適用。對 50 兆以上參數模型,仍需透過 MemoryX 外部儲存與 SwarmX 集群 fabric,整體延遲會顯著上升。
- 「2027 年 600 MW」:這是 CEO 在發表會的願景數字,實際出貨節奏取決於 PowerRack 的安裝進度與客戶簽約速度。Q2 690 萬美元的小幅虧損顯示公司仍在投資期,毛利率改善要看 CS-4 量產後。
- 「50% 零件減少」:是相對 CS-3 的內部設計簡化,不等於整機成本降低 50% —— 晶圓級封裝本身仍屬高成本製程。
編按:原始發表會上的 30x 與 100x 等數字,多半是「per-user latency」與「特定模型」的對比,不應直接解讀為「CS-4 全面碾壓 GPU 30 倍」。在 batch 推論、長 context、訓練等場景,Cerebras 與頂級 GPU(如 NVIDIA B200)仍各有勝負。
業界回應與社群討論
Hacker News 對 CS-4 發表的討論串(129 分、81 則回應)呈現明顯兩極:
正面聲音:30x 的 per-user 速度對即時 agentic workflow 是決定性差異。如果 token 延遲低於人類閱讀速度,AI 互動產品形態會完全改變。
質疑聲音:Cerebras 的歷史 benchmark 多半在「小到中型模型 + 低 batch」場景下取勝,對 70B 以上大模型的吞吐量優勢明顯縮水;且 wafer-scale 良率與封裝成本始終是外界疑慮。
投資人角度:CBRS 股價在 Supernova 發表當天盤中下跌約 12.69%,盤後小幅回升。市場對「再新一代硬體」的反應冷淡,反映出對 wafer-scale 路徑能否在 NVDA、AMD、TSMC 三方夾擊下持續擴大市佔的保留態度。
後續觀察重點
- 首季出貨:本季(Q3 2026)的首批客戶名單與實際部署時程
- AMD Helios 整合進度:分離式推論(GPU prefill + Cerebras decode)的端到端效能數據
- 下一代晶片時程:Cerebras 已預告 2027 年下一代晶圓級引擎,下一代是否直接進入 3nm 或更先進製程將是關鍵
- NVDA 反應:NVIDIA 是否會以 Blackwell / Rubin 對應 SKU 在 per-user latency 上回應
參考資料
網友熱門留言 (5)