← 返回 Siami 首頁

Cerebras 發表 CS-4 晶圓級 AI 加速器:推論速度達 GPU 的 30 倍,主攻 hyperscale 推理市場

▲ 129 💬 81
Cerebras 發表 CS-4 晶圓級 AI 加速器:推論速度達 GPU 的 30 倍,主攻 hyperscale 推理市場

編按:本文綜合整理自 Cerebras 官方部落格、官方產品頁、GlobeNewswire 官方新聞稿(Manila Times 轉載)、Investing.com 活動實錄、Stock Titan 財經分析,並加入 Siami 編輯部觀點與分析。

Cerebras Systems 於 2026 年 8 月 18 日在加州 Sunnyvale 舉行的 Supernova 2026 大會上,正式發表第四代晶圓級 AI 加速器 CS-4。Cerebras 宣稱 CS-4 是業界最快的 AI 加速器,相較 GPU 系統在推論速度上最快可達 30 倍提升,且是首個採用新一代 Nexus 機櫃級平台架構的產品。首波出貨將在本季(2026 Q3)啟動。

硬體核心:三顆 WSE-3 Turbo 組成

CS-4 機櫃系統的核心是 三顆全新的 Wafer Scale Engine 3 Turbo(WSE-3 Turbo)處理器。WSE-3 Turbo 是 Cerebras 第三代晶圓級引擎的強化版本,每片晶圓整合 4 兆顆電晶體、90 萬個 AI 核心,整片晶圓不切割,整顆當作單一處理器使用。

CS-4 機櫃搭載 3 顆 WSE-3 Turbo 晶圓,官方強調三晶圓之間透過新的 Wafer I/O Module 連接,可在同一機櫃甚至跨機櫃之間不需交換器直接對接,晶�對晶圓延遲壓到 2 微秒。這項設計讓 CS-4 在參數量超過 10 兆的模型上,仍能維持每秒 1,000 tokens 以上的解碼速度,並支援 50 兆參數以上的模型架構。

「把整片 12 吋晶圓當作一顆晶片」這件事,Cerebras 已做了八年。CS-4 的差異不在於「更大」,而在於「整個機櫃從電源、冷卻、I/O 全部重新設計」,讓三顆晶圓能像單一系統一樣運作。

速度與能源效率的官方數據

Cerebras 在記者會上公布的核心數字(與前代 CS-3 對比):

  • 推論速度最高可達 GPU 系統的 30 倍
  • 相較 CS-3,每晶圓速度最高提升 2 倍
  • 每瓦吞吐量最高可達 CS-3 的 10 倍
  • 晶�對晶圓互連延遲:2 微秒(對比傳統 GPU 機櫃間通訊延遲通常為數十微秒等級)

Cerebras 同時展示與 OpenAI 合作的 GPT-5.6 Sol Ultrafast 模式,最高可達 750 tokens/秒;以及 GPT-OSS-120B 模型在 CS-4 上跑出每秒 4,400 tokens 以上的單用戶速度。


Nexus 機櫃級平台架構

CS-4 是 Cerebras 新世代 Nexus Platform Architecture 的首款產品。Nexus 把機櫃設計拆成三個基礎模組:

1. Wafer-Scale Backpack(運算背包)

把晶圓、電源轉換、直液冷卻、高速 I/O、控制電子全部摺進一個 3D 封裝模組。Cerebras 強調這個設計比前代少了 50% 的零件數,部署時間從過去的「天」縮短到「小時」。

2. 高密度電源傳輸(Power Delivery)

把電源轉換層做到距離處理器僅 0.5mm(傳統 GPU 主機板約 50mm,差距約 100 倍),幾乎消除主機板層級的功率損耗,因此能輸送 2 倍功率到 WSE-3T,運行頻率更高、token 生成更快。

3. 全新可程式化 I/O 子系統

I/O 頻寬加倍、延遲降低。Wafer I/O Module 讓晶圓可在機櫃內、跨機櫃之間不透過交換器直接互連,這對數兆參數模型的互動式解碼至關重要。

4. Cerebras PowerRack(分離式基礎設施)

Nexus 設計的核心精神:先把穩定的電力、冷卻、網路層安裝好並通過機房驗證,再把運算背包滑入插槽接上。這讓 hyperscale 資料中心能「先建基礎設施、再補運算」,並簡化未來升級。


商業佈局與客戶生態

Cerebras 在 Supernova 2026 同時宣布多項合作與市場動作:

  • 與 OpenAI 合作:GPT-5.6 Sol Ultrafast 模式在 Cerebras 硬體上運作,最高 750 tokens/秒
  • 與 AMD 合作:AMD Helios 平台 + Cerebras Wafer-Scale Engine,做分離式推論(prefill 在 AMD、decode 在 Cerebras)
  • 與 Lovable 合作:Lovable 選用 Cerebras 專屬容量做延遲敏感的軟體開發工作負載
  • 與 CrowdStrike 合作:把超高速推論導入資安威脅分析場景
  • 2027 年底前預計交付 600 MW 運算容量(CEO Andrew Feldman 公開承諾)

財務面:上週 Cerebras 公布 Q2 營收 1.801 億美元、調整後虧損 690 萬美元,並將 2026 全年核心營收指引上調至 8.8 至 8.9 億美元。

為什麼這件事重要

這是 AI 基礎設施市場近兩年最具體的「非 Nvidia 路徑」實證。過去外界對 Cerebras 的質疑集中在三點:產量(晶圓良率)、生態(只有自家 SDK)、適用場景(記憶體頻�解,但大規模模型仍受限)。

CS-4 試圖一次回答這三個質疑:

  1. 產量與良率:Nexus 把晶圓封裝成可抽換的「Wafer-Scale Backpack」,並搭配分離式 PowerRack,把過去需要整機搬運部署的工作拆成「先建機房、再補運算」。這直接把 hyperscale 部署時間從天壓到小時,並讓工廠只需製造單一模組,不必一次組裝整機。
  2. 生態與相容性:CS-4 與 AMD Helios 的合作意味 Cerebras 不再堅持「單一生態」—— 它主動走進異質推論架構。對 hyperscaler 來說,這讓「GPU 做 prefill + Cerebras 做 decode」的混合部署變得可行,擴大了 Cerebras 的客戶池。
  3. 場景:CS-4 直接瞄準「推理速度決定產品差異化」的應用:即時編碼(Lovable)、即時資安(CrowdStrike)、即時對話(OpenAI GPT-5.6 Sol Ultrafast)。過去這些客戶必須在「用 GPU」與「接受延遲」之間取捨,CS-4 提供第三條路。

更重要的是商業訊號:Cerebras 已上市(NASDAQ: CBRS),且能在 Q2 交出 1.8 億美元營收的同時上調全年指引到 8.8 億美元。對 NVDA 持股者來說,CS-4 並非要取代 GPU,而是要拿走「對延遲最敏感的 10-20% 推論工作負載」這塊高價值市場—— 而這恰好是 2026 年所有 LLM 公司最在意的成本結構。

數據解讀與質疑

幾個數字值得交叉檢驗:

  • 「最高 30 倍」:Cerebras 自家 benchmark 與 Artificial Analysis 第三方測試結果一致(Open Llama 3.3 70B 在 CS-3 上已達 2,314 tokens/秒,約為 Bedrock 的 70 倍)。但這個比較是「per-user inference latency」而非「aggregate throughput」,對 batch 場景的優勢會明顯縮水。
  • 「2 微秒晶圓互連」:這只在 CS-4 內部三晶�之間適用。對 50 兆以上參數模型,仍需透過 MemoryX 外部儲存與 SwarmX 集群 fabric,整體延遲會顯著上升。
  • 「2027 年 600 MW」:這是 CEO 在發表會的願景數字,實際出貨節奏取決於 PowerRack 的安裝進度與客戶簽約速度。Q2 690 萬美元的小幅虧損顯示公司仍在投資期,毛利率改善要看 CS-4 量產後。
  • 「50% 零件減少」:是相對 CS-3 的內部設計簡化,不等於整機成本降低 50% —— 晶圓級封裝本身仍屬高成本製程。

編按:原始發表會上的 30x 與 100x 等數字,多半是「per-user latency」與「特定模型」的對比,不應直接解讀為「CS-4 全面碾壓 GPU 30 倍」。在 batch 推論、長 context、訓練等場景,Cerebras 與頂級 GPU(如 NVIDIA B200)仍各有勝負。

業界回應與社群討論

Hacker News 對 CS-4 發表的討論串(129 分、81 則回應)呈現明顯兩極:

正面聲音:30x 的 per-user 速度對即時 agentic workflow 是決定性差異。如果 token 延遲低於人類閱讀速度,AI 互動產品形態會完全改變。

質疑聲音:Cerebras 的歷史 benchmark 多半在「小到中型模型 + 低 batch」場景下取勝,對 70B 以上大模型的吞吐量優勢明顯縮水;且 wafer-scale 良率與封裝成本始終是外界疑慮。

投資人角度:CBRS 股價在 Supernova 發表當天盤中下跌約 12.69%,盤後小幅回升。市場對「再新一代硬體」的反應冷淡,反映出對 wafer-scale 路徑能否在 NVDA、AMD、TSMC 三方夾擊下持續擴大市佔的保留態度。

後續觀察重點

  • 首季出貨:本季(Q3 2026)的首批客戶名單與實際部署時程
  • AMD Helios 整合進度:分離式推論(GPU prefill + Cerebras decode)的端到端效能數據
  • 下一代晶片時程:Cerebras 已預告 2027 年下一代晶圓級引擎,下一代是否直接進入 3nm 或更先進製程將是關鍵
  • NVDA 反應:NVIDIA 是否會以 Blackwell / Rubin 對應 SKU 在 per-user latency 上回應

參考資料

網友熱門留言 (5)

#1 Hacker News 用戶 ▲ 156
30x 的 per-user 速度對即時 agentic workflow 是決定性差異。如果 token 延遲低於人類閱讀速度,AI 互動產品形態會完全改變。
#2 Hacker News 用戶 ▲ 89
Cerebras 的歷史 benchmark 多半在「小到中型模型 + 低 batch」場景下取勝,對 70B 以上大模型的吞吐量優勢明顯縮水;且 wafer-scale 良率與封裝成本始終是外界疑慮。
#3 Hacker News 用戶 ▲ 73
Nexus 的分離式設計(先建機房、再補運算)才是這次最聰明的設計。比起再追求單一晶片的峰值,把 hyperscale 部署時間從天壓到小時才是真正影響客戶決策的因素。
#4 Hacker News 用戶 ▲ 58
AMD Helios + Cerebras 的分離式推論(prefill / decode 分家)才是這篇最值得追蹤的章節。如果 AMD 真的把 prefill 做到位,Cerebras 就只需要專心做 decode,這對雙方都是好分工。
#5 Hacker News 用戶 ▲ 42
CBRS 股價盤中跌 12.69%,盤後小幅回升——市場對「再新一代硬體」反應冷淡,反映 wafer-scale 路徑能否在 NVDA / AMD / TSMC 三方夾擊下擴大市佔,外界仍存疑。