← 返回 Siami 首頁

GLM 5.2 在 AMD MI355X 跑出 2626 tok/s,成本比 Blackwell 砍半

▲ 136 💬 95
GLM 5.2 在 AMD MI355X 跑出 2626 tok/s,成本比 Blackwell 砍半

編按:本文綜合整理自 Wafer 官方部落格(wafer.ai/blog/glm52-amd)、Hacker News 討論串、以及 Zyphra、Modular 等同業的 MI355X 基準報告,並加入 Siami 編輯部觀點與分析。


Wafer 把 GLM 5.2 推到 2626 tok/s/節點

7 月 3 日,AI 推理新創 Wafer 在官方部落格發表基準:他們將智譜 GLM 5.2 量化為 MXFP4、跑在 AMD Instinct MI355X 上,於 20k 輸入 / 1k 輸出、60% 快取命中率的真實生產負載下,達成 2626 tok/s/節點、TTFT p50 0.62 秒(飽和點 2.4 RPS)。在單流(10k 輸入 / 1.5k 輸出)場景下也拿到 213 tok/s,符合 Artificial Analysis 的測試標準。

指標數值
單節點吞吐量2626 tok/s
單流解碼213 tok/s
MI355X vs B200 成本約 2x 便宜
第一時間延遲 (p50)0.62s
飽和 RPS2.4

為什麼這件事重要

CUDA 的護城河正以肉眼可見的速度被侵蝕。過去 AMD Instinct 系列跑 SOTA 模型,動輒要「週」的工程時間寫自訂 kernel 才能拉到合理速度,但 Wafer 這次 完全沒有寫自訂 kernel,只調了 MoE kernel 選擇就達到他們公布的頭條數字。換算下來 MI355X 在 20k 輸入、60% 快取的工作負載上跑到 B200 80% 的吞吐量,但單卡平均價格只要 2.75 折,等於 每美元效能領先 Blackwell 一倍。

對企業用戶而言,這代表兩件事:第一,如果工作量是「單節點足夠」的聊天、客服、批次推論,AMD 路徑現在是有競爭力的選項;第二,依賴 NVIDIA 單一供應商的風險(GPU 缺貨、定價飆漲、合約約束)開始有實質的替代方案。Wafer 是 TensorWave 的合作對象,後者已是 AMD 在美國最大的 HBM3e GPU 雲端之一。

「AMD 上的 SOTA 越來越像是支援問題,而不是軟體問題。CUDA 護城河正在即時被侵蝕。」 — Wafer 官方結論


數據解讀:哪些是真的?哪些要打折

真實可複現:213 tok/s 單流數字完全是寫死的「單一使用者體驗」,這個量級對聊天機器人、Copilot、Cursor 這類單會話情境很關鍵。Wafer 把 GLM 5.2 從 bf16 量化到 MXFP4 時,GSM8K、GPQA-Diamond、tau2 三項基準幾乎無損(差距 < 2%),所以讀者不需要擔心「量化變笨」。

要打折看的部分:

  • 文章標榜「2626 tok/s/節點」是 20k 輸入、60% 快取、2.4 RPS 飽和 的合併吞吐。對長 prompt、低快取的場景(例如 RAG、批次 ETL),預填成本反而是瓶頸。Wafer 自己承認 Blackwell 在這條曲線上跑到 3192 tok/s/節點(3.0 RPS)。
  • 文章 沒有多節點資料。Wafer 在結論裡明確說「這個研究不考慮多節點效能」,但單節點在業界仍很普遍,不代表 MI355X 多機 scaling 沒問題。
  • AMD 仍有的 sglang bug:HN 討論串引用 sgl-project issue #29375,GLM-5.2 FP8 在 gfx950 上啟動失敗或 TPOT 變 2x 慢,DSA attention backend 還沒修好。Wafer 走的是 MXFP4 + 自己修 MTP 的權重命名問題,所以避開了這個雷,但其他想復現的人得自己 patch。


數據解讀:2626 vs 213 的差別

合併吞吐與單流解碼是兩個完全不同維度的數字,讀者容易把它們混為一談。2626 tok/s/節點 是在 2.4 RPS 並發下、所有 session 加總的吞吐;213 tok/s 是同一個 GPU 上「只有一個 session」時的解碼速度。對終端使用者體驗而言,213 那個數字才是真正會感受到的回應速度。

Wafer 同時提供兩個數字其實是負責任的表現。坊間很多 LLM 推銷文只給合併吞吐、讓客戶誤以為每個使用者都能拿到 2000+ tok/s 的體驗。如果你的應用是「每個 session 獨立、需要穩定 100+ tok/s 回應速度」(例如 Copilot、Cursor、聊天機器人),Wafer 公布的 213 tok/s 才是要看的那一個。


業界對照:AMD MI355X 正在贏得不只一波推理客戶

Wafer 不是孤例:

  • Zyphra 在 5 月發表的 MI355X 生產基準 顯示 Kimi K2.6、GLM-5.1、DeepSeek V3.2 在單節點都能穩定部署。
  • Modular 兩週內在 MI355X 跑到 SOTA,比自家 fork 的 vLLM-AMD 快 2.2 倍。
  • InferenceX(SemiAnalysis)對 GLM 5/5.1 的價格基準顯示「每百萬 token $0.30 vs $0.31」—— Blackwell 和 MI355X 在該工作負載上已經站在同一條價格線上,單純比性能不再有意義。

換句話說,2026 下半年的 LLM 推理競爭,已經從「哪家框架快」轉向「哪家硬體每瓦每美元最划算」。NVIDIA 必須靠 B200/B300 的 day-0 支援、NVLink、與軟體生態維持溢價;AMD 則靠 2-3x 單卡價格 + ROCm 框架成熟,逐步把 open-weights 模型的工作量搬過來。


延伸閱讀

網友熱門留言 (4)

#1 Hacker News 用戶 ▲ 412
2x 成本的價格優勢是相對於 B200 列表價與一般資料中心電費計算的,但 Blackwell 的 day-0 軟體生態仍是 AMD 短時間內難以追上的差距。
#2 Hacker News 用戶 ▲ 287
Wafer 沒有自寫 kernel 就拿到這個數字,說明 ROCm 對 sglang 的相容性已經接近實用。這只是單節點,多節點才是真正的瓶頸。
#3 Hacker News 用戶 ▲ 176
GLM 5.2 已經是這週 HN 的主角,先前就有貼文說它性能接近 Claude Opus 4.8,現在再加 AMD 便宜推理,整個 open-weights 生態已經走向良性循環。
#4 Hacker News 用戶 ▲ 124
GLM 5.2 FP8 + DSA attention 在 AMD MI355X 上有兩個 bug 還沒修,TPOT 直接掉 2x。所以這次發表是 AMD 玩家先看 DXS、SA 修不修。