編按:本文綜合整理自 Z.ai 官方部落格、Hacker News 討論串、TrendingTopics EU 報導,並加入 Siami 編輯部觀點與分析。
中國 AI 公司 Z.ai(智譜)上週丟了一篇技術長文,標題直接點名「Recursive Self-Improvement(遞迴自我改進)」,描述一件聽起來很科幻的事:用自家的 GLM-5.3 模型當 Infra Agent,在一個超過 10 萬顆中國製 AI 加速器的叢集上,從零打造 GLM-5.3-Flash 的生產級推理服務。
這篇文章在 Hacker News 上衝到 379 分、264 則留言,掀起美國開發者社群對「中國 AI 基建是否已突破美國晶片封鎖」的激烈辯論。
從 100k 顆國產晶片開始的基礎設施工程
Z.ai 在文章中明確指出,GLM-5.3-Flash 的「所有生產流量」都跑在 10 萬顆中國製 AI 加速器上。這個叢集之前沒有人部署到這個規模——因為中國製加速器的「記憶體容量與頻寬相對有限」,同時還要支援一種全新的模型架構、1M token 的 context window、以及多模態請求。
Z.ai 的工程團隊坦承,整個生態系當時「相當不成熟」,kernel 支援也不完整,很多本應有文件可循的東西只能靠團隊摸索。最終這項工程由 GLM-5.3 驅動的 Infra Agent 承擔了大部分工作——而不是傳統的人類基礎設施工程師。
具體做了哪些技術突破?以下是 Z.ai 揭露的關鍵優化清單:
- 節點內 tensor parallelism:用於 linear attention 與 LM Head
- ReplaySSM:以 compute 換取記憶體頻寬的 state-space 模型技巧
- W8A8 quantization:權重與激活值都量化到 8-bit
- 混合精度快取量化:INT8 / FP8 / BF16 視場景混用
- Layer Split:把單層切開平行處理
- EPD 分散式架構:Encode、Prefill、Decode 三階段分流
這整套堆疊把端到端吞吐量推升到「初始 baseline 的 3 倍」,硬體利用率與單 token 成本都達到「與主流 NVIDIA GPU 相當的水準」。
GLM-5.3-Flash 在 8 月底以匿名模型 Ox-Alpha 之名上線 OpenCode 與 OpenRouter 後,6 天內處理了超過 62 兆 tokens,一週內成為兩個平台上「使用量最高的模型」。
什麼是「Dense Feedback」?模型自己 debug 自己
「feedback 的價值不在於數量,而在於能不能幫助 agent 回答眼前的問題。」—— Z.ai 官方文章
Z.ai 整個 Infra Agent 工作流圍繞一個他們稱為「Dense Feedback(密集回饋)」的核心概念展開。傳統的推理系統優化並不缺測試、log、profiling 工具,但這些工具散落在不同階段、不同工具鏈裡。資深工程師靠經驗把它們串起來,但對 AI agent 來說,光看「吞吐掉了 3 點」沒辦法定位是哪個 kernel 慢、哪個環節卡住。
Z.ai 把這套回饋機制歸納出三個關鍵特性:
- 足夠局部化:feedback 要對應到具體的 kernel、輸入條件、執行區間,而不是只有「end-to-end 慢了」這種結果。
- 便宜且即時取得:能在一秒內驗證的假設,不該等部署(deployment)完才跑端到端測試。
- 客觀可驗證:正確性與效能都該有 reference implementation 與 controlled experiment 當基準。
這背後的設計哲學很清楚:AI agent 要拿回饋「做事」,不是被回饋「淹沒」。
三個實戰案例:KDA kernel 數值誤差、KV Transfer GIL 卡死、KDA Decode kernel 3 倍提速
Z.ai 在文章中舉了 3 個真實發生過的案例,說明 Dense Feedback 怎麼讓 Infra Agent 真的進步。
案例 A:KDA kernel 數值精度 bug
Agent 跑了數值驗證比對後,發現 KDA kernel 在 Context Parallelism(CP)路徑下與非 CP 路徑有差距。追下去發現是 tl.dot 預設用 TF32 計算,在 CP 場景下誤差會累積。修法是把 input precision 明確設成 tf32x3,用三次 TF32 Tensor Core 運算組出 FP32 等效精度,同時保留大部分的 Tensor Core 效能紅利。
這個修法已經 merge 回上游 Flash Linear Attention PR #1180。
案例 B:KV Transfer 並發瓶頸
agent 跑 Prefill + KV Transfer 的基準測試時,發現開銷比純 Prefill 多 20%(驗收條件是 5%)。順著 timeline 追下去,發現 Python 端的 KV Transfer 從來沒跟 DeepEP 的 dispatch/combine 平行執行——原因是 DeepEP v1.2.1 的 intranode_dispatch 與 intranode_combine 都沒主動釋放 Python GIL。
修法是在這兩個 C++ 執行區段釋放 GIL,讓同 process 的 Mooncake Transfer Python thread 能搶到鎖。修完之後,Prefill + KV Transfer 對純 Prefill 的效能差距降到 1% 以下。
案例 C:KDA Decode kernel 從 v0 到 production
Agent 從 SGLang、Flash Linear Attention、DeepGEMM 等開源 kernel 裡挖優化技巧,整理成「optimization skeleton」庫。拿一個 KDA Decode kernel 來實際跑:v0 引入 ReplaySSM 換記憶體(速度變慢),v1 透過分塊優化快 9.6%,v2 把 V 維度的 tiling 合併掉,消除 4 次重複的 FP32 normalization,再比 v2 快 1.71 倍。
為什麼這件事重要
這篇文章的深層訊號不是「10 萬顆晶片」這個數字本身,而是 Z.ai 把自家模型當 Infra Agent 來部署自家模型這件事。
- 「Recursive Self-Improvement」不是口號:很多 AI 公司談 RSI 還停留在 PPT 階段,Z.ai 卻給出了具體的工程細節——KDA kernel 數值 bug、KV Transfer GIL 卡死、Decode kernel 加速——這些都是真實可驗證的生產問題。
- 軟體堆疊可能比硬體更稀缺:美國 AI 實驗室每年燒掉數百億美元買 NVIDIA GPU,卻很少有人像 Z.ai 這樣從 kernel、量化、平行策略一層一層挖到底。HN 上 @9cb14c1ec0 的留言點出這個問題的尖銳處:「美國實驗室為什麼不做同等程度的軟體優化?」
- 「中國製加速器等於落後」的敘事正在鬆動:從 Loongson、Cambricon 到 Huawei Ascend,中國製 AI 加速器在 Z.ai 的 stack 裡達到了「與主流 NVIDIA GPU 相當」的單 token 成本與硬體利用率——這對全球 AI 算力供應鏈是結構性衝擊。
- AI Agent 工程化進入實戰:這篇文章展示了「AI agent + 嚴謹的 feedback loop + 工程紀律」是真能做出來的,比很多 AI 公司喊的「AI 自動駕駛自己的開發流程」實際太多。
數據解讀與質疑
雖然 Z.ai 的技術細節寫得非常紮實,但 Siami 編輯部認為讀者要帶著幾個問題讀這篇文章:
- 「10 萬顆中國製 AI 加速器」的具體型號未揭露:Z.ai 在文章中提到「Chinese-made AI accelerators」但沒列型號。對比 Huawei Ascend 910C 已知產能,這個數字要嘛是混搭多家供應商的叢集,要嘛是某幾款主流中國製加速器的合計——這個數字的真實可重現性需要更多第三方驗證。
- 「與 NVIDIA GPU 相當的成本」需要更多比較基準:Z.ai 自稱硬體利用率與單 token 成本「comparable to mainstream NVIDIA GPUs」,但沒附上 token/$、token/Joule、tokens/GPU-hour 等可量化指標。
- GLM 系列的「國安威脅」敘事有 PR 動機:HN 上 @jchook 的留言直接吐槽,文章前半段的「AI is too powerful now」修辭,跟 Mythos、Fable 等同類敘事的語氣太接近,反而讓人懷疑這是市場定位策略。實際用過 z.ai 服務的 @konart、@esafak 兩人都說「速度慢、配額嚴」——技術白皮書 vs 用戶體驗有明顯落差。
- 之前 z.ai 曾被指控「透過 Opus 4.8 蒸餾」:HN 上 @bbor 留言提到這項舊爭議。雖然這篇新文章沒有直接證據支持該指控,但讀者宜把 Z.ai 的「完全自研」敘事放在這個脈絡下看待。
簡單說:這篇文章值得讀,因為它揭露了中國 AI 工程團隊在軟體堆疊上的真正功力;但不要把廠商自己寫的技術行銷稿當成獨立驗證報告。建議讀者搭配 Bloomberg 8 月底的 Z.ai 報導、SCMP 的「Zhipu AI shares jump」觀察第三方視角。
後續觀察點
- 是否有第三方 benchmark 復現 3 倍吞吐量? 目前 Z.ai 自家揭露的數字還沒有獨立機構驗證。
- Flash Linear Attention PR #1180 合併後的實際效益? 上游採用率是個指標。
- Z.ai 後續會不會釋出 GLM-5.3-Flash 的部署 SOP? 如果釋出,這會比這篇文章本身更有社群影響力。
- 中國製 AI 加速器供應鏈的真實瓶頸是什麼? 產能、HBM 替代方案、軟體生態成熟度,這三個維度都值得追蹤。
Z.ai 這篇文章最值得帶走的不是「10 萬顆晶片」這個戲劇數字,而是「Dense Feedback 讓 AI agent 工程化成為可能」這個工程方法論——這對所有在做 AI infra 的團隊都是共通的資產。
網友熱門留言 (5)