中國 Z.ai 開源 GLM-5.2:744B 參數、40B 激活,1M context 全開源中國 AI 實驗室 Z.ai(前身為智譜 AI)在 6 月 16 日以 MIT 授權開源釋出 GLM-5.2 模型權重,總參數達 744B、每次推論激活 40B,並支援穩定的 1M token context window。Unsloth 同步推出 Dynamic GGUF 量化版本,主打「本地可跑」與「比 Claude Opus 4.8 便宜 1/5」。
VentureBeat 報導指出,GLM-5.2 在多項長時程編碼基準(Terminal Bench 2.1、SWE-bench Pro、FrontierSWE)已逼近或超越 OpenAI GPT-5.5 與 Anthropic Claude Opus 4.8。Z.ai 同步在 20 多個第三方編碼環境(如 Cursor、Continue、Cline)提供 API,最低月費 12.60 美元。
Unsloth 動態量化:把 744B 塞進消費級硬體
Unsloth 在 GLM-5.2 釋出當天就拿到 day-zero access,並發布自家 Dynamic GGUF 系列。最大的技術亮點是「動態量化」—— 1-bit 量化在 223GB RAM 就能跑,2-bit 量化(UD-IQ2_M)只需要 239GB 磁碟空間,可直接塞進 256GB unified memory 的 Mac Studio,或用 1 張 24GB 顯卡 + 256GB RAM 搭配 MoE offloading 跑。
Unsloth 公開的數據顯示:
- Dynamic 1-bit:~76.2% top-1 準確率,模型大小縮減 86%
- Dynamic 2-bit:~82% 準確率,模型大小縮減 84%
- 完整 1.5TB 模型 vs 1-bit 量化版本,效能差距約 24%(不是 86%)這代表開發者不需要動輒數百萬美元的 H100 叢集,就能在桌機或單一 GPU 工作站跑出逼近 GPT-5.5 等級的編碼能力。
「這意味著模型不是『差 86%』,而是比完整 1.5TB 模型只差約 24%,但體積縮小了 86%。」—— Unsloth 官方文件
硬體需求對照:從筆電到機架一覽
Unsloth 整理的記憶體需求(RAM + VRAM 總和,或 Mac 的 unified memory):
| 量化位元 | 1-bit | 2-bit | 3-bit | 4-bit | 5-bit | 8-bit |
|---|---|---|---|---|---|---|
| 總記憶體 | 223GB | 245GB | 290-360GB | 372-475GB | 570GB | 810GB |
2-bit 動態量化版本(UD-IQ2_M,239GB)剛好可塞進 256GB Mac Studio;4-bit 版本則需要至少 372GB,推薦用於研發環境或小型伺服器。8-bit 完整版需 810GB,已經是資料中心等級。
Benchmark 對決:GLM-5.2 vs Opus 4.8 vs GPT-5.5
從 Hugging Face 模型卡與 Artificial Analysis 公開數據綜合整理:
- 編碼類:SWE-bench Pro GLM-5.2 拿到 62.1(vs Opus 4.8 69.2、GPT-5.5 58.6),差距不大;DeepSWE 上 GLM-5.2 拿到 46.2,領先 GPT-5.5(10 分)。
- 數學類:HMMT 2026 GLM-5.2 拿 92.5(vs Opus 96.7),IMOAnswerBench 91.0(vs Opus 83.5,反超)。
- 長時程 agentic:SWE-Marathon 26.0(vs Opus 12.0、GPT-5.5 4.0),領先幅度驚人;Tool-Decathlon 59.9,逼近 Opus。
Simon Willison 在 6 月 17 日的評論直接定性:「GLM-5.2 可能是目前最強的純文字開源權重 LLM。」他在自己的「北維吉尼亞負鼠騎電動滑板車」SVG 測試中發現,GLM-5.2 在創意動畫上比 5.1 更穩定。
成本結構:本地跑 vs API 訂閱怎麼選
HN 留言區出現一場成本論戰,數字頗具參考價值:
- 本地硬體(以 2 張 RTX 3090 + 512GB RAM 跑 Q4_K_XL 為例):實測 6 tok/sec(DDR4-2400)、升級到 DDR4-3200 可達 9 tok/sec、64 核 EPYC 可達 11 tok/sec。每日耗電約 14 kWh,美國電費 $0.2/kWh → $2.80/天、約 $1,000/年。
- OpenRouter API:當前最便宜的 GLM-5.2 provider 報價 $3/MTok(44 tok/s 吞吐)。純算 output token,約等同 45 萬 token/天的用量。
- Z.ai 官方月訂閱:$12.60 起,企業版另有 SLA。如果重視隱私、避免被美國「隨時切斷」(這是 HN 用戶提到的真實擔憂),或單日用量 > 45 萬 token,本地化部署開始有經濟效益;否則 OpenRouter / 官方 API 仍是多數人最務實的選擇。
社群回響:開源圈一片「終於等到」
HN 上對 GLM-5.2 的反應大致分三類:
「終於有開源模型能在 FrontierSWE 上拿到 26 分,這代表長時程 agent 工作流不再只能靠 Claude。」—— HN 用戶第一類是硬體玩家,公開自己的 GLM-5.2 build 心得(3090、Mac Studio、Apple Silicon),互相交流 DDR4/DDR5 帶寬對 tok/s 的影響。第二類是研究員背景,引用 arXiv 2606.00206 探討「如何縮減 LLM 的『waffling thinking』token(就是那種『等等』、『不過』、『或者』的廢話)」並提升推論效率。第三類是 AI 從業者,已經把 GLM-5.2 接到 OpenCode、Continue 等 agent 框架取代 Claude API。整體氛圍是「中國開源模型又往前跨一大步」,配上「西方封閉模型價格必須往下走」的樂觀期待。
為什麼這件事重要
GLM-5.2 的開源釋出,是 2026 年開源 LLM 競爭進入「逼近 GPT-5.5 等級」的關鍵節點。回顧這一年的開源賽局:DeepSeek V3 → R1 → V4,每一代都把性價比往前推;Z.ai 的 GLM 系列從 4.5、4.6、5.0 一路推到 5.2,開源權重 + MIT 授權意味任何企業、實驗室、甚至個人開發者都能下載、微調、部署。VentureBeat 引述產業分析師指出,這種「開源 + 本地化」路線直接挑戰了 OpenAI 與 Anthropic 的封閉 API 商業模式。更關鍵的是 Unsloth 的「Dynamic GGUF」技術成熟——以前要在本地跑 700B 等級的模型幾乎不可能(光是 FP16 就要 1.5TB 硬碟),現在用動態 1-bit 量化可以塞進 223GB 記憶體,等於把超大型模型的門檻從「資料中心」拉到「單一高階 Mac Studio」或「2 張 3090」。這個趨勢若持續下去,2027 年本地 AI 推理很可能會像自架 NAS 一樣普及。對台灣的開發者社群來說,這也代表可以用合理的成本(NT$ 數萬元級)建置自有 LLM 工作流,不用擔心資料出境或被 API 供應商單方面切斷。
數據解讀與質疑雖然 GLM-5.2 的 benchmark 數字亮眼,但有幾個值得追問的地方:
- 2-bit 量化的實際效果:Unsloth 強調 1-bit 量化仍保留 76% 準確率,但這是 top-1 accuracy 而非任務成功率。在長時程編碼任務上,量化版本的「幻覺率」與「loop 機率」是否真的等同完整模型,目前缺乏獨立的第三方審計報告。
- 1M context 是「穩定」還是「聲稱」:Z.ai 行銷主打「highly stable 1M context window」,但 Artificial Analysis 的 long-context benchmark 尚未公開 GLM-5.2 在 500K+ token 下的「大海撈針」實測數據。
- 企業部署成本被低估:HN 留言計算的 $1,000/年電費假設在 6 tok/s 速度,但實際上若要跑 4-bit 量化(372-475GB)需要 NVLink 伺服器,硬體投入約 NT$ 30-50 萬,回收期遠比 API 訂閱長。
- 中文 / 簡體偏見:模型由中國團隊訓練,繁體中文、英文以外的語言表現缺乏公開 benchmark。簡單說:GLM-5.2 是當前最強的開源權重 LLM 之一,但「本地可跑」≠「本地實用」,企業導入前需要做 PoC 驗證真實業務場景的 token 成本與品質。
編按:本文綜合整理自 Unsloth 官方文件、Hugging Face 模型卡、VentureBeat 報導、Simon Willison 部落格,並加入 Siami 編輯部觀點與分析。
網友熱門留言 (5)