← 返回 Siami 首頁

Z.ai 開源 GLM-5.2:744B 參數、40B 激活,本地可跑逼近 GPT-5.5

▲ 237 💬 109
Z.ai 開源 GLM-5.2:744B 參數、40B 激活,本地可跑逼近 GPT-5.5

中國 Z.ai 開源 GLM-5.2:744B 參數、40B 激活,1M context 全開源中國 AI 實驗室 Z.ai(前身為智譜 AI)在 6 月 16 日以 MIT 授權開源釋出 GLM-5.2 模型權重,總參數達 744B、每次推論激活 40B,並支援穩定的 1M token context window。Unsloth 同步推出 Dynamic GGUF 量化版本,主打「本地可跑」與「比 Claude Opus 4.8 便宜 1/5」。

VentureBeat 報導指出,GLM-5.2 在多項長時程編碼基準(Terminal Bench 2.1、SWE-bench Pro、FrontierSWE)已逼近或超越 OpenAI GPT-5.5 與 Anthropic Claude Opus 4.8。Z.ai 同步在 20 多個第三方編碼環境(如 Cursor、Continue、Cline)提供 API,最低月費 12.60 美元。


Unsloth 動態量化:把 744B 塞進消費級硬體

Unsloth 在 GLM-5.2 釋出當天就拿到 day-zero access,並發布自家 Dynamic GGUF 系列。最大的技術亮點是「動態量化」—— 1-bit 量化在 223GB RAM 就能跑,2-bit 量化(UD-IQ2_M)只需要 239GB 磁碟空間,可直接塞進 256GB unified memory 的 Mac Studio,或用 1 張 24GB 顯卡 + 256GB RAM 搭配 MoE offloading 跑。

Unsloth 公開的數據顯示:

  • Dynamic 1-bit:~76.2% top-1 準確率,模型大小縮減 86%
  • Dynamic 2-bit:~82% 準確率,模型大小縮減 84%
  • 完整 1.5TB 模型 vs 1-bit 量化版本,效能差距約 24%(不是 86%)這代表開發者不需要動輒數百萬美元的 H100 叢集,就能在桌機或單一 GPU 工作站跑出逼近 GPT-5.5 等級的編碼能力。

「這意味著模型不是『差 86%』,而是比完整 1.5TB 模型只差約 24%,但體積縮小了 86%。」—— Unsloth 官方文件


硬體需求對照:從筆電到機架一覽

Unsloth 整理的記憶體需求(RAM + VRAM 總和,或 Mac 的 unified memory):

量化位元1-bit2-bit3-bit4-bit5-bit8-bit
總記憶體223GB245GB290-360GB372-475GB570GB810GB

2-bit 動態量化版本(UD-IQ2_M,239GB)剛好可塞進 256GB Mac Studio;4-bit 版本則需要至少 372GB,推薦用於研發環境或小型伺服器。8-bit 完整版需 810GB,已經是資料中心等級。


Benchmark 對決:GLM-5.2 vs Opus 4.8 vs GPT-5.5

從 Hugging Face 模型卡與 Artificial Analysis 公開數據綜合整理:

  • 編碼類:SWE-bench Pro GLM-5.2 拿到 62.1(vs Opus 4.8 69.2、GPT-5.5 58.6),差距不大;DeepSWE 上 GLM-5.2 拿到 46.2,領先 GPT-5.5(10 分)。
  • 數學類:HMMT 2026 GLM-5.2 拿 92.5(vs Opus 96.7),IMOAnswerBench 91.0(vs Opus 83.5,反超)。
  • 長時程 agentic:SWE-Marathon 26.0(vs Opus 12.0、GPT-5.5 4.0),領先幅度驚人;Tool-Decathlon 59.9,逼近 Opus。

Simon Willison 在 6 月 17 日的評論直接定性:「GLM-5.2 可能是目前最強的純文字開源權重 LLM。」他在自己的「北維吉尼亞負鼠騎電動滑板車」SVG 測試中發現,GLM-5.2 在創意動畫上比 5.1 更穩定。


成本結構:本地跑 vs API 訂閱怎麼選

HN 留言區出現一場成本論戰,數字頗具參考價值:

  1. 本地硬體(以 2 張 RTX 3090 + 512GB RAM 跑 Q4_K_XL 為例):實測 6 tok/sec(DDR4-2400)、升級到 DDR4-3200 可達 9 tok/sec、64 核 EPYC 可達 11 tok/sec。每日耗電約 14 kWh,美國電費 $0.2/kWh → $2.80/天、約 $1,000/年。
  2. OpenRouter API:當前最便宜的 GLM-5.2 provider 報價 $3/MTok(44 tok/s 吞吐)。純算 output token,約等同 45 萬 token/天的用量。
  3. Z.ai 官方月訂閱:$12.60 起,企業版另有 SLA。如果重視隱私、避免被美國「隨時切斷」(這是 HN 用戶提到的真實擔憂),或單日用量 > 45 萬 token,本地化部署開始有經濟效益;否則 OpenRouter / 官方 API 仍是多數人最務實的選擇。

社群回響:開源圈一片「終於等到」

HN 上對 GLM-5.2 的反應大致分三類:

「終於有開源模型能在 FrontierSWE 上拿到 26 分,這代表長時程 agent 工作流不再只能靠 Claude。」—— HN 用戶第一類是硬體玩家,公開自己的 GLM-5.2 build 心得(3090、Mac Studio、Apple Silicon),互相交流 DDR4/DDR5 帶寬對 tok/s 的影響。第二類是研究員背景,引用 arXiv 2606.00206 探討「如何縮減 LLM 的『waffling thinking』token(就是那種『等等』、『不過』、『或者』的廢話)」並提升推論效率。第三類是 AI 從業者,已經把 GLM-5.2 接到 OpenCode、Continue 等 agent 框架取代 Claude API。整體氛圍是「中國開源模型又往前跨一大步」,配上「西方封閉模型價格必須往下走」的樂觀期待。


為什麼這件事重要

GLM-5.2 的開源釋出,是 2026 年開源 LLM 競爭進入「逼近 GPT-5.5 等級」的關鍵節點。回顧這一年的開源賽局:DeepSeek V3 → R1 → V4,每一代都把性價比往前推;Z.ai 的 GLM 系列從 4.5、4.6、5.0 一路推到 5.2,開源權重 + MIT 授權意味任何企業、實驗室、甚至個人開發者都能下載、微調、部署。VentureBeat 引述產業分析師指出,這種「開源 + 本地化」路線直接挑戰了 OpenAI 與 Anthropic 的封閉 API 商業模式。更關鍵的是 Unsloth 的「Dynamic GGUF」技術成熟——以前要在本地跑 700B 等級的模型幾乎不可能(光是 FP16 就要 1.5TB 硬碟),現在用動態 1-bit 量化可以塞進 223GB 記憶體,等於把超大型模型的門檻從「資料中心」拉到「單一高階 Mac Studio」或「2 張 3090」。這個趨勢若持續下去,2027 年本地 AI 推理很可能會像自架 NAS 一樣普及。對台灣的開發者社群來說,這也代表可以用合理的成本(NT$ 數萬元級)建置自有 LLM 工作流,不用擔心資料出境或被 API 供應商單方面切斷。


數據解讀與質疑雖然 GLM-5.2 的 benchmark 數字亮眼,但有幾個值得追問的地方:

  • 2-bit 量化的實際效果:Unsloth 強調 1-bit 量化仍保留 76% 準確率,但這是 top-1 accuracy 而非任務成功率。在長時程編碼任務上,量化版本的「幻覺率」與「loop 機率」是否真的等同完整模型,目前缺乏獨立的第三方審計報告。
  • 1M context 是「穩定」還是「聲稱」:Z.ai 行銷主打「highly stable 1M context window」,但 Artificial Analysis 的 long-context benchmark 尚未公開 GLM-5.2 在 500K+ token 下的「大海撈針」實測數據。
  • 企業部署成本被低估:HN 留言計算的 $1,000/年電費假設在 6 tok/s 速度,但實際上若要跑 4-bit 量化(372-475GB)需要 NVLink 伺服器,硬體投入約 NT$ 30-50 萬,回收期遠比 API 訂閱長。
  • 中文 / 簡體偏見:模型由中國團隊訓練,繁體中文、英文以外的語言表現缺乏公開 benchmark。簡單說:GLM-5.2 是當前最強的開源權重 LLM 之一,但「本地可跑」≠「本地實用」,企業導入前需要做 PoC 驗證真實業務場景的 token 成本與品質。

編按:本文綜合整理自 Unsloth 官方文件Hugging Face 模型卡VentureBeat 報導Simon Willison 部落格,並加入 Siami 編輯部觀點與分析。

網友熱門留言 (5)

#1 HN 用戶(Q4_K_XL build 心得) ▲ 187
我用 2 張 RTX 3090 + 512GB RAM 跑 Q4_K_XL 量化版本,搭配 llama.cpp -cmoe 拿到約 6 tok/sec(DDR4-2400);升級到 DDR4-3200 可達 9 tok/sec,64 核 EPYC 可達 11 tok/sec。雖然硬體投資有點後悔,但能在本地跑這個等級的模型真的太爽了。
#2 HN 用戶(成本論戰) ▲ 142
全速跑起來耗電至少 600W,一天約 14 kWh,按 $0.2/kWh 算就是 $2.80/天、約 $1,000/年。除非真的重視隱私或不想被平台隨時切斷,否則付錢給 hyperscaler 還是比較划算、tok/s 也快很多。
#3 HN 用戶(隱私派) ▲ 98
我們要的不只是隱私,更希望硬體掌握在自己手上,這樣美國就不能隨時把我們的 API 切斷。本地跑的另一個理由是想要完整的模型,而不是被量化過的版本。
#4 HN 用戶(研究員引用 arXiv 2606.00206) ▲ 76
這篇 paper nerf 了 LLM 發出『等等』、『不過』、『或者』這類廢話 thinking token 的能力,模型推論終止得更快,表現也更好。我想開始測試這些開源模型,但不知道大家都用什麼工具跑『agentic』任務。
#5 HN 用戶(電費比較) ▲ 63
不是每個人都住 $0.20/kWh 的地方。BC Hydro 第一階 $0.11 CAD、Hydro Quebec 更便宜。理論上 6 tok/sec、一天 86,400 秒、產出 50 萬 token,只要 $2/天。本地跑在電費便宜的地方其實很有競爭力。