← 返回 Siami 首頁

Meta Muse Glimmer 開放權重 30B 本地編碼模型,可在一張消費級 GPU 跑 agent

▲ 615 💬 329
Meta Muse Glimmer 開放權重 30B 本地編碼模型,可在一張消費級 GPU 跑 agent

今天 Meta Superintelligence Labs 推出 Muse Glimmer,這是一個 30B 參數、開放權重(Apache 2.0)的模型,專為「永遠在線」的本地端代理人(agent)工作流設計。它小到能在一台 Mac 或 PC 上用一張消費級 GPU 跑起來,涵蓋本地 agent、函式呼叫、本地編碼、LLM-as-a-judge 評估等場景。

訓練方法

Muse Glimmer 是 Meta 從更大的教師模型 Muse Spark 蒸餾而來。整個訓練分三階段:

  • 預訓練:用教師 Muse Spark 的輸出做 logit 蒸餾,資料配比與教師模型類似。
  • 中訓練:把上下文拉長、加入更多 agent 風格資料、加入更豐富的推理軌跡,並搭配有機資料。
  • 後訓練:結合監督式微調(SFT)、on-policy 蒸餾,以及跨通用、推理、編碼、agentic 領域的強化學習。

Meta 表示,模型依其「Advanced AI Scaling Framework」做評估,並在所有相關維度上通過開放權重版本釋出的審核。

為什麼這個尺寸值得關注

30B 是當前本地端推理的甜蜜點。Gemma4-31B、Qwen3.6-27B 都在這個區間,意味著 Meta 不是發一個「基準試驗品」,而是直接加入了今年最激烈的開放權重競爭。Muse Glimmer 量化後可壓到 20GB 以下,給 24GB / 32GB VRAM 留下餘裕同時跑 KV cache、感知編碼器、Speculative Decoding drafter。

為什麼這件事重要

從 LLM 商業化角度來看,雲端 API 一直是主戰場。Muse Glimmer 告訴我們,Meta 願意把 30B 級的本地 agent 模型以 Apache 2.0 開源,這對開發者生態意義重大:

  • 本地 agent 真正可用:之前 30B 級模型在 agentic 場景上常被 70B+ 雲端模型輾壓,現在差距縮小。
  • 隱私與成本:企業可在自己的硬體上跑,無需把程式碼、客戶資料送出雲端。
  • 可控性:可微調、可量化、可離線部署,不會被雲端供應商「拔插頭」。

對台灣開發者而言,這代表可以用 A$8499 等值的雙通道高頻寬 DDR5 平台(160–320GB/s)或單張 RTX 5090 / RTX Pro 6000,跑出接近雲端的體驗。

數據解讀

根據 Meta 與第三方評測 Muse Glimmer 在 agentic 場景普遍勝出:

  • MCP Atlas:75.5,遠勝 Gemma4-31B 的 54.2、Qwen3.6-27B 的 62.5
  • DeepSearch QA:74.6 vs 對手 61.7 / 71.1
  • WildClawBench:47.6 vs 37.6 / 43.2
  • GAIA2:43.3 vs 36.4 / 40.0
  • SWE-Bench Pro:51.2 vs 36.9(Gemma4 落後 14 分)
  • SciCode:43.6,領先兩個對手

但 Qwen3.6-27B 在偏終端操作類的基準上反超:

  • TerminalBench 2.1:Qwen 60.7 vs Glimmer 51.7
  • SWE-Bench Verified:Qwen 77.2 vs Glimmer 76.0(差距小但真實)
  • OSWorld-Verified:Qwen 拉開差距

編碼基準上 Muse Glimmer 整體領先,但涉及「持續終端操作 + 電腦控制」時 Qwen 更穩。對 agentic 平台選型來說,需要依工作負載類型挑選。

速度與硬體優化

Muse Glimmer 透過兩項工程來達到「流暢對話」:

  1. 量化把模型塞進裝置:30B 全精度需要超過 55GB 顯存;用 4-bit 量化壓到 20GB 以內,給 KV cache、感知編碼器、drafter 預留空間,可在 24GB / 32GB 顯存內同時跑。
  2. Speculative Decoding 加速:內建一個名為 DFlash 的小模型當 drafter,一次生成整段 token 候選,主模型再平行驗證。

Meta 測量了 K-Quant-17GB 模型搭配 DFlash drafter 在 MacBook M4-Max、M5-Max、RTX-5090 上的速度。在這些消費級硬體上已足以達到流暢對話與即時 agent 互動。

架構細節

Muse Glimmer 是稠密(dense)模型:

  • 52 層 decoder
  • 分組查詢注意力(GQA)
  • 局部/局部/局部/全域交錯的注意力模式
  • 專屬感知編碼器:ViT-G/14 風格、約 18 億參數、50 層
  • 支援文字 + 圖片交錯輸入,Hugging Face 啟動指南顯示影片以抽幀方式處理,上限 96 幀
  • 模型本身不生成圖片

怎麼開始用

Muse Glimmer 已在 Hugging Face 上架,可下載權重:

  • 本地一鍵部署:Ollama、LM Studio、Unsloth
  • 邊緣框架:llama.cpp、ExecuTorch、MLX
  • 規模化服務:vLLM、SGLang
  • 雲端一鍵託管:Together AI、Fireworks AI、OpenRouter
  • 裝置廠商合作:AMD、Arm、Dell、Intel、NVIDIA

社群迴響與質疑

Hacker News 上 615 分、329 則留言,主流社群討論圍繞幾個面向:

  • 效能質疑:Muse Glimmer 4-bit 量化版僅 17GB,但官方未明示是否啟用 quantization-aware training,這可能影響任務穩定性。
  • 硬體選擇:消費級 GPU 記憶體頻寬仍是本地 LLM 的瓶頸。實測 2 張 RTX Pro 6000 跑 DeepSeek-V4-Flash 可達約 250 token/s decode,而 DGX Spark 與 Apple Silicon 在頻寬延遲上仍吃虧。
  • 政治口水:不少留言糾結於「Meta 是否被開源洗白」,但技術留言普遍認為企業開權重多是行銷策略,能用就用。
  • DGX Spark 性價比:在零售通路用 DGX Spark 同樣預算可買 544GB DDR5-5200,搭配 8/12 通道平台可達 320GB/s 頻寬,純 CPU decode 還能贏 DGX Spark。

Siami 觀點

Meta 這步棋的真正意義是把「永遠在線的本地 agent」從概念推到量產:

  1. 30B 級 open weights 重新回潮:過去兩年大家追逐 MoE 與更大稠密模型,Meta 反其道選擇 30B 稠密 + 蒸餾,告訴大家「對的尺寸 + 對的訓練」可能比盲目擴張更划算。
  2. Speculative Decoding 變基礎設施:DFlash 內建代表業界已把加速器從研究主題變成產品必備。Qwen、Inkling 還未跟上這步。
  3. Muse Spark 1.2 開權重即將到來:Zuckerberg 已在 Threads 預告 Muse Spark 1.2 也將開放權重。若屆時 70B+ 級也解鎖,本地 agent 的天花板會再上一層。

對台灣開發者最直接的好處是:可以用合理預算組一台 64GB–128GB 統一記憶體的小型工作站,部署 Muse Glimmer 處理企業內部 agent 工作流,不用再把程式碼、客戶資料、財報送上雲端 API。

編按:本文綜合整理自 Meta AI Research 官方部落格、Hugging Face 模型卡、Unsloth 部署指南、OfficeChai 評測、BenchLM MCP Atlas 排行榜,以及 Hacker News 留言區原始討論,並加入 Siami 編輯部觀點與分析。

網友熱門留言 (6)

#1 Aurornis 0
Unsloth 已經上架量化版本:https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF 。量化版本在發布後幾週內常會因為新發現的優化而更新,所以要用會檢查 Hugging Face 新版的工具,或過幾天自己回來確認。初期回報都不錯,但模型才剛發布,社群還沒有足夠時間做完整評測。
#2 dannyw 0
用 DGX Spark 的價格(A$8499,合約新台幣 18 萬)在零售通路大概可以買到 544GB DDR5-5200MHz;放在 quad channel 平台上實測可達約 160GB/s 頻寬,octa channel(Xeon、Threadripper Pro)可達 320GB/s。8/12 通道的 DDR5 跑純 CPU 推論的 decode 速度已經能贏 DGX Spark,根本不需要 GPU。
#3 spmurrayzzz 0
本地 LLM 最大的效能瓶頸其實是記憶體頻寬,只要你 VRAM 容量夠把所有權重都塞進去。DGX Spark 跟 Apple Silicon 的記憶體頻寬(還有記憶體存取延遲)都會嚴重拖累 decode 速度。我兩台 GPU 機器各裝 2 張 RTX Pro 6000,跑 DeepSeek-V4-Flash native mixed precision 可以達到約 250 token/s decode。
#4 andy99 0
GGUF 已經上架而且可以跑了,不確定是 Meta 還是真的 Unsloth 推的;但這對用戶很方便,因為像 Inkling 這種模型到現在 llama.cpp 都不支援,等於對那一類用戶毫無用處。可惜我對 Qwen 27B 沒有足夠經驗可以直接比較,只能確定 Qwen 3.6 35B A3 明顯更慢,但 token 利用效率看起來高出不少。
#5 linguae 0
我對本地 LLM 的長期前景非常樂觀,原因在於隱私與成本控制。跑在自己硬體上的 LLM(就算不是筆電而是家用伺服器)就不用擔心 token 額度、token 計費、隱私,還有被供應商「拔插頭」的風險。短期最大的挑戰是要能負擔跑 30B 模型需要的硬體,上個月我終於入手一台記憶體夠大的二手設備...。
#6 jjice 0
我會說任何公司在開權重時都一樣,動機不是什麼正義,而是行銷。這不一定是壞事,他們確實把好東西免費放出來,大家也都受益。每家公司這樣做都有不能開源頂級模型的理由,所以我們看到的是跟他們競爭版圖相符的東西。