← 返回 Siami 首頁

NVIDIA Nemotron 3.5 Lightning 開源 30B MoE 模型 3B 激活參數在單張 H100 上跑得起來

▲ 57 💬 14
NVIDIA Nemotron 3.5 Lightning 開源 30B MoE 模型 3B 激活參數在單張 H100 上跑得起來

編按:本文綜合整理自 NVIDIA 官方 Hugging Face model card、NVIDIA Developer Blog 與 lmsys.org 公告,並加入 Siami 編輯部觀點與分析。基準分數為 NVIDIA 自家 NeMo Gym 量測結果,可能與第三方實測有差異。

NVIDIA 在 2026 年 8 月 11 日正式開源 Nemotron 3.5 Lightning,這是繼 6 月發布的 Nemotron 3 Ultra 550B 之後,Nemotron 家族中第一個專為「長時間運作的 agent」設計的輕量級模型。它是 30B 總參數、3B 激活參數的 MoE + Mamba-2 + Attention 混合架構,透過 NVFP4 4-bit 量化,讓單張 H100 或 DGX Spark(GB10)就能跑完整模型,包含 1M token 的長上下文視窗。

模型定位與規格

Nemotron 3.5 Lightning 的核心賣點是「Always-On Agent 執行層」:負責高吞吐量、低延遲的子任務執行,而不是對話式主模型。NVIDIA 在官方部落格中明確提到,這個模型設計給 OpenClaw、Hermes Agent 等常駐型 agent 框架使用,並由 NVIDIA NemoClaw 開源安全與管理堆疊支援。

關鍵規格:

  • 總參數 30B / 激活 3B:典型 MoE 配置,每次推論只啟動 10% 參數
  • 架構:Mamba-2 + MoE + Attention 混合(Hybrid LatentMoE)
  • 上下文長度:最高 1M token
  • 硬體需求:單張 H100、單張 DGX Spark(GB10)、或 RTX 5090 / GB200
  • 授權:OpenMDW-1.1(NVIDIA 主導的開放模型授權,允許商用)
  • 發布日期:2026 年 8 月 11 日

訓練流程與資料

Nemotron 3.5 Lightning 採用 20T+ tokens 做預訓練,並走完整五階段流程:

  1. 預訓練:NVFP4 配方,搭配 web 爬蟲與合成資料(程式、數學、科學、通用知識),使用 Megatron-LM
  2. MTP 持續預訓練:訓練 Multi-Token Prediction head,提供更豐富的訓練信號
  3. 監督式微調:合成程式、數學、科學、tool calling、指令遵循、結構化輸出資料
  4. 強化學習:使用 GRPO 在數學、程式、科學、tool use、多輪對話環境做多環境 RL;採用 NeMo RL 與非同步 RL 架構
  5. 後訓練量化(PTQ):W4A16 + FP8 KV cache 的 Four-Over-Six NVFP4 配方

預訓練資料截止 2025 年 9 月,後訓練資料截止 2026 年 5 月。

效能基準

NVIDIA 公佈的基準分數(BF16 vs NVFP4 量化後):

任務類別基準BF16NVFP4
通用知識MMLU Pro81.9481.62
推理GPQA Diamond75.4475.57
推理HLE(無工具)11.7210.47
程式碼SWE-bench Verified51.5652.80
程式碼SWE-bench Multilingual39.3336.47
AgenticTerminal-Bench 2.124.5823.46
AgenticPinchBench85.3783.43
AgenticBrowseComp36.9736.81
長上下文AA-LCR52.0049.19

NVIDIA 把基準評測腳本與 recipe 都公開在 NeMo Gym 的 nemotron_recipes/lightning-3.5/reproducibility.md,這次「基準可重現」是設計重點。

DSpark 投機解碼:真正的差異化


這次發布最值得注意的是 NVIDIA 同步開源的 DSpark(位於 NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark 儲存庫)。DSpark 是半自迴歸的平行投機解碼器:

  • 平行 backbone 在單次 forward pass 提出整個 token 區塊的候選
  • 輕量 Markov head 注入區塊內 token 依賴性,避免純平行 drafter 的 acceptance decay
  • confidence head 預測每個位置的接受機率,用於排程驗證
  • drafter 凍結 target 的 embed_tokens 與 lm_head,只訓練新加的層

NVIDIA 官方建議的部署方式:

  • DGX Spark / 低並行資料中心 → DSpark
  • 高並行資料中心 → 純 MTP
  • 其他 → DFlash 或 MTP

🚨 為什麼這件事重要

NVIDIA 這次發布的本質,是把「開源 agent 模型 + 開源投機解碼器 + 開源授權」三件事一次打包到位。在 8 月這個時間點,這代表幾件事:

第一,小型 MoE 正在取代稠密模型成為 agent 的預設選擇。3B 激活參數代表每個 token 的計算成本接近 3B 稠密模型,但容量有 30B;這對需要「大量並行 agent」的部署模式(例如一個主 agent + 多個子 agent)是決定性的成本優勢。

第二,Mamba-2 + Attention 混合架構成為長上下文的務實解。純 Transformer 在 1M context 的 KV cache 會爆炸(即使量化後也是),純 Mamba 又有召回率瓶頸。Lightning 採用交錯 Mamba-2 + MoE + 選擇性 Attention 的方式,在 NVIDIA 的官方部署指令中明確可以看到 --mamba-backend flashinfer 與 --kv-cache-dtype fp8 兩個關鍵參數,這是為了把長上下文成本壓到能接受的範圍。

第三,DSpark 把投機解碼從「外掛工具」變成「模型原生能力」。傳統投機解碼(Medusa、EAGLE)需要另外訓練 draft 模型,且 acceptance 會隨著 draft 長度衰減。DSpark 的設計(平行 backbone + Markov head + confidence head)讓 acceptance 曲線更穩定。Thoughtworks 獨立實測 2,091 次推論後,原生 MTP 投機解碼比未加速版本快 1.46–1.96 倍,且任務準確度統計上等價。

第四,OpenMDW 授權是 NVIDIA 在開源策略上的明確表態。不同於 Llama 系列的「可商用但有限制」社群授權,OpenMDW-1.1 允許完整商用,這對企業部署是關鍵差異。配合 build.nvidia.com 上的官方 API endpoint,NVIDIA 已經把「開源模型 + 雲端 API + 本地部署」三條路同時鋪好。

🚨 數據解讀與質疑

基準分數的解讀需要特別小心:

  1. NVFP4 量化並非免費。SWE-bench Multilingual 從 39.33 掉到 36.47(-2.86 分),AA-LCR(長上下文)從 52.00 掉到 49.19(-2.81 分)。多語言程式任務與長上下文任務是量化的明顯弱點。
  2. 某些基準反而上升。SWE-bench Verified 從 51.56 升到 52.80、GDPval-AA-V2 從 832 升到 865。這些小幅上升屬於 run-to-run 變動範圍,並不代表「量化讓模型變聰明」。explainx.ai 的分析師特別指出,這個變動幅度大約是 ±1 分,所以單一基準數字的「上升」要打折扣看。
  3. HLE 11.72 → 10.47 是 Humanity’s Last Exam(被設計為極難的綜合推理題),即使只有 10 分出頭,這已經是當前開源模型的領先水準。但要記住這是「無工具」版本,使用工具可以顯著提升分數。
  4. PinchBench 83.43 是亮點。PinchBench 測試多輪互動任務,83.43 分在 30B 等級的開源模型中是頂尖水準。這也呼應 NVIDIA 把模型定位為「always-on agent」而非「聊天機器人」。

值得關注的限制:

  • H100 高並行場景不建議使用投機解碼。官方文件明確說「For max throughput deployments, no speculative decoding strategy is best」,因為記憶體限制與並行衝突會抵消加速效果。
  • DSpark 在 disaggregated serving 仍有 bug。NVIDIA TensorRT-LLM issue #16767 指出,當 batch size > 1 且在分離式 context/generation 部署下,DSpark 的 accept length 會掉到 ~1,等於完全失效。這個問題到 8 月 11 日仍在處理中。
  • Ampere 架構只能跑 W4A16 量化版本。這對企業既有 H100/A100 機房是限制——A100 用戶拿到的版本效能會低於 Blackwell 用戶。

延伸閱讀:

網友熱門留言 (3)

#1 Hacker News 社群 ▲ 28
3B active params + NVFP4 4-bit quantization is a real sweet spot for agent workloads. The Mamba-2 hybrid also avoids KV cache blowup at 1M context.
#2 Hacker News 社群 ▲ 19
DSpark speculative decoding seems like the most interesting part. NVIDIA shipped a parallel drafter that doesn't decay the way Medusa/EAGLE do.
#3 Hacker News 社群 ▲ 14
On DGX Spark (GB10) at home this actually fits. That changes the calculus for local agentic stacks vs API-only.