編按:本文綜合整理自 NVIDIA 官方 Hugging Face model card、NVIDIA Developer Blog 與 lmsys.org 公告,並加入 Siami 編輯部觀點與分析。基準分數為 NVIDIA 自家 NeMo Gym 量測結果,可能與第三方實測有差異。
NVIDIA 在 2026 年 8 月 11 日正式開源 Nemotron 3.5 Lightning,這是繼 6 月發布的 Nemotron 3 Ultra 550B 之後,Nemotron 家族中第一個專為「長時間運作的 agent」設計的輕量級模型。它是 30B 總參數、3B 激活參數的 MoE + Mamba-2 + Attention 混合架構,透過 NVFP4 4-bit 量化,讓單張 H100 或 DGX Spark(GB10)就能跑完整模型,包含 1M token 的長上下文視窗。
模型定位與規格
Nemotron 3.5 Lightning 的核心賣點是「Always-On Agent 執行層」:負責高吞吐量、低延遲的子任務執行,而不是對話式主模型。NVIDIA 在官方部落格中明確提到,這個模型設計給 OpenClaw、Hermes Agent 等常駐型 agent 框架使用,並由 NVIDIA NemoClaw 開源安全與管理堆疊支援。
關鍵規格:
- 總參數 30B / 激活 3B:典型 MoE 配置,每次推論只啟動 10% 參數
- 架構:Mamba-2 + MoE + Attention 混合(Hybrid LatentMoE)
- 上下文長度:最高 1M token
- 硬體需求:單張 H100、單張 DGX Spark(GB10)、或 RTX 5090 / GB200
- 授權:OpenMDW-1.1(NVIDIA 主導的開放模型授權,允許商用)
- 發布日期:2026 年 8 月 11 日
訓練流程與資料
Nemotron 3.5 Lightning 採用 20T+ tokens 做預訓練,並走完整五階段流程:
- 預訓練:NVFP4 配方,搭配 web 爬蟲與合成資料(程式、數學、科學、通用知識),使用 Megatron-LM
- MTP 持續預訓練:訓練 Multi-Token Prediction head,提供更豐富的訓練信號
- 監督式微調:合成程式、數學、科學、tool calling、指令遵循、結構化輸出資料
- 強化學習:使用 GRPO 在數學、程式、科學、tool use、多輪對話環境做多環境 RL;採用 NeMo RL 與非同步 RL 架構
- 後訓練量化(PTQ):W4A16 + FP8 KV cache 的 Four-Over-Six NVFP4 配方
預訓練資料截止 2025 年 9 月,後訓練資料截止 2026 年 5 月。
效能基準
NVIDIA 公佈的基準分數(BF16 vs NVFP4 量化後):
| 任務類別 | 基準 | BF16 | NVFP4 |
|---|---|---|---|
| 通用知識 | MMLU Pro | 81.94 | 81.62 |
| 推理 | GPQA Diamond | 75.44 | 75.57 |
| 推理 | HLE(無工具) | 11.72 | 10.47 |
| 程式碼 | SWE-bench Verified | 51.56 | 52.80 |
| 程式碼 | SWE-bench Multilingual | 39.33 | 36.47 |
| Agentic | Terminal-Bench 2.1 | 24.58 | 23.46 |
| Agentic | PinchBench | 85.37 | 83.43 |
| Agentic | BrowseComp | 36.97 | 36.81 |
| 長上下文 | AA-LCR | 52.00 | 49.19 |
NVIDIA 把基準評測腳本與 recipe 都公開在 NeMo Gym 的 nemotron_recipes/lightning-3.5/reproducibility.md,這次「基準可重現」是設計重點。
DSpark 投機解碼:真正的差異化
這次發布最值得注意的是 NVIDIA 同步開源的 DSpark(位於 NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark 儲存庫)。DSpark 是半自迴歸的平行投機解碼器:
- 平行 backbone 在單次 forward pass 提出整個 token 區塊的候選
- 輕量 Markov head 注入區塊內 token 依賴性,避免純平行 drafter 的 acceptance decay
- confidence head 預測每個位置的接受機率,用於排程驗證
- drafter 凍結 target 的
embed_tokens與lm_head,只訓練新加的層
NVIDIA 官方建議的部署方式:
- DGX Spark / 低並行資料中心 → DSpark
- 高並行資料中心 → 純 MTP
- 其他 → DFlash 或 MTP
🚨 為什麼這件事重要
NVIDIA 這次發布的本質,是把「開源 agent 模型 + 開源投機解碼器 + 開源授權」三件事一次打包到位。在 8 月這個時間點,這代表幾件事:
第一,小型 MoE 正在取代稠密模型成為 agent 的預設選擇。3B 激活參數代表每個 token 的計算成本接近 3B 稠密模型,但容量有 30B;這對需要「大量並行 agent」的部署模式(例如一個主 agent + 多個子 agent)是決定性的成本優勢。
第二,Mamba-2 + Attention 混合架構成為長上下文的務實解。純 Transformer 在 1M context 的 KV cache 會爆炸(即使量化後也是),純 Mamba 又有召回率瓶頸。Lightning 採用交錯 Mamba-2 + MoE + 選擇性 Attention 的方式,在 NVIDIA 的官方部署指令中明確可以看到 --mamba-backend flashinfer 與 --kv-cache-dtype fp8 兩個關鍵參數,這是為了把長上下文成本壓到能接受的範圍。
第三,DSpark 把投機解碼從「外掛工具」變成「模型原生能力」。傳統投機解碼(Medusa、EAGLE)需要另外訓練 draft 模型,且 acceptance 會隨著 draft 長度衰減。DSpark 的設計(平行 backbone + Markov head + confidence head)讓 acceptance 曲線更穩定。Thoughtworks 獨立實測 2,091 次推論後,原生 MTP 投機解碼比未加速版本快 1.46–1.96 倍,且任務準確度統計上等價。
第四,OpenMDW 授權是 NVIDIA 在開源策略上的明確表態。不同於 Llama 系列的「可商用但有限制」社群授權,OpenMDW-1.1 允許完整商用,這對企業部署是關鍵差異。配合 build.nvidia.com 上的官方 API endpoint,NVIDIA 已經把「開源模型 + 雲端 API + 本地部署」三條路同時鋪好。
🚨 數據解讀與質疑
基準分數的解讀需要特別小心:
- NVFP4 量化並非免費。SWE-bench Multilingual 從 39.33 掉到 36.47(-2.86 分),AA-LCR(長上下文)從 52.00 掉到 49.19(-2.81 分)。多語言程式任務與長上下文任務是量化的明顯弱點。
- 某些基準反而上升。SWE-bench Verified 從 51.56 升到 52.80、GDPval-AA-V2 從 832 升到 865。這些小幅上升屬於 run-to-run 變動範圍,並不代表「量化讓模型變聰明」。explainx.ai 的分析師特別指出,這個變動幅度大約是 ±1 分,所以單一基準數字的「上升」要打折扣看。
- HLE 11.72 → 10.47 是 Humanity’s Last Exam(被設計為極難的綜合推理題),即使只有 10 分出頭,這已經是當前開源模型的領先水準。但要記住這是「無工具」版本,使用工具可以顯著提升分數。
- PinchBench 83.43 是亮點。PinchBench 測試多輪互動任務,83.43 分在 30B 等級的開源模型中是頂尖水準。這也呼應 NVIDIA 把模型定位為「always-on agent」而非「聊天機器人」。
值得關注的限制:
- H100 高並行場景不建議使用投機解碼。官方文件明確說「For max throughput deployments, no speculative decoding strategy is best」,因為記憶體限制與並行衝突會抵消加速效果。
- DSpark 在 disaggregated serving 仍有 bug。NVIDIA TensorRT-LLM issue #16767 指出,當 batch size > 1 且在分離式 context/generation 部署下,DSpark 的 accept length 會掉到 ~1,等於完全失效。這個問題到 8 月 11 日仍在處理中。
- Ampere 架構只能跑 W4A16 量化版本。這對企業既有 H100/A100 機房是限制——A100 用戶拿到的版本效能會低於 Blackwell 用戶。
延伸閱讀:
網友熱門留言 (3)