編按:本文綜合整理自 DwarfStar 官網、Hacker News 討論串、antirez 官方部落格 - Distributing LLM inference、antirez 官方 YouTube 實機展示,並加入 Siami 編輯部觀點與分析。
Salvatore Sanfilippo(網路代號 antirez),也就是開源記憶體資料庫 Redis 的原創作者,10 月初把他最新個人專案 DwarfStar 4(代號 ds4)推上 Hacker News 首頁,立刻引爆開發者社群。這個專案的核心主張是:在 128GB 消費級 MacBook 上跑得動 284B 參數的 DeepSeek V4 Flash——而且每張 token 都能達到 ~35-40 t/s 的生成速度。
這不是 llama.cpp 換皮,也不是通用 GGUF runner。antirez 從一開始就把 ds4 定位成「窄而深的 C 推論引擎」,只支援他親自驗證過的模型家族:DeepSeek V4 / V4.1 Flash、GLM 5.x、Qwen3.8 Flash Next——三個家族背後是一整套非對稱 2-bit 量化、SSD 流式 KV cache、Metal/CUDA/ROCm 三平台 runtime 的工程組合。
為什麼 antirez 要從頭寫一個 inference engine
DwarfStar 官網開宗明義寫著「Not a generic GGUF runner」——這句話本身就是 antirez 對整個本地 LLM 開源生態的宣告。從 2023 年 llama.cpp 橫空出世以來,整個本地推論的世界幾乎是 llama.cpp + GGUF 雙軌壟斷。任何新模型出來,只要有人貢獻 GGUF 轉檔,大家馬上能在自己筆電上跑。
但 antirez 在自己的 部落格文章 點出一個殘酷現實:routed-MoE 模型(DeepSeek V4 Flash 這類混合專家)對記憶體頻寬極度敏感,通用 GGUF 量化方案在這種架構下會嚴重掉品質。DeepSeek V4 Flash 是 284B 參數的 MoE,總記憶體需求約 384GB,即使是量化後也要 96GB VRAM——這已經超出大多數消費級 GPU 的能力。
antirez 的解法是「asymmetric 2-bit quantization」:把 routed experts 壓到 2-bit,但保留 critical shared paths 的精度。這種設計讓支援的模型能剛好塞進目標機器的記憶體,而不是犧牲太多品質。
更激進的是 KV cache 設計。ds4 把 KV cache 寫到 SSD,並用 SHA1 hash prompt prefix 來索引——伺服器重啟後不必重新 prefill,只要 prompt prefix 還在磁碟上,hash 一致就立刻載回。對 65K context 的長對話或 agent 工作流來說,這是救命功能。
三大硬體平台的實測數字
dwarfstar.sh 把硬體支援分得很細,每個平台都有保守建議:
| 平台 | 最低記憶體 | 適合模型 | 預期速度(q2 2,048 tok) |
|---|---|---|---|
| Apple Silicon Mac | 64 GB+ | V4 Flash Q2 | 視晶片而定 |
| NVIDIA DGX Spark / CUDA Linux | 128 GB | V4 Flash Q2 | 825 t/s prefill · 18 t/s gen |
| AMD Strix Halo(ROCm) | 96 GB+ | GLM 5.2 / V4 Flash | 視驅動成熟度 |
官網上的基準測試表顯示,M5 Max 128GB 跑 2,048 token 短 context 可達 790.2 t/s prefill、39.4 t/s generation。長 context 拉到 65,536 token 時 prefill 降到 398.5 t/s、generation 還有 27.6 t/s——這個衰減斜率對 agent workload 來說是可接受的。
DGX Spark 128GB 的數字更極端:短 context 825.8 t/s prefill、18.1 t/s generation,但長 context prefill 居然還能維持 823.0 t/s、generation 還有 13.8 t/s。這個差異主要來自 Spark 的記憶體頻寬比 Mac 弱,但對 long-context agent 反而有利。
antirez 在部落格特別提到,M5 Max 128GB MacBook Pro 是當前 local inference 的最佳性價比平台——售價 6-7 千美元,能跑 frontier 等級的 284B MoE 模型。他直接預言 NVIDIA 短期內不會更便宜,加上 RAM 缺貨讓 Mac Studio M5 Ultra 短期內可能看不到。
不只是模型推論——ds4 還想做本地 coding agent 平台
dwarfstar.sh 官網把 ds4 拆成三個獨立但共享狀態的介面:
./ds4— 互動式 CLI chat,直接在 terminal 對話./ds4-server— 啟動本地 HTTP 伺服器,同時支援 OpenAI Chat Completions 和 Anthropic Messages API 兩種格式./ds4-agent— 持久化編碼代理 session,目標是取代 Claude Code、Codex CLI、OpenCode 對雲端 API 的依賴
第二點最關鍵:因為 ./ds4-server 同時吐 OpenAI 跟 Anthropic 格式的 API,開發者可以把本地 ds4 設成 base_url,讓所有相容 OpenAI/Anthropic API 的工具(Claude Code、Codex、OpenCode、Pi 等)直接接到自己 MacBook 上的 284B 模型。
這對在意成本的開發者來說意義重大——一台 128GB MacBook Pro 買斷之後,本地推論的邊際成本接近電費,不用每月付 Claude Pro $20 或 ChatGPT Plus $20,更不用講 API 按 token 計價。
antirez 在 antirez 官方 YouTube 頻道 有一支 37K 觀看次數的實機 demo:「Hands-on demo of DeepSeek v4 Flash locally with 128GB of RAM」——從硬體要求、模型下載、build、到實際 chat 都演示過。
從單機到分散式:antirez 的下一步野心
更值得注意的是 antirez 在 5 月 25 日發表的 Distributing LLM inference in DwarfStar 文章。他正式宣告 ds4 進入分散式推論時代。
他的核心論點:在當前硬體環境下,兩台 M5 Max 128GB MacBook 串起來,可能比一台 Mac Studio M3 Ultra 512GB 更划算也更靈活。理由是 RAM 缺貨導致 Mac Studio M5 Ultra 可能難產,而 MacBook 是「普通人都能擁有」的消費級硬體。
他列出兩條分散式路徑:
- 層級切分(Pipeline Parallelism):把 transformer 一半層放機器 A、一半放機器 B,啟動在兩台間傳遞。優點是只要傳 activations(資料量小),缺點是單 token 推論要等 A 跑完才能跑 B。但搭配 micro-batching 可以把 prefill 速度拉高。
- 專家切分(Expert Parallelism via Apple RDMA):兩台機器都載完整模型,執行時各跑一半 routed experts。對 DeepSeek V4 PRO 這類專家數極大的模型特別有效,因為通訊成本相對低。
他也坦言 NVLink 等專屬互連速度太快,傳統 tensor parallelism 在 Apple Silicon 之間短期內不可行。但兩條「小資料量傳輸」的路徑已經足以讓兩台 MacBook 跑得動完整 DeepSeek V4 PRO。
為什麼這件事重要
這是 2026 年本地 LLM 運動的分水嶺。 在 DwarfStar 之前,「本地跑 frontier 模型」對一般開發者來說意味著:要嘛花大錢買 Mac Studio 512GB($5,000+ 起跳),要嘛用雲端 API(每月數百到數千美元)。antirez 用「窄而深」的工程哲學,把選項從兩極拉到中間——一台 6-7 千美元的 MacBook Pro 就能跑 284B 參數的 DeepSeek V4 Flash,速度還比 GPT-3.5 時代的雲端 API 還快。
更深層的意義是:ds4 開源(MIT License)、作者是 Redis 創辦人、社群信任感強。這三個條件組合起來,讓本地 LLM 從「極客玩具」變成「可投入生產的工程選項」。如果 ds4-agent 真的能取代 Claude Code / Codex 的雲端依賴,整個 AI 編碼產業的成本結構會被重組。
Siami 編輯部認為,DwarfStar 4 的真正貢獻不是速度數字,而是證明了「個人硬體 + 開源工程」這條路線的可行性。在所有人都往雲端集中式算力衝的 2026 年,antirez 走了一條相反的路——而且走得通。
數據解讀與質疑
1. 量化品質的真實代價:asymmetric 2-bit quantization 在 routed experts 上效果好,但這只針對 DeepSeek V4 / GLM 5 / Qwen3.8 這三個 antirez 親自驗證的家族。其他模型(如 Llama 4、Mistral Large 3)ds4 並不支援。想跑新模型的開發者要嘛等 antirez 加,要嘛回頭用 llama.cpp。
2. 硬體鎖定 Apple Silicon 的疑慮:M5 Max 128GB 雖然效能/價格比好,但 6-7 千美元對個人開發者仍不是小數目。而且 antirez 自己承認,「M5 Ultra Mac Studio 可能因為 RAM 缺貨不會出」——這等於把本地推論的未來押在 Apple 的供應鏈上。
3. 「本地取代雲端 API」的經濟學被高估:買一台 128GB MacBook Pro 6-7 千美元是一次性成本,但 MLX / Metal 框架仍在快速演化,模型量化格式也還沒統一。今天跑的 ds4,明天可能需要重 build 或換 framework。相對之下,雲端 API 是「無腦永遠可用」。對多數開發者來說,短期混用(coding 用 Claude API、長文生成用本地)會比「全本地」更務實。
4. HN 留言區的工程師也有疑慮:有人指出 ds4 的社群生態比 llama.cpp 小非常多,遇到問題幾乎只能靠 antirez 一人回。這是單一作者開源專案的典型風險——品質天花板高,但 bus factor 也是 1。
編按:本文綜合整理自 DwarfStar 官網、Hacker News 討論串、antirez 官方部落格、antirez 官方 YouTube 實機展示,並加入 Siami 編輯部觀點與分析。
網友熱門留言 (5)