編按:本文綜合整理自 Strata 開發者 Niko1221 的 GitHub README、Qwen 官方部落格、Hugging Face 模型卡、Hacker News 討論串 與 r/LocalLLaMA 社群實測,並加入 Siami 編輯部觀點與分析。
125B 模型,現在跑在 12GB 顯示卡上過去這種規模的模型,連想都不用想,必須放在裝了數百 GB 顯示記憶體的伺服器機房。但 Strata 這個開源推論引擎,把 1,250 億參數的 Qwen3.8-Flash-Next 塞進了普通玩家的遊戲電腦。實測數字很漂亮:在 RTX 5070(12GB)加上 64GB RAM、AMD Ryzen 5 7600 的常見配置下,量化版 Q2_0 寫入速度 94 tokens/s、讀取速度 2,650 tokens/s。RTX 3090(24GB)可達 100-140 tokens/s。開發者 Niko1221 在 10 月初把這套引擎丟上 GitHub,幾天內就累積超過 11,000 顆 Star、衝上 GitHub Trending 全語言前幾名,HN 討論串也破 296 則留言。
怎麼做到的?把 MoE 拆給整台電腦
Qwen3.8-Flash-Next 不是普通的稠密模型,而是極稀疏的 MoE(Mixture of Experts,混合專家)架構:
- 總參數 125B(主模型 130B + 51B N-gram embeddings + 4B MTP,合計約 180B 級距)
- 每個 token 只啟動 6B 參數
- 24,576 個「專家」,每個詞只會喚醒其中約 10 個
Strata 的聰明之處在於把工作分散到整台電腦,而不是硬塞進顯示卡:
- 顯示卡(VRAM):保留最常用的幾千個專家
- 系統 RAM:放所有 24,576 個專家
- 處理器(CPU):並行處理其他專家
- SSD:放大型 lookup table
就像廚房備料:常用的食材放流理台,全部食材放冰箱儲藏室,鍋碗瓢盆放儲藏室。另一個加速技巧叫「先猜再驗」:讓一個小模型先猜下一串詞,大模型一次比對所有候選,1.6-1.8 倍速度拿到同樣品質的答案。
你的硬體跑得動嗎?
| 你的 RAM | 建議量化 | 理由 |
|---|---|---|
| 32 GB | Coder | 32GB 裝得下,專為寫程式微調,達原版 SWE-bench Verified 91% |
| 48 GB | IQ2_XS 或 Q2_0 | 更大量化塞不下 |
| 64 GB | IQ2_XS(推薦)或 IQ3_XXS / IQ3_S | 全部量化都裝得下;IQ3_S 最佳但最慢 |
| 96 GB+ | IQ3_S 或 Unsloth UD-IQ4_XS(≈4-bit) | 連最大量化都能開著瀏覽器跑 |
顯示卡需求:NVIDIA GeForce RTX 20/30/40/50 系列,或 AMD Radeon RX 7900/7800/7700/9060/9070 系列,皆需 12GB+ VRAM。
注意:Coder 版本為了塞進 32GB RAM 砍掉一半專家,對中文等 CJK 文字表現會變弱。如果你常處理中文,建議改用 Q2_0、IQ2_XS 或 IQ3_S,這些保留所有專家。磁碟需要約 80GB SSD。安裝時第一次啟動會把 35-55GB 載入 RAM,整台電腦可能會卡住 1-3 分鐘,這是正常的,別關掉視窗。
安裝:三個步驟搞定
Windows:解壓縮後雙擊 START-HERE.bat。
Linux:在 Strata 資料夾跑 ./setup.sh。
用 AI 助理代勞(Claude Code、Cursor、Codex、GitHub Copilot 等):
Set up Strata on this PC for me: https://github.com/Niko1221/Strata
- follow docs/AI_SETUP.md in that repository.
安裝程式會自動偵測顯卡、設定對應引擎、問你幾個問題(用哪個模型、context 多長、要不要讀圖),下載約 70GB 的模型後啟動服務,瀏覽器自動開 http://127.0.0.1:8080。也可以用現有 app 串接(因為 Strata 提供 OpenAI / Anthropic 相容 API):
- ChatGPT 相容 app:base URL 設
http://127.0.0.1:8080/v1,API key 隨便填都行 - Claude Code / Anthropic 相容 app:
ANTHROPIC_BASE_URL=http://127.0.0.1:8080 - Codex CLI:用
/v1/responses端點
用手機或另一台電腦遠端連:
START-HERE.bat --setup --host 0.0.0.0 --api-key <自訂密碼>。務必設密碼,不然整個網路都能呼叫你的模型。
為什麼這件事重要過去一年,「開源 LLM 能不能跑在本地」這題一直被一個物理限制綁住:模型多大、VRAM 就要多大。70B 等級的稠密模型勉強塞得進 48GB 顯示卡工作站,但 24GB 以下的消費級顯卡連想都不敢想。
MoE 架構理論上能打破這個限制(總參數很大但只啟動一小部分),但實務上怎麼聰明地把專家分散到不同硬體,一直沒有乾淨的開源解。Strata 證明了一件事:消費級顯示卡 + 足夠 RAM + SSD 暫存 = 跑 125B 模型不再是夢。這對一般使用者意味著:
- 隱私:模型完全跑在本地,機敏文件、公司原始碼、健康資料都不外流
- 訂閱費:每月省下 $20 USD 的 ChatGPT Plus 或 Claude Pro 訂閱(一年約 7,000 台幣)
- 離線可用:飛機上、客戶端機房、沒有網路的實驗室都能跑
- 不受 API 限流:本地無 token 上限、不被服務條款限制對開發者來說更關鍵:可以串接 Claude Code、Cursor 等 coding agent,等於在本地跑出一個不輸閉源大模型的寫程式助手。
Unsloth 社群實測:在 RTX 3090 + 128GB DDR5 + SSD 上跑 Qwen3.8-Flash-Next Coder 版,524K context 維持 72 tokens/s。「Wild.」是測試者 @picaye 在 X 上的原話。
數據解讀 / 質疑
100 tokens/s 是上限、不是保證。實測速度高度依賴三件事:
- RAM 速度:DDR5-6400 比 DDR4-3200 快 1.5-2 倍。Reddit 用戶在 64GB DDR4-3200 + RTX 4090 跑出 1000 t/s prefill,但 decode 端就掉到 50 t/s 左右。
- VRAM 容量:12GB 顯卡只能跑 IQ3_S 以下的量化,24GB 顯卡才能跑 IQ3_S 完整版享受更穩定的品質。
- SSD 速度:如果 RAM 不夠大,模型部分會被交換到 SSD,這時 NVMe SSD 跟 SATA SSD 差非常多。
IQ3_S 的品質是妥協不是免費。量化是把模型的權重精度降低來換取更小的體積。IQ3_S 大約是 3-bit 量化,模型「聰明程度」約為原版的 96%(社群實測)。對日常問答、寫 code 影響不大,但對數學證明、長邏輯推理還是會掉。
MoE 啟動成本高。第一次把模型載入 RAM 要 1-3 分鐘,期間整台電腦會卡。這是因為 24,576 個專家要從 SSD 載入記憶體重新組織,不是 bug 是設計。
「省 API 費」這帳要算仔細。一台能跑 Strata 的電腦最少要 RTX 3090(約台幣 25,000 二手)+ 64GB RAM+ 1TB NVMe SSD。光顯卡就超過 3 年 ChatGPT Plus 訂閱費。本地 LLM 的經濟優勢在「每天重度使用 + 隱私需求」的使用者才划算。
社群反應:硬核玩家社群狂喜
Hacker News 評論者:「這是真正的開源 AI 勝利。Qwen 出一個奇怪的 MoE 架構,然後社群一週內就做出能在 12GB 顯卡上跑的推論引擎。」
r/LocalLLaMA 實測者:「3 張改裝 RTX 2080 Ti 22GB(合計 66GB VRAM)跑出 66.6 tok/s decode、742 tok/s prefill,Strata 的 layer-split 真的太神了。」
簡中社群:「讓我的 9950X3D 64G + 4070S 12G 也能跑 Qwen3.8-Flash-Next 125B MoE IQ2_XS 量化版大概 60 tok/s。量化作者公布的三項測試,平均分數還有原版的約 96%。」
安全研究員 Simone Margaritelli(@evilsocket):在 X 上轉推 Strata 給他的 4 萬追蹤者,標註「本地 LLM 進入新時代」。
GitHub Trending:上線一週內衝到全語言前幾名、累積 11.7k+ Star、1k+ Fork、216 個 PR 等著合併。
接下來呢?
Strata 目前還不是 llama.cpp 的競爭者。Reddit 有人比較「標準 Qwen 3.8」跑在 llama.cpp 上 20 t/s,跑在 ninfer-3090 上 50 t/s,Strata 則在 40-60 t/s 之間——「比其他專用推論引擎慢一點,但社群會追上來」。開發者 Niko1221 已經放話要把 Strata 從「Qwen3.8-Flash-Next 專用引擎」擴展到其他 MoE 模型。Unsloth 也已經包好 GGUF 版本,搭配 llama.cpp 直接跑也可行。對台灣讀者的實際建議:
- 有遊戲電腦(12GB+ 顯卡 + 32GB+ RAM):可以試 Coder 版玩本地 coding agent
- 有 Mac Studio M2/M3 Ultra(192GB 統一記憶體):目前 MLX 版本還沒出,但等一下一定會有
- 只有筆電:跑不起來,老實訂 ChatGPT Plus 或 Claude Pro
- 想離線處理隱私資料(醫療、法律、財報):Strata 比 llama.cpp 對 MoE 更友善,是目前最成熟的選擇
一句話總結:Qwen 把模型做出來、Strata 把它帶進你家。本地 LLM 的硬體門檻,從「資料中心級」降到「遊戲玩家級」,這是 2026 年開源 AI 最重要的一次典範轉移。
網友熱門留言 (5)