← 返回 Siami 首頁

Strata:把 125B 參數的 Qwen3.8-Flash-Next 跑在 12GB 顯示卡上,100T/s 的開源推論引擎

▲ 635 💬 296
Strata:把 125B 參數的 Qwen3.8-Flash-Next 跑在 12GB 顯示卡上,100T/s 的開源推論引擎

編按:本文綜合整理自 Strata 開發者 Niko1221 的 GitHub README、Qwen 官方部落格、Hugging Face 模型卡、Hacker News 討論串 與 r/LocalLLaMA 社群實測,並加入 Siami 編輯部觀點與分析。


怎麼做到的?把 MoE 拆給整台電腦

Qwen3.8-Flash-Next 不是普通的稠密模型,而是極稀疏的 MoE(Mixture of Experts,混合專家)架構:

  • 總參數 125B(主模型 130B + 51B N-gram embeddings + 4B MTP,合計約 180B 級距)
  • 每個 token 只啟動 6B 參數
  • 24,576 個「專家」,每個詞只會喚醒其中約 10 個

Strata 的聰明之處在於把工作分散到整台電腦,而不是硬塞進顯示卡:

  • 顯示卡(VRAM):保留最常用的幾千個專家
  • 系統 RAM:放所有 24,576 個專家
  • 處理器(CPU):並行處理其他專家
  • SSD:放大型 lookup table

就像廚房備料:常用的食材放流理台,全部食材放冰箱儲藏室,鍋碗瓢盆放儲藏室。另一個加速技巧叫「先猜再驗」:讓一個小模型先猜下一串詞,大模型一次比對所有候選,1.6-1.8 倍速度拿到同樣品質的答案。


你的硬體跑得動嗎?

你的 RAM建議量化理由
32 GBCoder32GB 裝得下,專為寫程式微調,達原版 SWE-bench Verified 91%
48 GBIQ2_XS 或 Q2_0更大量化塞不下
64 GBIQ2_XS(推薦)或 IQ3_XXS / IQ3_S全部量化都裝得下;IQ3_S 最佳但最慢
96 GB+IQ3_S 或 Unsloth UD-IQ4_XS(≈4-bit)連最大量化都能開著瀏覽器跑

顯示卡需求:NVIDIA GeForce RTX 20/30/40/50 系列,或 AMD Radeon RX 7900/7800/7700/9060/9070 系列,皆需 12GB+ VRAM。

注意:Coder 版本為了塞進 32GB RAM 砍掉一半專家,對中文等 CJK 文字表現會變弱。如果你常處理中文,建議改用 Q2_0、IQ2_XS 或 IQ3_S,這些保留所有專家。磁碟需要約 80GB SSD。安裝時第一次啟動會把 35-55GB 載入 RAM,整台電腦可能會卡住 1-3 分鐘,這是正常的,別關掉視窗。


安裝:三個步驟搞定

Windows:解壓縮後雙擊 START-HERE.bat。

Linux:在 Strata 資料夾跑 ./setup.sh。

用 AI 助理代勞(Claude Code、Cursor、Codex、GitHub Copilot 等):

Set up Strata on this PC for me: https://github.com/Niko1221/Strata
- follow docs/AI_SETUP.md in that repository.

安裝程式會自動偵測顯卡、設定對應引擎、問你幾個問題(用哪個模型、context 多長、要不要讀圖),下載約 70GB 的模型後啟動服務,瀏覽器自動開 http://127.0.0.1:8080。也可以用現有 app 串接(因為 Strata 提供 OpenAI / Anthropic 相容 API):

  • ChatGPT 相容 app:base URL 設 http://127.0.0.1:8080/v1,API key 隨便填都行
  • Claude Code / Anthropic 相容 app:ANTHROPIC_BASE_URL=http://127.0.0.1:8080
  • Codex CLI:用 /v1/responses 端點

用手機或另一台電腦遠端連: START-HERE.bat --setup --host 0.0.0.0 --api-key <自訂密碼>。務必設密碼,不然整個網路都能呼叫你的模型。


為什麼這件事重要過去一年,「開源 LLM 能不能跑在本地」這題一直被一個物理限制綁住:模型多大、VRAM 就要多大。70B 等級的稠密模型勉強塞得進 48GB 顯示卡工作站,但 24GB 以下的消費級顯卡連想都不敢想。

MoE 架構理論上能打破這個限制(總參數很大但只啟動一小部分),但實務上怎麼聰明地把專家分散到不同硬體,一直沒有乾淨的開源解。Strata 證明了一件事:消費級顯示卡 + 足夠 RAM + SSD 暫存 = 跑 125B 模型不再是夢。這對一般使用者意味著:

  • 隱私:模型完全跑在本地,機敏文件、公司原始碼、健康資料都不外流
  • 訂閱費:每月省下 $20 USD 的 ChatGPT Plus 或 Claude Pro 訂閱(一年約 7,000 台幣)
  • 離線可用:飛機上、客戶端機房、沒有網路的實驗室都能跑
  • 不受 API 限流:本地無 token 上限、不被服務條款限制對開發者來說更關鍵:可以串接 Claude Code、Cursor 等 coding agent,等於在本地跑出一個不輸閉源大模型的寫程式助手。

Unsloth 社群實測:在 RTX 3090 + 128GB DDR5 + SSD 上跑 Qwen3.8-Flash-Next Coder 版,524K context 維持 72 tokens/s。「Wild.」是測試者 @picaye 在 X 上的原話。


數據解讀 / 質疑

100 tokens/s 是上限、不是保證。實測速度高度依賴三件事:

  1. RAM 速度:DDR5-6400 比 DDR4-3200 快 1.5-2 倍。Reddit 用戶在 64GB DDR4-3200 + RTX 4090 跑出 1000 t/s prefill,但 decode 端就掉到 50 t/s 左右。
  2. VRAM 容量:12GB 顯卡只能跑 IQ3_S 以下的量化,24GB 顯卡才能跑 IQ3_S 完整版享受更穩定的品質。
  3. SSD 速度:如果 RAM 不夠大,模型部分會被交換到 SSD,這時 NVMe SSD 跟 SATA SSD 差非常多。

IQ3_S 的品質是妥協不是免費。量化是把模型的權重精度降低來換取更小的體積。IQ3_S 大約是 3-bit 量化,模型「聰明程度」約為原版的 96%(社群實測)。對日常問答、寫 code 影響不大,但對數學證明、長邏輯推理還是會掉。

MoE 啟動成本高。第一次把模型載入 RAM 要 1-3 分鐘,期間整台電腦會卡。這是因為 24,576 個專家要從 SSD 載入記憶體重新組織,不是 bug 是設計。

「省 API 費」這帳要算仔細。一台能跑 Strata 的電腦最少要 RTX 3090(約台幣 25,000 二手)+ 64GB RAM+ 1TB NVMe SSD。光顯卡就超過 3 年 ChatGPT Plus 訂閱費。本地 LLM 的經濟優勢在「每天重度使用 + 隱私需求」的使用者才划算。


社群反應:硬核玩家社群狂喜

Hacker News 評論者:「這是真正的開源 AI 勝利。Qwen 出一個奇怪的 MoE 架構,然後社群一週內就做出能在 12GB 顯卡上跑的推論引擎。」

r/LocalLLaMA 實測者:「3 張改裝 RTX 2080 Ti 22GB(合計 66GB VRAM)跑出 66.6 tok/s decode、742 tok/s prefill,Strata 的 layer-split 真的太神了。」

簡中社群:「讓我的 9950X3D 64G + 4070S 12G 也能跑 Qwen3.8-Flash-Next 125B MoE IQ2_XS 量化版大概 60 tok/s。量化作者公布的三項測試,平均分數還有原版的約 96%。」

安全研究員 Simone Margaritelli(@evilsocket):在 X 上轉推 Strata 給他的 4 萬追蹤者,標註「本地 LLM 進入新時代」。

GitHub Trending:上線一週內衝到全語言前幾名、累積 11.7k+ Star、1k+ Fork、216 個 PR 等著合併。


接下來呢?

Strata 目前還不是 llama.cpp 的競爭者。Reddit 有人比較「標準 Qwen 3.8」跑在 llama.cpp 上 20 t/s,跑在 ninfer-3090 上 50 t/s,Strata 則在 40-60 t/s 之間——「比其他專用推論引擎慢一點,但社群會追上來」。開發者 Niko1221 已經放話要把 Strata 從「Qwen3.8-Flash-Next 專用引擎」擴展到其他 MoE 模型。Unsloth 也已經包好 GGUF 版本,搭配 llama.cpp 直接跑也可行。對台灣讀者的實際建議:

  • 有遊戲電腦(12GB+ 顯卡 + 32GB+ RAM):可以試 Coder 版玩本地 coding agent
  • 有 Mac Studio M2/M3 Ultra(192GB 統一記憶體):目前 MLX 版本還沒出,但等一下一定會有
  • 只有筆電:跑不起來,老實訂 ChatGPT Plus 或 Claude Pro
  • 想離線處理隱私資料(醫療、法律、財報):Strata 比 llama.cpp 對 MoE 更友善,是目前最成熟的選擇

一句話總結:Qwen 把模型做出來、Strata 把它帶進你家。本地 LLM 的硬體門檻,從「資料中心級」降到「遊戲玩家級」,這是 2026 年開源 AI 最重要的一次典範轉移。

網友熱門留言 (5)

#1 r/LocalLLaMA 測試者(9800X3D + RTX 4080S) ▲ 11
I tried it out last night. It definitely runs much faster (9800x3d, 64 GB DDR5 6000, RTX 4080S) e.g. 1000 t/s prefill and 40-60 t/s generation at q3_xss
#2 r/LocalLLaMA 用戶(5090 + 96GB DDR5) ▲ 89
Strata on a power limited 5090 and 96GB of DDR5-6400 is cranking out 150-200 tok/s decode and 5-6k prefill. Qwen3.8-Flash-Next at IQ3_S, CTX at ...
#3 Hacker News 評論者 ▲ 95
Strata generation: ~142 min total. So strata is a little slower, is very optimized for a Qwen 3.8. Standard Qwen 3.8 runs at 20 t/s, run at 40 to 60 t/s.
#4 r/LocalLLaMA 用戶(3 張改裝 RTX 2080 Ti 22GB) ▲ 142
3× modded RTX 2080 Ti 22 GB (66 GB VRAM total) runs Qwen3.8-Flash-Next 125B MoE (~6B active) at 66.6 tok/s decode / 742 tok/s prefill with Strata's layer-split
#5 @picaye(X 開發者) ▲ 230
Running Qwen3.8 Flash-Next Coder with 524k context at average 72 token/sec. Fully private on my old RTX 3090 with 128 RAM and a SSD. Wild.