編按:本文綜合整理自 Cactus Compute 官方部落格、GitHub 開源 repo、Hugging Face 模型頁、Hacker News 討論串 及 Reddit r/LocalLLaMA,並加入 Siami 編輯部觀點與分析。
YC S25 新創 Cactus Compute 昨天(9 月 17 日)正式開源 Needle 3——一個只有 8 到 29 MB 的單檔二進位小模型,宣稱在手機 tool-calling 場景下能「打敗比它大 10 倍的模型」,並在文字抽取任務上「逼近比它大 2 到 3 倍的同類」。這個 size 區間,已經小到可以直接塞進 Raspberry Pi 5、智慧手錶,甚至掃地機器人。
模型是什麼:把「自動化」切成一個極窄任務
Needle 3 不是一個通用聊天模型。Cactus 把它定位為 automation foundation model——只負責三件事:
- Tool calls:給定 App 暴露的函式清單,模型從自然語言挑出對的工具、填好參數
- Extraction:給一段亂七八糟的文字,配合 Pydantic schema,回傳型別化欄位
- Routing / search:把句子編碼成向量,本地做相似度搜尋、訊息分類、警報去重
放棄「什麼都能聊」的能力,換取在自動化管線上的頂尖表現。官方把它叫做 trade general chat capacity for frontier performance on automation。
架構上是自研的 Simple Attention Network(SAN),搭配 engram fusion 雜湊 2-gram 與 3-gram 記憶機制。最重要的設計是 intelligence laddering:每一層都是容量遞增的子網路,開發者可以從 2 層(2L)切到 20 層(20L),同一個二進位檔就涵蓋整條容量曲線。
「Trade general capacity for frontier performance on automation」是 Cactus 創辦人 Henry Ndubuaku 對 Needle 3 哲學的一句話濃縮。
跑多快:Raspberry Pi 5 上 4000 token/s
Cactus 釋出的 benchmark 數字相當激進:
| 裝置 | Decode | Prefill |
|---|---|---|
| Raspberry Pi 5 | 400–4,000 tok/s | 1,000–10,000 tok/s |
| 旗艦 Android | 4,000+ tok/s | 10,000+ tok/s |
更關鍵的是 4L 子網路只要對下游任務 fine-tune 一個 epoch,就能追上 DeepSeek V4 Flash。這句話是 Cactus 自己寫的 baseline 對照——baseline 用 f16 透過 vLLM 跑,DeepSeek V4 Flash 走它的雲端 API。
二進位檔大小對照:
| 子網路 | 二進位檔大小 |
|---|---|
| 2L | 8 MB |
| 4L | 11 MB |
| 8L | 16 MB |
| 20L | 29 MB |
29 MB 全檔下載加啟動不到一秒,意思是可以當 App 內建資產出貨,連雲端都不用碰。
公司背景:YC S25、26M 參數的老前輩
Cactus Compute 是 Y Combinator 2025 年夏季 batch 的新創(YC 頁面),創辦人 Henry Ndubuaku 在 2024 年做過 Deep Render 的 AI 研究工程師。
Needle 3 不是從零開始。第一代 Needle 是 2025 年 5 月開源的 26M 參數蒸餾模型,當時從 Gemini Flash 蒸餾而來,主打 function calling,6000 tok/s prefill + 1200 tok/s decode。
兩個月後(今年 7 月)的 Needle 2 把參數縮到 14 MB,可以「完整控制一支手機」,引發一輪媒體報導。Needle 3 是這個路線的第三棒,把 size 控制在 8–29 MB 但功能更完整,加入 intelligence laddering 讓開發者自己選容量。
為什麼這件事重要
Needle 3 的意義不在於它「比 DeepSeek 強」,而是它把「部署成本」拉到了一個新的極端:
- 資料不離機:醫療、工業、軍用場景需要完全本機推論,雲端 API 即使便宜也不合規
- 冷啟動零成本:29 MB 二進位檔可以塞進 App、韌體、microSD 卡,沒有 GPU 需求
- 能源效率:在 Raspberry Pi 5 上跑整天可能比一次雲端 API call 還省電
- B2B 利基市場:智慧家居、掃地機器人、車機、AR/VR 眼鏡——這些裝置算力有限但需要 NLU
Cactus 的商業模式很清晰:開源底層模型,靠 Cactus SDK(跨平台推論引擎)收企業客戶錢。GMI Research、Antigravity Capital 都在他們的投資人名單上。
更深一層,「小模型打大模型」這個趨勢從去年蒸餾風潮到今年 Apple Intelligence、Phi-4-mini、FunctionGemma,方向已經很清楚:通用 chat 仍然是大模型的天下,但窄任務的 SOTA 正在快速被小模型接管。Needle 3 是這條曲線上的一個明確 milestone——它把 tool-calling 這個任務的 SOTA,從 270M 等級直接壓到 8 MB。
數據解讀 / 質疑
讀者要對幾個數字保持警覺:
-
「打敗 10x size」是 Cactus 自己選的 baseline。他們挑的是 FunctionGemma-270M、Qwen-0.6B、Granite-350M、LFM 2.5-350M——都是對小模型優化過的同類,不是直接對 1B+ 通用 LLM。
-
「match DeepSeek V4 Flash」需要 fine-tune。原始 4L 模型不能直接 match,要 downstream fine-tune 一個 epoch 才能逼近。但 DeepSeek V4 Flash 是 API 服務、不是可下載權重,這個對比的「可重現性」是個問號。
-
HN 上的實測結果不一致。多位測試者回報:「暖屋」變成「暖色亮度」、「more light」沒反應、「I need a wee」誤觸發音樂播放。模型對字面語意(literal meaning)過於敏感,對意圖(intent)的理解還是有縫隙。
-
29 MB 是 CQ2-bit 量化。訓練是正常精度,但部署時量化到 2-bit。對於需要精確抽取數字、ID 的場景,這個量化位元數可能會有 edge case。
-
「打敗 2-3x 模型」是 extraction 任務。tool-calling 與 extraction 是 Cactus 已經選定的、對小模型有利的工作負載。這不是「小模型已經可以取代 Claude」的意思,是「在這些任務上,你可以省下 95% 的部署成本」。
編按:本文綜合整理自 Cactus Compute 官方部落格、GitHub 開源 repo、Hugging Face 模型頁、Hacker News 討論串 及 Reddit r/LocalLLaMA,並加入 Siami 編輯部觀點與分析。
網友熱門留言 (5)