← 返回 Siami 首頁

Cactus Needle 3:8 到 29 MB 小模型,正面對決 DeepSeek V4 Flash

▲ 140 💬 69
Cactus Needle 3:8 到 29 MB 小模型,正面對決 DeepSeek V4 Flash

編按:本文綜合整理自 Cactus Compute 官方部落格GitHub 開源 repoHugging Face 模型頁Hacker News 討論串Reddit r/LocalLLaMA,並加入 Siami 編輯部觀點與分析。

YC S25 新創 Cactus Compute 昨天(9 月 17 日)正式開源 Needle 3——一個只有 8 到 29 MB 的單檔二進位小模型,宣稱在手機 tool-calling 場景下能「打敗比它大 10 倍的模型」,並在文字抽取任務上「逼近比它大 2 到 3 倍的同類」。這個 size 區間,已經小到可以直接塞進 Raspberry Pi 5、智慧手錶,甚至掃地機器人。


模型是什麼:把「自動化」切成一個極窄任務

Needle 3 不是一個通用聊天模型。Cactus 把它定位為 automation foundation model——只負責三件事:

  1. Tool calls:給定 App 暴露的函式清單,模型從自然語言挑出對的工具、填好參數
  2. Extraction:給一段亂七八糟的文字,配合 Pydantic schema,回傳型別化欄位
  3. Routing / search:把句子編碼成向量,本地做相似度搜尋、訊息分類、警報去重

放棄「什麼都能聊」的能力,換取在自動化管線上的頂尖表現。官方把它叫做 trade general chat capacity for frontier performance on automation

架構上是自研的 Simple Attention Network(SAN),搭配 engram fusion 雜湊 2-gram 與 3-gram 記憶機制。最重要的設計是 intelligence laddering:每一層都是容量遞增的子網路,開發者可以從 2 層(2L)切到 20 層(20L),同一個二進位檔就涵蓋整條容量曲線。

「Trade general capacity for frontier performance on automation」是 Cactus 創辦人 Henry Ndubuaku 對 Needle 3 哲學的一句話濃縮。


跑多快:Raspberry Pi 5 上 4000 token/s

Cactus 釋出的 benchmark 數字相當激進:

裝置DecodePrefill
Raspberry Pi 5400–4,000 tok/s1,000–10,000 tok/s
旗艦 Android4,000+ tok/s10,000+ tok/s

更關鍵的是 4L 子網路只要對下游任務 fine-tune 一個 epoch,就能追上 DeepSeek V4 Flash。這句話是 Cactus 自己寫的 baseline 對照——baseline 用 f16 透過 vLLM 跑,DeepSeek V4 Flash 走它的雲端 API。

二進位檔大小對照:

子網路二進位檔大小
2L8 MB
4L11 MB
8L16 MB
20L29 MB

29 MB 全檔下載加啟動不到一秒,意思是可以當 App 內建資產出貨,連雲端都不用碰。


公司背景:YC S25、26M 參數的老前輩

Cactus Compute 是 Y Combinator 2025 年夏季 batch 的新創(YC 頁面),創辦人 Henry Ndubuaku 在 2024 年做過 Deep Render 的 AI 研究工程師。

Needle 3 不是從零開始。第一代 Needle 是 2025 年 5 月開源的 26M 參數蒸餾模型,當時從 Gemini Flash 蒸餾而來,主打 function calling,6000 tok/s prefill + 1200 tok/s decode。

兩個月後(今年 7 月)的 Needle 2 把參數縮到 14 MB,可以「完整控制一支手機」,引發一輪媒體報導。Needle 3 是這個路線的第三棒,把 size 控制在 8–29 MB 但功能更完整,加入 intelligence laddering 讓開發者自己選容量。


為什麼這件事重要

Needle 3 的意義不在於它「比 DeepSeek 強」,而是它把「部署成本」拉到了一個新的極端:

  • 資料不離機:醫療、工業、軍用場景需要完全本機推論,雲端 API 即使便宜也不合規
  • 冷啟動零成本:29 MB 二進位檔可以塞進 App、韌體、microSD 卡,沒有 GPU 需求
  • 能源效率:在 Raspberry Pi 5 上跑整天可能比一次雲端 API call 還省電
  • B2B 利基市場:智慧家居、掃地機器人、車機、AR/VR 眼鏡——這些裝置算力有限但需要 NLU

Cactus 的商業模式很清晰:開源底層模型,靠 Cactus SDK(跨平台推論引擎)收企業客戶錢。GMI Research、Antigravity Capital 都在他們的投資人名單上。

更深一層,「小模型打大模型」這個趨勢從去年蒸餾風潮到今年 Apple Intelligence、Phi-4-mini、FunctionGemma,方向已經很清楚:通用 chat 仍然是大模型的天下,但窄任務的 SOTA 正在快速被小模型接管。Needle 3 是這條曲線上的一個明確 milestone——它把 tool-calling 這個任務的 SOTA,從 270M 等級直接壓到 8 MB。


數據解讀 / 質疑

讀者要對幾個數字保持警覺:

  1. 「打敗 10x size」是 Cactus 自己選的 baseline。他們挑的是 FunctionGemma-270M、Qwen-0.6B、Granite-350M、LFM 2.5-350M——都是對小模型優化過的同類,不是直接對 1B+ 通用 LLM

  2. 「match DeepSeek V4 Flash」需要 fine-tune。原始 4L 模型不能直接 match,要 downstream fine-tune 一個 epoch 才能逼近。但 DeepSeek V4 Flash 是 API 服務、不是可下載權重,這個對比的「可重現性」是個問號。

  3. HN 上的實測結果不一致。多位測試者回報:「暖屋」變成「暖色亮度」、「more light」沒反應、「I need a wee」誤觸發音樂播放。模型對字面語意(literal meaning)過於敏感,對意圖(intent)的理解還是有縫隙。

  4. 29 MB 是 CQ2-bit 量化。訓練是正常精度,但部署時量化到 2-bit。對於需要精確抽取數字、ID 的場景,這個量化位元數可能會有 edge case。

  5. 「打敗 2-3x 模型」是 extraction 任務。tool-calling 與 extraction 是 Cactus 已經選定的、對小模型有利的工作負載。這不是「小模型已經可以取代 Claude」的意思,是「在這些任務上,你可以省下 95% 的部署成本」

編按:本文綜合整理自 Cactus Compute 官方部落格GitHub 開源 repoHugging Face 模型頁Hacker News 討論串Reddit r/LocalLLaMA,並加入 Siami 編輯部觀點與分析。

網友熱門留言 (5)

#1 IanCal(Hacker News) ▲ 8
試了一些指令,「I need a wee」居然觸發播放音樂,「I need a wee wee」變成啟動浴室吸塵器,「I'm going to the toilet」則說它會打開馬桶。模型顯然對字面意義太敏感了。
#2 hirako2000(Hacker News) ▲ 7
越來越多「小模型打敗大型 LLM」的可疑聲明,反而讓真正有用的創新被忽略。重點應該說清楚這個模型「不能做什麼」——也就是反例用例,這樣我才不用自己試錯。
#3 Retro_Dev(Hacker News) ▲ 6
很酷的專案,但不完美。我寧可要 30MB 的「精確對應指令 → 控制動作」查表,也不想要 30MB 的啟發式猜測。我試著「暖屋」(升溫),結果模型把燈調成「暖色亮度」。
#4 Scaevolus(Hacker News) ▲ 5
跟 Needle 2 比起來有顯著進步,我之前用它做 Runescape 資料庫的 tool-calling 介面,但還是不夠好。比 FunctionGemma 還差一截——它仍然是 270M 參數量級的對手。
#5 Tsarp(Hacker News) ▲ 4
撇開虛構的 use case,真實應用是什麼?開源模型對通用任務的 API 報價已經低得離譜。對隱私重視的人來說,跑一個 8-27B 在本地網路就好。也許有工業或農業場景?