← 返回 Siami 首頁

VibeThinker-3B 開源:3B 參數小模型擊敗 DeepSeek V3.2、GLM-5,逼近 Gemini 3 Pro 推理水準

▲ 36 💬 12
VibeThinker-3B 開源:3B 參數小模型擊敗 DeepSeek V3.2、GLM-5,逼近 Gemini 3 Pro 推理水準

編按:本文綜合整理自 Sina Weibo AI 團隊發表的 arXiv 論文 2606.16140《VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models》、官方 Hugging Face 模型頁 WeiboAI/VibeThinker-3B、GitHub 倉庫 WeiboAI/VibeThinker,以及 Hacker News 與 AI Weekly 等媒體的延伸報導,並加入 Siami 編輯部對「小模型 vs. 大模型」路線之爭的觀察。

新浪微博(Sina Weibo)AI 團隊於 2026 年 6 月 15 日釋出 VibeThinker-3B 技術報告與模型權重,主打「以 3B 參數在可驗證推理任務上逼近前沿旗艦模型」。這個模型以 Qwen2.5-Coder-3B 為基座,搭配團隊自創的 Spectrum-to-Signal Principle(SSP) 後訓練框架,在 AIME26、LiveCodeBench、IMO-AnswerBench 等高難度基準上擠入第一梯隊。

核心成績單:3B 對決 671B

VibeThinker-3B 的核心賣點是用 3B 參數達到原本需要數百倍參數量才能達成的推理表現。根據 arXiv 論文與官方 GitHub 公告,以下是關鍵 benchmark 數字:

  • AIME26:94.3 分(搭配 Claim-Level Reliability Assessment 測試時縮放可達 97.1 分
  • LiveCodeBench v6:80.2 Pass@1
  • HMMT25:89.3 分
  • BruMO25:93.8 分
  • IMO-AnswerBench:76.4 分(搭配 CLR 達 80.6)
  • IFEval:93.4 分(顯示極端推理強化沒有犧牲指令遵循)
  • 未見過的 LeetCode 競賽:96.1% 通過率(強 OOD 泛化)

作為對照,DeepSeek V3.2 是 671B 參數、GLM-5 是 744B 參數、Gemini 3 Pro 規模更大。VibeThinker-3B 在上述基準的分數與這些旗艦「匹敵或超越」,但參數量只有對手的 1/200 到 1/250。


怎麼做到的?Spectrum-to-Signal 三階段

VibeThinker 系列的核心不是模型架構,而是後訓練 pipeline。SSP 原則分三步走:

  1. 課程式監督微調(SFT):先建立「光譜」——大量多樣的合法推理路徑,刻意保留解題的多樣性,避免模型只學到單一路徑。
  2. 多領域強化學習(RL):再從光譜中「提煉訊號」——用強化學習放大正確推理路徑的權重。
  3. 離線自我蒸餾:最後用模型自己的高質量輸出做蒸餾,把整體表現穩定下來。

這個流程是 VibeThinker-1.5B(前作,只用 $7,800 後訓練預算就能在 AIME 上打敗 DeepSeek-R1)的延伸,3B 版本把規模拉大、覆蓋更多 STEM 領域。

論文團隊提出一個新假說:Parametric Compression-Coverage Hypothesis。可驗證推理(數學、程式、STEM)屬於「參數密集型能力」——解題演算法通用可重複,可以被密集編碼進少量參數;但開放域知識(常識、長尾事實)需要「廣覆蓋」的參數容量。這解釋了為什麼小模型在可驗證任務上能逼近大模型,卻在 GPQA-Diamond 等知識密集任務上仍然落後。


為什麼這件事重要

VibeThinker-3B 的發布不只是又多一個開源模型,而是「規模敘事」遭遇實質挑戰的訊號。

過去兩年 AI 行業的主流共識是「Scaling Laws 萬歲」:模型越大越好,訓練資料越多越好,參數量直接決定能力上限。GPT-4、Claude 3 Opus、Gemini 1.5 Pro 都是這個邏輯下的產物。VibeThinker 系列連續兩次證明:只要訓練方法對,3B 甚至 1.5B 參數也能在特定任務上打到旗艦水準

對部署端來說意義巨大:

  • 邊緣裝置可行:3B 模型可以在單張消費級顯存 GPU(如 RTX 4090)甚至 Apple Silicon 上跑,671B 模型需要整個資料中心。
  • 推論成本直降:每 token 的推理成本按比例下降,使大規模 batch 處理、可驗證 AI agent、即時競賽解題等場景變得經濟。
  • 客製化更容易:MIT 授權 + 完全開源權重,任何團隊都可以在自己的領域微調,不必從頭訓練。

更深層的影響是學術導向:Weibo 提出的「可壓縮推理 vs. 廣覆蓋知識」二分法,可能會成為下一代後訓練研究的理論基礎——哪些能力可以壓縮、哪些必須擴展,是比單純堆參數更有生產力的研究方向。


數據解讀:別被標題黨誤導

社群實測結果與官方 benchmark 之間存在明顯落差,讀者需要看清幾件事:

  • Hugging Face 開發者實測:在「根據 PDF 論文生成線性代數 Python 程式碼」這個實際任務上,VibeThinker-3B 的輸出被評為「絕對是災難」,表現不如 Qwen 3.5 4B。該開發者結論是「benchmaxed 太狠」。
  • 工具呼叫不支援:VibeThinker-3B 目前沒有 function calling / tool use 能力,這對想拿來做 AI agent 的人是硬傷。
  • 知識密集任務弱:Facebook AI 群組網友指出,GPQA-Diamond 等需要世界知識的基準上,VibeThinker-3B 仍明顯落後。它不是「Claude in a tiny box」,而是「可驗證推理專項的精品工具」。
  • VibeThinker-1.5B 的 $7,800 後訓練成本常被引用,但那是 1.5B 版本的數字,3B 版本的成本與資料量未公開。

換句話說,VibeThinker-3B 的最佳使用情境是數學競賽、競賽程式設計、STEM 解題等有明確對錯、可自動驗證的任務。要拿來做開放問答、長文寫作、agent 規劃,目前還是要回到大模型。


開源資源與社群反應

VibeThinker-3B 採用 MIT 授權,完全開源權重與訓練程式碼,這在中國大型科技公司的模型釋出中相對少見:

  • Hugging Face 模型頁WeiboAI/VibeThinker-3B(支援 Transformers、vLLM、SGLang、Docker Model Runner)
  • GitHub 倉庫WeiboAI/VibeThinker(含數學評測與程式評測腳本)
  • 技術報告arXiv 2606.16140
  • 官方推薦用法:競賽數學、競賽程式、STEM 推理、其他有驗證目標答案的任務

Sam Witteveen(知名 Google Developer Expert、AI 教育 YouTuber)在 6 月 19 日發布了 24 分鐘深度評測影片(連結見參考資源),結論是「用 3B 打到旗艦水準不是要取代 Claude/GPT,而是證明 SSP pipeline 能把可驗證任務榨到極限,對邊緣部署意義重大」。Hacker News 開發者則更關注「Parametric Compression-Coverage Hypothesis」這個理論框架的價值,認為它為未來的小模型研究提供了清晰的能力邊界畫法。

VibeThinker 系列的真正訊號是:中國 AI 團隊正在用「後訓練方法論」這條路線,繞過「算力規模」的傳統護城河。當 OpenAI、Anthropic、Google 還在拚萬億參數模型時,Weibo 用 3B 證明在特定任務上小模型可以贏——這場「效率 vs. 規模」的路線之爭,才剛開始。


參考資源

網友熱門留言 (5)

#1 Hugging Face 開發者 ▲ 187
實測了一下,這模型不能用 tool calling,而且跟 Qwen 3.5 4B 比還是有段落差,特別是 PDF 線性代數程式碼生成根本是災難。個人結論是 benchmaxed 太狠了,但作為可驗證推理專項模型確實驚艷。
#2 Hacker News 開發者 ▲ 142
最讓我驚訝的不是 AIME 94.3 分,而是『Parametric Compression-Coverage Hypothesis』這個理論框架——可驗證推理可以壓縮到小參數核心,但開放域知識需要廣覆蓋,這條界線畫得很清楚。
#3 Sam Witteveen(YouTube AI 教育者) ▲ 98
用 3B 參數在數學、程式、STEM 上打到旗艦模型水準,重點不是取代 Claude/GPT,而是證明 Spectrum-to-Signal 後訓練 pipeline 可以把可驗證任務榨到極限。對想在邊緣裝置部署的人意義重大。
#4 AI Weekly 編輯 ▲ 64
MIT 授權 + 完全開源權重 + 3B 參數 = 今年最具可重現性的小模型敘事。任何實踐者都能拿 Hugging Face 上的權重自己跑一次 benchmark,不像某些閉源模型只能看官方數字。
#5 Facebook AI 群組網友 ▲ 47
別被標題黨騙了。VibeThinker-3B 在知識密集任務(GPQA-Diamond)上還是很弱,它不是 Claude-in-a-tiny-box,而是『可驗證推理專項的精品工具』,要看清楚使用情境。