Castform + Neon:4B 開源模型在檢索任務上追平 GPT-5.6 Sol,成本只有 1%
「大多數團隊最好的訓練資料其實就躺在自己的資料庫裡。問題在於把原始資料變成可用的東西很難,而讓 Agent 能便宜、大規模地讀取、搜尋、修改資料,則需要進階的基礎設施。把 Castform 對接 Neon 正好把這兩件事都跳過了。」
Neon(Lakebase Postgres 的開發公司)和 Castform(開源模型後訓練平台)近日發表技術案例研究,證明一個 40 億參數的開源模型,經過 Castform 以 Neon Lakebase Postgres 基礎設施進行 RL 後訓練後,能在檢索任務的準確率上追平 GPT-5.6 Sol,而每次推理的成本只有大約 1%。這個成果鎖定的具體場景是「代理式搜尋」(agentic search)——模型必須規劃並在一個迴圈中發出多次檢索查詢,而不是傳統的單次搜尋。
為什麼前沿模型在代理式搜尋上會崩盤
大約在 2022 年,整個產業全面押注 embedding 搜尋。每家資料庫廠商都加上一個向量索引,而 pgvector 也成為 Neon 下載量最高的擴充套件。工程師手刻 RAG pipeline——本質上就是一種 embedding 相似度搜尋。
到了 2025 年,Agent 開始流行。開發者開始建立多跳搜尋(multi-hop search)工作流程,把大問題拆解成小問題,而檢索也從單次搜尋轉變成代理式檢索:模型先規劃,再在迴圈中發出多次搜尋呼叫。每一次迴圈迭代都是對前沿模型的一次呼叫,成本和延遲也跟著倍數成長。
具體來說,一個典型的多輪搜尋請求使用 gpt-5.6-sol 需要超過 10 秒、整體花費約 0.03 美元——作者形容這個數字「慢到與貴到讓人卻步」。
與此同時,開源小型模型每次推理的成本大約便宜 100 倍。但開箱即用時,它們的能力仍落後於閉源 API 的前沿模型。RL 後訓練正好能補上這個落差;在搜尋這類特定任務上,後訓練過的開源模型可以追平甚至超越前沿模型,且每次請求的成本少了好幾個數量級。
這正是 Castform 想解決的問題:讓開發者可以 RL 後訓練模型,而不必自己處理機器學習和 GPU 內部細節。目標是把後訓練變得像 prompt 工程一樣平易近人。
兩塊拼圖:Neon 解決「上下文」,Castform 解決「模型」
一個「好的 Agent」需要在兩個面向都夠強:
- 上下文:能不能提供工具讓模型找到正確資料?
- 模型:模型能不能決定該搜尋什麼?
Neon(Lakebase Postgres)和它新的 Search 擴充套件負責第一塊;Castform 負責第二塊。
Castform 如何使用 Neon
Castform 的 pipeline 透過 Lakebase Search 跑在 Neon 之上。要有效執行 RL 後訓練,需要三個要素齊備:
- 一個任務(例如回答使用者的問題)
- Agent 執行的環境(例如對你的語料庫提供搜尋工具)
- 一個獎勵函數(例如答案是否正確)
三個都到位後,RL 後訓練就是一個試誤迴圈:模型用工具嘗試任務、獎勵函數給這次嘗試打分、回饋訊號引導模型往最優表現爬升。
訓練資料已經躺在你的資料庫裡
大多數公司手上並沒有乾淨的任務與獎勵函數資料集可以直接做後訓練。但企業確實擁有一大批專有資料:
- 內部文件
- 產品紀錄
- 支援文章
- 客戶互動紀錄
- 營運資料庫
這些資料確實含有 Agent 需要的知識,但要把它變成有效的訓練資料集,通常需要大量的資料工程和人工標註。
這讓很多團隊對後訓練卻步,原因不外乎兩種:
- 「我們沒有訓練資料。」
- 「微調太難,還需要我們沒有的基礎設施。」
Castform 同時解決了這兩個問題。它把現有的語料庫轉成訓練任務,再管理讓開源模型學會有效使用這些資料所需的 RL 迴圈。
把企業知識庫變成一個模型
有了 Castform,企業的知識庫可以被訓練成一個模型。Castform 先從既有文件生成問答配對,再讓開發者透過指定 Agent 可使用的工具和獎勵函數,把整個訓練過程「架起來」。
獎勵函數定義了模型應該擅長什麼。在公開的案例中,目標是檢索到正確的段落、引用到正確的來源,並給出正確的最終答案。
舉例來說,給定一則內部文件:「透過 Navan 預訂的火車班次將由 GitLab 差旅卡支付,車廂必須是標準艙等,且需提前 14 天預訂。」Castform 可以合成一道訓練題:「透過 Navan 預訂火車行程時,最晚需要提前幾天預訂,以及應該選擇哪個艙等?」
獎勵函數接著在三個面向給每次 rollout 評分:檢索(是否抓到正確來源)、引用(是否引用到正確段落)、正確性(是否落到正確答案)。
可觀察性:看著模型學習
Castform 提供完整的 RL 訓練可觀察性。開發者可以監看每一步的獎勵爬升曲線,更重要的是可以下鑽到個別任務和 prompt,觀察模型的質性表現。這讓訓練過程中可以除錯像是工具壞掉或獎勵駭客(reward hacking)等問題。
Neon 為什麼「剛好能用」於後訓練
訓練過程中,Agent 會反覆呼叫 Lakebase Search,直到累積足夠的上下文才回答。橫跨數千個平行 rollout,每個可能發出數十次呼叫,這會形成一個高度 bursty(突發性)的工作負載。
Neon 的動態運算擴展吸收了這些尖峰,不需要 Castform 全天候配置最大容量。訓練過程在需求爆發時取得低延遲搜尋,閒置時運算則會 scale down。
當 Agent 從「搜尋」延伸到「修改資料」,這套基礎設施的價值更大。訓練有狀態的(stateful)Agent 需要可以便宜地建立與重置的隔離環境,避免一次 rollout 的動作影響到另一次或碰到正式環境。
Neon 的 branching 功能可以給每次 rollout 一個隔離的資料庫狀態,而 time-travel 查詢則可以重現並檢查 Agent 當時碰到的狀態。搭配 autoscaling 與 scale-to-zero,這構成了一條可行的路徑:訓練數千個有狀態 Agent rollout,卻不需要同時維持數千個持續運行的環境。
為什麼這件事重要
這份案例研究的核心訊息不是「某家新創公司打敗了 GPT-5.6」,而是 RL 後訓練這條技術路線開始成熟到「連普通開發者都能用」。過去兩年,產業的預設動作是「所有事情都丟給最大、最通用的模型」,導致 Agent 類應用的 token 成本動輒每月數萬美元。
Castform 把「後訓練」從機器學習團隊的工作,變成 prompt 工程師也能上手的工作流程。Neon 提供便宜的儲存 + 運算分離基礎設施,讓數千次平行 rollout 變得經濟實惠。兩者結合起來的效果是:對一個特定任務的表現,可以跟前沿模型打平,且只需要 1% 的成本。
但也需要務實看待。第三方媒體 RuntimeWire 點出幾個重要的方法論限制:
- Castform 與 Neon 未公開該開源模型的具體名稱與 checkpoint,也未公布完整的評估語料庫、測試查詢數、評分方法論、跨次執行的變異數或信賴區間——這讓結果無法被獨立重現。
- 100 倍的成本比較沒有說明是否包含資料準備、合成範例生成、強化學習訓練、搜尋基礎設施與工程成本。
- 這是任務特定的勝利,不是全面替代 Sol 的證明。在 Neon 與 Castform 評估的檢索工作流之外,這個 4B 模型能不能追平 Sol 是未知數。
也就是說,這是一個有意義但有侷限的結果:對「在自己的資料上做高頻 agentic 搜尋」這個場景,它給出了一個經濟實惠的方案;但對一般性的代理任務,前沿模型仍是更穩的選擇。
數據解讀
- 40 億參數 vs 數千億參數的 GPT-5.6 Sol:在這個任務上,模型規模縮減約兩個數量級卻達到相同準確率——這是 RL 後訓練技術成熟的訊號。
- 每查詢 0.0003 美元 vs 0.03 美元:100 倍成本差距來自「多次呼叫 frontier 模型」的開銷被移除。對每月執行數百萬次檢索的應用,這個差距從年度數十萬美元降到數千美元。
- 10 秒以上 vs 推測個位數秒:GPT-5.6 Sol 在多輪搜尋迴圈中需要串接多次推理;一個專門為這個任務訓練的小模型,每次推理延遲可以壓到更低。
- 訓練成本 0.10 美元 / 百萬訓練 token(Castform 公布的 Qwen3.5 4B 訓練費率):不是 4B 模型訓練的真實總成本,但暗示這個數量級的小模型後訓練在數千美元等級即可完成,與訓練前沿模型的數千萬美元成本形成鮮明對比。
對台灣開發者的意義
對台灣的 AI 開發團隊,這份案例的具體意義在於:
- 不必再為每次 agentic 搜尋付 GPT-5.6 的帳單——開源 4B 模型在自己資料上後訓練,已經能在特定任務達到 frontier 等級表現。
- Postgres-as-a-service 在台灣接受度已經很高(Supabase、Neon、AWS RDS 都常見),Neon 提出的「運算儲存分離 + scale-to-zero」對台灣常見的「偶爾高流量、平日低用量」應用(例如內部工具、B2B SaaS)特別划算。
- RL 後訓練不再是 OpenAI、Anthropic 內部技術——Castform 把它變成自助式、依用量計價的服務,搭配 Neon 的 bursty 訓練基礎設施,數千美元等級就能完成過去要花數十萬美元的自訓練工作。
- 台灣本地化資料訓練變得可行——中文客服紀錄、內部知識庫、政府公開資料集都可以用同一套 pipeline 訓練成專屬模型,不必依賴境外 API。
編按:本文綜合整理自 Neon 官方技術 blog「How Castform + Neon Beats Frontier Models on Price and Efficiency」、RuntimeWire 獨立報導、Hacker News 討論串,並加入 Siami 編輯部觀點與分析。
網友熱門留言 (5)