編按:本文綜合整理自 IT之家 的 DeepSeek V4 Pro 正式版報導,並交叉比對新浪財經、Yahoo 股市、36 氪、DeepSeek 官方更新日誌、Hacker News 討論區及多位業界 KOL 的 X 推文,加入 Siami 編輯部觀點與分析。
DeepSeek 在 8 月 12 日深夜無預警出招,透過 API 文件悄然將 deepseek-v4-pro 切換到 DeepSeek-V4-Pro-0813,沒有發布正式產品公告,卻引發整個 AI 社群的高度關注。多家媒體引述官方群組流出的評測對比表指出,這次的正式版在多項 Agent 測試中逼近 Anthropic 的 Claude Fable 5,部分項目甚至反超,價格卻仍維持在 Fable 5 的 1/57 左右。
一、正式版的核心升級
這次 V4 Pro 正式版最大的改變,在於面向 Agent 場景的能力大幅提升。從官方 API 文檔可見,正式版仍維持 1M Token 上下文、最高 384K Token 輸出、JSON Output、Tool Calls、Responses API、Anthropic API 與 FIM 等功能。DeepSeek 也在 8 月 13 日同步更新了更新日誌,明確指出 deepseek-v4-pro 對應的版本已升級為 DeepSeek-V4-Pro-0813,呼叫方式不變。
對開發者而言,最重要的變化有三:
- 原生支援 Responses API — 這是 OpenAI 為 Agent 設計的核心介面,V4 Pro 正式版直接接入代表開發者可以用 OpenAI 標準介面呼叫 DeepSeek 模型而無需改寫程式。
- Codex 接入 — OpenAI 的 Codex CLI 與編碼 Agent 工具鏈可以選擇 DeepSeek V4 Pro 作為後端,無需部署自己的 GPU 叢集。
- Anthropic API 格式相容 — 從 Claude 程式碼遷移到 DeepSeek 的成本大幅降低。
至於訓練規格,V4 Pro 1.6T 總參數、約 49B 啟用參數的 MoE 架構並未改變,這次升級主要靠後訓練(Post-training)流程,把先前累積的工程最佳化轉化為實際任務執行能力。
從定價來看,V4 Pro 維持預覽版價格:每百萬 Token 輸入(快取未命中)3 元人民幣、輸出 6 元、快取命中 0.025 元。官方同時公告,未來計劃上調 DeepSeek API 服務的整體價格,預計漲幅較大
二、Agent 測試逼近 Fable 5
社群流出的官方評測對比表顯示,V4 Pro 0813 在多項 Agent 基準上有顯著進步:
- Terminal Bench 2.1 升至 87.9 分,距離 Fable 5 的 88.0 分僅差 0.1 分,並超越 Claude Opus 4.8
- DeepSWE 從 12.8 分躍升至 62.7 分,漲幅近 4 倍
- CyberGym 在安全/紅隊場景中反超 Fable 5
- AutomationBench 也高於 Opus 4.8
整體看,V4 Pro 0813 在七項 Agent 測試中全面領先自家 V4 Flash,性能梯度清晰:Fable 5(67.77)> Opus 4.8 ≈ Kimi K3 ≈ DeepSeek V4 Pro(60.73)> DeepSeek V4 Flash(55.11)> GLM-5.2(48.42)。
值得注意的是,DeepSeek 至今未在官方更新日誌公布 V4 Pro 0813 的完整基準測試成績,目前的分數主要來自官方群組與社群流傳,因此這些數字仍屬非正式披露。Yahoo 股市的多位分析師已指出,雖然社群聲量熱烈,但對所有「逼近 Fable 5」的說法都應保留態度,等後續第三方獨立測試驗證。
三、歷史定價:為什麼這件事重要
V4 Pro 0813 的真正意義,不只是「又一個國產大模型發布」。過去兩年,AI 競爭主要集中在兩個維度:模型能力與 API 價格。V4 Pro 0813 同時在這兩個維度上推進,而且推進幅度都很大:
- V4 Pro 輸出價格折合約 0.87 美元/百萬 Token,而 Claude Fable 5 的輸出定價為 50 美元/百萬 Token,前者僅約為後者的 1/57
- 對比 OpenAI GPT-5.4($15.00/M 輸出)、Claude Opus 4.8($25.00/M 輸出),V4 Pro 仍維持在極低水位
- 與同一天發布的 Grok 4.6($2/$6 定價,定位「其他前沿模型的一半」)形成正面對撞
券商研報中,申萬宏源、國聯證券、民生證券都點出 V4 Pro 的「性價比紅利」,認為將利好整個 AI 應用產業鏈。獨立 AI 分析師、前 Hugging Face 研究員 Tiezhen Wang 在 X 平台直言:「如果這是真的,而且 DS-V4-Pro 還是開源模型,那 Opus 甚至 Fable 都要『GG』了」。
四、🚨 為什麼這件事重要
從 2025 年的 R1 到 2026 年的 V4,DeepSeek 一直在做一件很類似的事情:不是追求「我要做一個比所有模型都強的 AI」,而是把前沿模型的能力往更低的成本區間裡壓。V4 Pro 0813 標誌著這個策略進入了第二階段:
第一階段(V4 Preview、V4 Flash)證明「開源模型可以逼近閉源旗艦」。V4 Pro 0813 證明「逼近旗艦的模型可以維持開發者付得起的價格」。這兩個跳躍加在一起,重新定義了前沿 AI 競爭的基準線。
更關鍵的是,V4 Pro 0813 打開了「開源稀疏 KV Cache」這條技術路線。得益於 V4 的稀疏 KV Cache,DeepSeek 有能力以只有 Fable 5 API 價格 1/50 的成本,提供與 Fable 同級別的模型,同時獲得遠高於 Anthropic 的快取命中率。最終的總成本甚至可能低 100 倍,而模型能力基本在同一水平。這對儲存產業是個利好,因為 SSD KV Cache 可能成為標準配置;對整個 AI 行業也是好消息 — AI 變得更便宜,會有更多人開始使用 AI,進一步加快需求增長。
橫向看,AI 競爭的主戰場正從單純比拼參數、聊天與基準測試能力,轉向智能體執行能力、Token 成本與開發者生態的全面較量。V4 Pro 0813 與 Grok 4.6 幾乎同日發布,分別壓低價格、衝擊前沿,將這場較量推到了新階段。
五、🚨 數據解讀 / 質疑
雖然官方群組流出的評測數字亮眼,但解讀時必須注意三個限制:
- 基準測試尚未由第三方獨立驗證 — DeepSeek 官方至今未在更新日誌公布 V4 Pro 0813 的完整基準成績,目前的分數主要來自官方群組與社群截圖,並非 DeepSeek 官方公開聲明
- 實際使用體驗與基準測試存在落差 — HN 用戶 @minraws 實測後表示,V4 Pro 0813 在 pass@3 上表現驚人地好(可匹配 Sol 或 Fable 的任務完成度),但 pass@1 非常糟糕、容易出錯,懷疑可能與 GRPO 訓練方法有關。這意味著在需要一次到位的生產場景中,V4 Pro 仍不如 Fable 5 穩定
- 缺少視覺輸入能力 — HN 用戶 @indigodaddy 直接表達失望:「看起來沒有視覺能力。本來還期待能支援圖片輸入的」。雖然早期報導稱模型已原生支援圖像推理,但截至發稿,DeepSeek 官方 API 文檔尚未列出圖像輸入的呼叫說明,該能力的全量開放節奏仍待確認
另一個值得關注的訊號是 DeepSeek 自己在價格頁面寫的聲明,稱未來將上調 DeepSeek API 服務的整體價格,預計漲幅較大。當前「能力升級、價格暫不變」未必能長期維持,HN 用戶 @damsta 已經在討論「漲價之後 API 會變多貴」。
六、開發者實測:程式碼任務的真實表現
相比基準分數,開發者社群的真實實測更能反映模型可用性。V2EX 與知乎的討論區裡,開發者普遍反映 V4 Pro 0813 在以下場景表現優異:
- 搭配 Claude Code 介面使用,1 億 Token 快取命中率達 99%,總花費不到 1 元人民幣
- 程式碼任務的一次完成率提升十多項 Bug,整體成本約 0.1 美元
- 主流 Agent 工具(Claude Code、OpenCode、CodeBuddy、OpenClaw)已適配最佳化
不過也有反向案例。一位 HN 用戶在 Codex CLI 中同時測試 V4 Pro 0813 與 Grok 4.6(同一個新功能開發任務):
- V4 Pro 0813:花 12 分 02 秒、成本 0.12 美元,出現 Bug
- Grok 4.6:花 3 分 18 秒、成本 1.41 美元,沒有出現 Bug
這個結果比「某個基準超過多少」更有意思,說明真實軟體開發中,模型能力並非一個簡單分數。當然,單次實驗不能給模型下定論,Agent 本身具有很強的隨機性,但這個案例提醒開發者:基準測試得分高,實際使用可能仍有差距。
七、接下來會發生什麼
V4 Pro 0813 的上線,最值得關注的後續發展有三:
- DeepSeek Harness 完整發布:8 月 13 日 DeepSeek 官方在 HN 同步上線 Developer Preview 的 Harness 框架,完整的開源版本尚未正式釋出,預期會在 1-2 週內公開
- 漲價時程:DeepSeek 已預告「整體 API 價格將有較大漲幅」,具體時間表與幅度仍待官方公告
- 華為昇騰 950 超節點支援:DeepSeek 計劃在 2026 年下半年將 Huawei Ascend 950 超節點引入推理叢集,以進一步降低成本,V4 Pro 的價格戰空間可能還沒結束
對開發者而言,現在是用 V4 Pro 0813 鎖定當前價格紅利的最佳窗口期。對整個 AI 行業而言,這次發布再次驗證了「前沿 AI 模型的差異正在縮小,價格與生態成為新的競爭武器」這個產業共識。
編按:本文綜合整理自 IT之家、新浪財經、Yahoo 股市、36 氪、DeepSeek 官方更新日誌、Hacker News 討論區、知乎與 V2EX 開發者討論區,並加入 Siami 編輯部觀點與分析。評測數據來源為社群流傳的官方評測對比表,DeepSeek 官方尚未在更新日誌公開完整基準成績。
網友熱門留言 (8)