編按:本文綜合整理自 IT 之家、VentureBeat、DeepSeek 官方 API 文檔 與 Hacker News 討論串,並加入 Siami 編輯部觀點與分析。
事件:DeepSeek V4 Pro 正式版與 Harness 同步上線
8 月 14 日晚間,中國「國家超算互聯網」宣布正式上線 DeepSeek V4 Pro 正式版(內部版本號 DeepSeek-V4-Pro-0813),以及同日釋出的開源 Agent 框架 DeepSeek Harness v0.1。這是 DeepSeek 自 2026 年 4 月發表 V4-Pro 預覽版後,首次把模型推上 GA(General Availability),同時把 Agent 執行層以 MIT 協議開源釋出。
官方定位是「全國首個十萬卡級超智融合算力資源池」,可為科研機構、科創企業與獨立開發者提供從訓練、微調、評測到部署的完整生命週期算力支撐,並支援 DeepSeek 系列模型/源碼下載、私有化部署、分散式推理與 Agent 二次開發。
規格與效能:MoE 1.6T 參數、1M context、強化 Agent
根據 DeepSeek 官方 API 文檔與 OpenRouter 頁面,DeepSeek-V4-Pro-0813 採用 Mixture-of-Experts 架構,總參數量 1.6 兆,每次推論啟動 49B 參數,並把上下文窗口拉長到 1M token。官方稱這次升級重點是「在生產環境中的 Agent 能力顯著強化」,整體效能可與 Claude Fable 5、Opus-4.8 等海外閉源模型相媲美。
DeepSeek 自行公布的 Agent 基準成績包括:
- Terminal Bench 2.1:87.9(Fable 5 為 88.0,Opus-4.8 為 85.0)
- SWE-bench Verified:80.6%
- DeepSWE:從預覽版的 12.8 躍升至 62.7(網易文章版本為 54.4,數字差異可能來自不同 harness 設定)
- Toolathlon-Verified:74.1
- DSBench-FullStack:71.1、DSBench-Hard:67.2
V4-Pro 同時原生支援 OpenAI Responses API 格式,並針對 Codex 整合做專項適配,開發者可在 api-docs.deepseek.com 一鍵切換設定腳本。對已在 OpenAI 生態上開發的應用,等於把遷移成本壓到「改 base_url 跟 model 名稱」。
DeepSeek Harness:「一切皆插件」的 Agent 執行層
同日釋出的 DeepSeek Harness(命令列簡稱 dsh)是這次發布的另一個主角。它以 MIT 協議在 GitHub 公開,內建 Cordis 插件核心,主打「Everything is a Plugin」的設計哲學 —— 模型、工具、技能、會話、沙盒、檔案系統、迴圈、排程、甚至 UI 本身,全部都是可替換的插件。
Harness 提供四種運行模式:
- 標準模式:通用 Agent 編碼工作流
- PTC 模式:為大型代碼庫優化
- 極簡模式:最小依賴、低資源情境
- 創造模式:探索性、發散性任務
開發者可在「國家超算互聯網 AI 社區」一鍵拉取完整工程檔案,編譯、調試、二次迭代後部署到自有環境。發布當日 GitHub 已累積約 27,500 stars、2,000 forks,後續衝到 64k+ stars、72k stars(不同時點擷取)。
對企業 IT 來說,Harness 的「插件可換」架構意味著可以把內部既有工具鏈直接掛上去,不必整個重寫 Agent 邏輯 —— 這也是它被外媒 VentureBeat 形容為「Claude Code 開源對手」的核心賣點。
🚨 為什麼這件事重要
這次上線的本質不只是「又一個新模型 GA」,而是中國國產算力 + 開源 Agent 框架 + OpenAI 相容 API 三件事綁在一起同時推出,背後有三層意義:
第一,繞過美國晶片管制的國產算力敘事成型。 「國家超算互聯網」是中國第一個十萬卡級異構算力池,這次把 DeepSeek-V4-Pro 整套模型與 Harness 源碼打包上架,等於宣告「不用輝達 H100/A100,也能跑世界級大模型」的工程閉環。對中國 AI 自主可控政策而言,這是一個具體可交付的樣板。
第二,DeepSeek 從模型公司升級成平台公司。 之前 DeepSeek 的對標是 Anthropic、OpenAI 等模型供應商;這次 Harness 開源後,它的競爭對手變成 LangChain、CrewAI、Claude Code SDK 等 Agent 框架廠商。VentureBeat 觀察:「這是 DeepSeek 從純粹的模型供應商,往『模型 + 平台』組合推進的明顯訊號。」
第三,把 OpenAI Responses API 變成事實標準。 透過原生支援 Responses API + Codex 適配,DeepSeek 在開發者體驗上幾乎消除了「用 Claude Code 還是 OpenAI Codex」的切換摩擦。對全球企業的 AI 採購決策者來說,這代表「OpenAI 相容性」正在從單純介面格式,升級成一種跨廠商的可移植性資產。
🚨 數據解讀與質疑
1. Benchmark 是模型分數,還是「模型 + Harness」分數? VentureBeat 與多位開發者都點出,DeepSeek 自家公布的 Agent 基準(如 DeepSWE、Toolathlon、DSBench)跑在「Harness minimal mode」上 —— 也就是說,這些成績其實是「V4-Pro-0813 加上 DeepSeek Harness」聯手測出來的,不純粹是模型本體。這跟早期 LLM 競爭中,純模型 benchmark 容易被後續工具層放大,是同一個老問題。
2. 價格即將上漲。 byteiota 報導指出,DeepSeek 在 8 月 6 日已預告「顯著」的 API 漲價,時程與幅度未定。對企業預算決策者而言,這意味著現在 GA 的 V4-Pro 短期內可能比 preview 版貴不少,需要重新核算單位成本。
3. 第三方獨立驗證仍缺。 87.9 vs 88.0 vs 85.0 這些差 0.1 點的數字,目前沒有 Artificial Analysis、HELM、lmsys 等獨立評測機構覆核。社群上已有開發者回報:「同樣 prompt 給 Claude Code、Pi、OpenCode 三種 harness 跑 V4-Pro,結果差很多」—— 這提醒我們,benchmark 表上的「與 Fable 5 持平」不等於「在你的工作流上跟 Fable 5 一樣好用」。
4. 沒有 vision(多模態圖像理解)。 HN 上有開發者明確失望:「No vision looks like. Was hoping…」V4-Pro-0813 仍是純文字模型,要做圖像相關 Agent 流程仍需外接視覺模型。
後續觀察重點
- 國家超算互聯網算力配額:十萬卡級池實際釋出給開發者的算力配額、API rate limit、商業價格,是企業能否真正導入的關鍵
- Harness 從 v0.1 走向 1.0 的時程:MIT 開源後的社群貢獻速度、breaking change 頻率,會決定它能不能成為「中國版 Claude Code」
- DeepSeek 與超算互聯網的商業分工:模型迭代與算力營運兩條業務線如何切割,影響未來開源協議是否轉換
- Fable 5、Opus 4.8 與 GPT 後續版本的回應:當對標對手仍是 Anthropic/OpenAI 時,DeepSeek 在 agentic workflow 上的實際差距,要等獨立 benchmark 才能論斷
參考來源
- IT 之家原文:DeepSeek V4 Pro 正式版、Harness 上線國家超算互聯網
- VentureBeat:DeepSeek Harness launches as open source rival to Claude Code
- DeepSeek API 更新日誌(官方 benchmark 表)
- OpenRouter DeepSeek V4 Pro 定價與規格頁
- DeepSeek API:Responses API 使用指南
- Hacker News 討論串:DeepSeek-V4-Pro-0813 Publish
- byteiota:DeepSeek V4 Pro 0813 Is Live — And Prices Are About to Jump
- DigitalApplied:DeepSeek Open-Sources Harness: Everything Is a Plugin
網友熱門留言 (5)