← 返回 Siami 首頁

DeepSeek Harness 開發者預覽版上線:開源 agent 框架主打「一切皆插件」架構

▲ 510 💬 230
DeepSeek Harness 開發者預覽版上線:開源 agent 框架主打「一切皆插件」架構

編按:本文綜合整理自 DeepSeek Harness 官方頁、GitHub repo、架構文檔 與 Hacker News 討論串,並加入 Siami 編輯部觀點與分析。

DeepSeek 在 2026 年 8 月 13 日正式開源自家的 agent 框架 DeepSeek Harness(指令簡稱 dsh),並以 MIT 授權釋出完整原始碼。這個專案上線 24 小時內在 GitHub 累計超過 24,000 顆 star,是該公司繼 V4-Pro 模型發表之後的下一個戰略級動作——把「agent 怎麼跑」這一層從閉源黑盒子變成可重組的開源樂高。

什麼是 DeepSeek Harness

DeepSeek Harness 不是另一個「Coding Agent」,而是 agent 跑起來所需的整層 runtime——負責掛載模型、串接工具、記錄 session、執行 loop、排程子任務、管理 sandbox 與 UI。官方定位是「讓任何模型都能在任何環境下持續工作」的底座。

整個框架的設計哲學濃縮成一句口號:「Everything is a plugin. Every run is traceable」。前者意味著從模型適配器、工具註冊表、session log、agent loop、sandbox 到 UI 元件,每一個元件都是可替換的插件;後者意味著模型看到的每一段 prompt、推理、tool call、結果、子 agent 排程、context injection 全部寫進 append-only log,支援 resume / fork / search / replay。

執行入口非常輕量:

# 用 npx 直接跑
npx @deepseek-ai/dsh web

# 或從 source
git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness
pnpm install && pnpm run build && pnpm dsh web

Web UI 預設在 http://127.0.0.1:3080。

一切皆插件:Cordis 驅動的 plugin tree

Harness 的底層依賴一個叫 Cordis 的開源框架(由 Cordiverse 維護),設計概念發表於論文 A Programming Paradigm for Spatiotemporal Composability。Cordis 的核心抽象是「插件向共享上下文貢獻服務、型別化事件與可逆副作用」,每一個註冊都是 effect,會在插件卸載時自動撤銷。

沒有需要 patch 的特權核心:擴展 dsh 的方式是掛載一個新插件到既有插件旁邊,而不是 fork 主程式。

啟動時,Harness 會按以下順序組裝一棵 plugin tree:

  • 各個 bundle(dsh-base 是基底,含模型適配器、工具、持久化、沙箱與審批策略、憑證、遙測;dsh-web-app 加瀏覽器;dsh-headless 加一次性執行器)。
  • profile 級的 cordis.patch.yml(patch 對應 row id 替換整段 config)。
  • home 級 patch。
  • --patch overlay(CLI 傳入)。

跑 dsh --profile web --dump-config 可以印出實際啟動的 plugin tree,任何一行都可以被自己寫的 patch 替換。這個「可重組」特性讓企業可以在不動 DeepSeek 原始碼的前提下,把模型適配器從 DeepSeek V4 換成 Claude、把 sandbox 從本機換成雲端、或把檔案系統從直接 I/O 換成受審批策略管控的版本。


四種 Runtime Mode 對應四種使用情境

DeepSeek Harness 並不預設「一個 size fits all」的工作模式,而是切成四種 runtime mode,可由 profile 切換:

  • Standard mode — 全套工具組:file editing、shell、file/web search、skills、planning、goals、subagents、workflows。這是終端使用者最常用的一般編碼代理模式。
  • Code mode — Standard 全部能力,加上 Code Mode SDK:模型可以生成一段 TypeScript 程式,在裡面組合多步操作成單次呼叫。對長流程、批次處理很有用。
  • Minimal mode — 只留 shell + str_replace_editor 兩個工具。這正是 DeepSeek-V4-Flash 在 SWE-bench / Terminal-Bench 上跑分用的模式,目的是把環境變數壓到最低,純粹量測模型能力。
  • Creator mode — 給想做「自訂 agent preset」的人:保留 Standard 全部能力,加上 runtime introspection、plugin 實驗、preset 編寫輔助,等於是把 dsh 自己當 IDE 來 debug。

Siami 觀察:Minimal mode 的存在本身就是 DeepSeek 對「公平 benchmark」的政治聲明——其他閉源 agent framework(Claude Code、Codex CLI)沒辦法被研究者獨立重現,因為 tool set 跟 prompt assembly 都是不透明的。Minimal mode 只用兩個工具的極簡設定,讓任何人都能重現 V4-Flash 的分數。


「Every run is traceable」是這次最被低估的差異化

官方架構文檔把 session log 講得很清楚:

Model-visible means logged. Anything that reaches a model request must be reconstructable from the log, and a runtime invariant asserts it. This is why a new model-visible input requires a new session event: extend SessionEventMap and render from the log.

簡單說:模型看到的任何東西,都必須能從 log 重組出來。這帶來三個好處:

  1. Replay & Fork:可以從 session 中任意一個斷點 fork 出一條新分支,不會破壞既有紀錄。
  2. 可審計:法遵、紅隊測試、prompt 迭代都需要這個能力。
  3. 可離線分析:把整個 session export 後做 fine-tuning、蒸餾、trace 分析都沒問題。

這也正是 HN 討論串被推爆的原因——美國模型(OpenAI、Anthropic、Google)對 traces 多半加密或混淆,要繞過 ToS 才能萃取。SwellJoe 的高分留言直接點名:「如果想改進跟模型協作的工具,就必須能看到模型怎麼思考和處理資料。DeepSeek 的可追溯 trace 在這一塊無人能及。」

為什麼這件事重要

DeepSeek 選在 V4-Pro 發表隔天開源 Harness,時機不是巧合。Agent 層正在變成新一輪商業戰場——Claude Code、Codex CLI、Gemini CLI 都把「coding agent」當作護城河,因為模型本身越來越商品化、毛利下滑。但這些框架都是閉源的:Anthropic 不開源 Claude Code 的 loop 邏輯、OpenAI 不開源 Codex 的 prompt assembly、Google 不開源 Gemini CLI 的 tool registry。

DeepSeek 用三招同時打破這個格局:

  • MIT 授權——任何公司都能 fork、自架、合規審查,不用等 DeepSeek 開 API。
  • Plugin 一切化——把「換模型」「換 sandbox」「換工具」這些企業最在意的客製化變成純配置,不必 fork 主程式。
  • Append-only log——把整個 agent 行為變成可審計、可 replay 的事件流,這對金融、醫療、政府場景是入場券。

對獨立開發者來說,Harness 的競爭對手不是 Claude Code 或 Codex——而是 pi.dev、opencode、Aider 這些開源 coding agent。差別在於 Harness 的野心更大:它想做「agent OS」,而不是「某一種 agent」。

對 Anthropic 跟 OpenAI 來說,Harness 的開源 + Cordis 的可重組特性,會讓企業客戶開始問:「為什麼我不能在自己的環境裡跑 Claude Code、但又能 trace + audit?」這壓力會逼兩家重新思考 CLI 工具的封裝策略。


數據解讀與質疑

GitHub 數據(截至 2026-08-13 22:30 UTC):

  • Stars:38,931(README 也開宗明義說是「developer preview」,未來仍有 breaking changes)
  • Forks:3,041
  • 語言:TypeScript
  • 授權:MIT
  • Open issues:0(Issue 系統關閉,改走 Discussions)
  • size:117 MB
  • 啟用 Discussions:是
  • 啟用 Wiki / Pages / Projects:否

質疑一:24 小時破 24k stars 是真的熱度還是 hype?

DeepSeek 過去一年(V3、R1、V3.5、V4-Flash、V4-Pro)每次發表都有數千到上萬 star 灌入,社群基本盤是中國開源開發者 + 西方 AI 好奇族。這次的 24k star 跟前幾次比起來算「正常熱度」,沒有破紀錄。要判斷真實採用率,要看 30 天後的 star 留存率、issue/discussion 活動、第三方 fork 是否進入 production。

質疑二:Cordis 是新框架嗎?

對。Cordis 由 Cordiverse 這個獨立組織維護,目前在 GitHub 上的能見度遠低於 LangChain、LlamaIndex、Semantic Kernel。DeepSeek 把整個 agent runtime 押在這個新框架上,是一個 strategic bet——如果 Cordis 之後維護不力,整個 dsh 都會受影響。短期內 DeepSeek 顯然會 fork 維護,但長期要看 Cordiverse 能不能建立穩定的社群。

質疑三:開源 agent framework 的真正敵人不是授權

過去兩年開源 coding agent(Continue、Aider、Cline、Roo Code)雨後春筍,瓶頸不在授權,而在 模型品質 + 工具整合。即使 Harness 開源,如果用 DeepSeek V4-Flash 跑出來的分數還是比 Claude Opus 4.7 差 7 個百分點(SWE-bench Verified),企業仍然會選閉源。換言之,Harness 開源是必要條件,不是充分條件。

質疑四:會不會只是 V4-Pro 的行銷配套?

很有可能。DeepSeek 選在 V4-Pro 發表隔天開源 Harness,剛好是 SWE-bench 80.6% 數字還熱的時候。Harness 的 minimal mode 正是 V4-Flash 跑 benchmark 用的環境——公開這個環境 = 讓外界能驗證 benchmark 結果 = 增加可信度。但若 V4-Pro 後續在 production agent 任務表現不如預期,Harness 開源的紅利會迅速蒸發。


怎麼自己跑起來

如果你想親自試,兩個最快的路徑:

  1. Web UI(30 秒上手):

    npx @deepseek-ai/dsh web

    開 http://127.0.0.1:3080,預設會看到 Creator mode。

  2. Source build(進階):

    git clone https://github.com/deepseek-ai/deepseek-harness.git
    cd deepseek-harness
    pnpm install
    pnpm run build
    pnpm dsh web

    然後 dsh --profile web --dump-config 看 plugin tree。

社群目前分散在:


Siami 結論

DeepSeek Harness 是 2026 年夏天開源 agent framework 領域最重要的一次發表。它的破壞力不在於「又一個 coding agent」,而在於把整個 agent runtime 變成可重組、可審計、可合規的開源組件。對中國以外的企業客戶,這是第一次可以在不繞過 ToS 的前提下,拿到完整的 agent trace;對中國社群,這是繼 V3、R1 之後又一次「DeepSeek 把模型之外的關鍵層也開源」的信號。

接下來 30 天值得追的三個訊號:

  1. 第三方 fork 是否進入 production——目前 3,041 forks 中有沒有企業把它拿來跑 production workflow。
  2. Cordiverse 的維護節奏——Cordis 框架本身的 issue 回應速度、release 頻率會直接影響 dsh 的長期可行性。
  3. Anthropic / OpenAI 的反應——是否會被迫開源部分 Claude Code / Codex 的 prompt assembly 邏輯,或者推出更完整的 enterprise audit tier 來對抗。

短期看,Harness 還在 0.1.0-rc 階段(README 用全大寫警告「THERE WILL BE COMPATIBILITY-BREAKING CHANGES」),不建議直接用在 production。但對想理解「下一代 agent OS 會長怎樣」的開發者,這份原始碼值得花一個週末翻一遍。


影片解說

Prism Labs 頻道在 DeepSeek Harness 上線當天錄製的深度解說,涵蓋 Cordis plugin 架構、append-only session log、四種 runtime mode,並對比 Claude Code。


延伸閱讀

網友熱門留言 (7)

#1 SwellJoe (HN) ▲ 234
「Every run is traceable — everything the model sees is recorded in an append-only session log」是個殺手級特色。美國模型(OpenAI / Anthropic / Google)不會讓你這樣做,因為他們的 traces 是加密、混淆的,要繞過 ToS 才能萃取。如果想改進跟模型協作的工具,就必須能看到模型怎麼思考和處理資料。DeepSeek 的可追溯 trace 在這一塊無人能及。
#2 alansaber (HN) ▲ 87
同意這是 killer feature。美國模型刻意混淆 CoT(理由是 A. 讓輸出看起來比較好、B. 防蒸餾攻擊),但 raw trace 其實很難直接拿來推理。儘管如此,這個方向仍然是對的一步。
#3 Phemist (HN) ▲ 56
用法是用更聰明的模型來檢視 traces、找出當前 harness 對當前 LLM 的瓶頸在哪裡,然後調整 prompts 或 tools 來修。這才是 append-only log 的真正威力。
#4 mickeyp (HN) ▲ 42
我用同樣的方式做了一個叫 dreamcoder 的 AI agent — event sourced architecture 寫進 SQLite、用 recursive CTEs 解析查詢(外加 sneaky projections 加速),給 AI 一模一樣、穩定的訊息鏈,加完整 introspection。還送了 constraint-satisfaction solver 做 tiling window manager,所以視窗永遠不會重疊。
#5 hmokiguess (HN) ▲ 18
我今天是透過 Tailscale Aperture 作為 AI Gateway 拿到 trace 功能的,強烈推薦。
#6 miroljub (HN) ▲ 15
請問跟 Pi 已經做的有什麼差別?
#7 SwellJoe (HN) ▲ 38
Pi 只能 log 模型顯示給它看的東西。許多模型會把 thinking traces 藏起來,只給一個 hash,要 resume 時才能還原。DeepSeek 是直接給你 CoT traces,可能是目前唯一這樣做的模型。Kimi 訂閱服務(Kimi Code)後來也不再給 CoT traces 了。GLM 或 Qwen 3.8 Max 我沒測,但猜也是同樣情況。