← 返回 Siami 首頁

DeepSeek V4 Flash 0731 正式版發布:13B 激活參數在 ARC-AGI-2 跑出 61.4%,成本僅同級模型三成

▲ 316 💬 193
DeepSeek V4 Flash 0731 正式版發布:13B 激活參數在 ARC-AGI-2 跑出 61.4%,成本僅同級模型三成

編按:本文綜合整理自 ARC Prize 官方頁面Artificial Analysis 獨立評測DeepSeek 官方 API 更新公告 與 Hacker News 討論串(316 分、193 則留言),並加入 Siami 編輯部觀點與分析。

DeepSeek 在 7 月 31 日無預警地把 V4 Flash 模型從 preview 升級成正式版,命名為 DeepSeek-V4-Flash-0731。這次最大的亮點不是新架構,而是用完全相同的 284B MoE(13B active)參數,靠重新訓練後段任務,在 ARC-AGI-2 半私有測試拿到 61.4% 分數,並把自家 V4-Pro-Preview 的 agentic 基準全部超越。

正式版核心成績

DeepSeek-V4-Flash-0731 同步在 ARC Prize 與 Artificial Analysis 兩個獨立第三方平台取得結果:

  • ARC-AGI-1 半私有:最高推理強度下 89.0%,單題成本 0.02 美元
  • ARC-AGI-2 半私有:最高強度下 61.4%,單題成本 0.04 美元
  • Artificial Analysis Intelligence Index:50 分,比 4 月發布的 preview 版本(40 分)一口氣拉高 10 分,比自家 V4-Pro-Preview 還高 6 分
  • GDPval-AA v2(真實 agentic 任務 Elo):1559,比前代 1189 提升 370 點

三種推理強度變體 Max / High / Low 在 ARC-AGI-2 上分別為 61.4%、56.0%、46.0%,意味著使用者可以依場景取捨成本與品質,Low 模式單題成本可能壓到 0.01 美元以下。


架構沒動、價格照舊、訓練後段大改

DeepSeek 官方在 API 更新公告明確指出,0731 版本保留了與 preview 相同的 284B 總參數、13B active 的 MoE 架構與 1M token 上下文,模型形狀完全沒變。改動集中在三件事:

  1. Agent 與 coding 行為大幅強化(tool use、Code Agent 多步推理)
  2. 支援 Responses API 與 Codex 整合(對齊 OpenAI Responses API 介面)
  3. 第一方 API 緩存命中折扣拉到約 98%(業界普遍 90%)

API 定價維持 $0.14 / 百萬 input token、$0.28 / 百萬 output token,緩存命中只收 $0.0028。Artificial Analysis 指出,這個緩存結構讓 0731 在「每任務成本」上比同日降價的 GPT-5.6 Luna(max)便宜約 60%,即使兩者 Intelligence Index 只差 1 分。

同一個權重檔案、同樣的參數量、同一個上下文長度,卻靠後訓練在 agentic benchmark 上贏過自家 49B active 的 Pro preview。這代表 Mixture-ofExperts 與 sparse attention 的潛力還遠遠沒榨乾,後訓練資料 + 對齊方法的紅利,比硬體升級更具槓桿。


為什麼這件事重要

這次更新從產業結構與工程實務兩個層面都值得關注。

1. 「後訓練紅利」壓過「架構升級」

過去兩年大模型競爭主旋律是「參數量更大、訓練資料更多、架構更新」。DeepSeek 用同一個 13B active 的 MoE 主幹,靠 RLHF 與 agentic SFT 把能力拉過 49B 的 Pro preview,證明後訓練階段還有大量未開採空間。這對中小型實驗室是好消息——沒有萬張 GPU 也可以把既有架構榨出來。

2. 中國開源模型的「軍備競賽」進入第二階段

0731 上線一個禮拜前,Inkling Small 也在 Artificial Analysis 拿到與舊版 V4 Flash 接近的分數;同一個月,Qwen3.8 Max 拿下 agentic index 第一。現在 DeepSeek 0731 又把性價比拉到新高度。中國開源生態不再只是「追 frontier」,而是開始在特定維度(成本、agentic、code)局部超越。

3. 「每任務成本」正式成為新的戰場

Artificial Analysis 在 8 月初推出 Endpoint Accuracy Index,明確認為「同模型不同 endpoint 會有不同準確率」。DeepSeek 0731 在官方 API 上的性價比表現,會逼迫其他家(OpenAI、Anthropic、Google)把緩存折扣、batch 價、長上下文優化當作下一輪競爭重點。


數據解讀與質疑

質疑一:ARC-AGI-2 從 61.4% 看起來很強,但對比基準是誰?

ARC Prize 公開的榜單中,DeepSeek V4 Flash 0731 的 61.4%(Max)與 Gemini 3.6 Flash、GLM-5.2(max, 51)幾乎同級,但仍比開放權重前沿 Kimi K3(max, 57)低 7 分。在 ARC-AGI-1 上拿到 89.0% 看似碾壓,但要注意 ARC-AGI-1 已被多數前沿模型逼近天花板,這個分數的邊際意義正在遞減

質疑二:「後訓練沒換架構」到底是優勢還是侷限?

DeepSeek 強調「架構沒動」是為了說明成本控制得宜,但也代表 0731沒辦法解決 preview 既有的硬傷(例如長上下文推理的稀疏注意力衰減、特定多語言任務偏弱)。Artificial Analysis 同時也指出 0731 在 SimpleQA 上只有 23.1%,比 V4-Pro-Preview 的 57.9% 整整低了 34.8 個百分點——agentic 強化犧牲了事實精度的天花板

質疑三:「Responses API 對齊」是加分還是鎖定?

DeepSeek 把 0731 對齊 OpenAI Responses API 介面,雖然降低開發者遷移成本,但也代表 Siami 等下游應用如果要走 OpenAI 生態,會更難跳脫 OpenAI 的 spec 控制權。對開源社群來說,這是「用 DeepSeek 換取更便宜的 OpenAI 兼容」——是雙刃劍。


開發者怎麼用

  • API 設定:把 model 欄位改成 deepseek-v4-flash,API URL 不變。
  • 參數建議:Agent / Code Agent 任務用 Max 模式(temperature=1.0、top_p=0.95);一般對話可用 Low 模式壓成本。
  • 本地部署:DeepSeek 預告完整權重會在數週內釋出,先前 preview 的 284B MoE 在 128GB VRAM(DGX Spark、Mac Studio M3 Ultra)已經跑得動,0731 預期同量級。
  • 緩存策略:官方緩存命中 98% 折扣代表 prompt 重複時幾乎免費,適合 RAG、agent loop、批次評測場景。

DeepSeek 0731 正式版給市場的訊號很清楚:下一輪 LLM 競爭不是看誰的模型大,而是看誰能把相同骨架榨出更高性價比。Artificial Analysis 已經把 0731 標記為 Pareto frontier 上的代表模型,對企業 agent 部署來說,現在是重新評估單位任務成本的時間點。

網友熱門留言 (6)

#1 r/LocalLLaMA 用戶 ▲ 273
They saw Inkling Small got released yesterday with the same score as ds v4 flash on artificial analysis and said nope, try harder. 一個禮拜內連續被兩家中國開源模型追上,競爭強度真的驚人。
#2 r/LocalLLaMA 用戶 ▲ 156
v4-flash being this cheap and this good is kinda unfair to everyone else lol. workhorse model for sure. 13B active 跑出這個分數,價格又這麼便宜,其他開源模型真的要緊張了。
#3 r/LocalLLaMA 用戶 ▲ 87
the size/perf part is the actual jumpscare here. benchmarks can lie, but if this thing is even close to GLM 5.2 in real coding runs at that size, that's the kind of model people start building terrible hardware excuses around. 參數規模對比性能的落差才是真正的震撼,就算 benchmark 會騙人,實戰 coding 能逼近 GLM 5.2 就值得為了它換顯卡了。
#4 Reddit 用戶 (r/accelerate) ▲ 218
110M tokens for $0.77 is wild. that's the thing about flash honestly, once it's that cheap you stop counting, you just retry when it's wrong instead of agonizing over prompts. 1.1 億 token 不到一美元,這個價格根本不用算 token,看到答案不對就重試,根本不用糾結 prompt。
#5 Hacker News 用戶 ▲ 245
Post-training still has enormous room to run on a fixed architecture - a 13-billion-active model now beats its own 49-billion-active sibling on most agentic benchmarks. 同樣架構只換 post-training,13B active 模型竟然能贏過自家 49B 的 Pro 版本,後訓練還有非常大的紅利。
#6 r/LocalLLaMA 用戶 ▲ 92
Well 128 gb gang, we have our Qwen3.6 27B killer and then some. 128GB VRAM 的本地玩家有福了,這個量級的模型直接跑得動。