← 返回 Siami 首頁

DeepSeek V4-Flash-Vision 上線:多模態模型逼近 Opus-4.8,圖片算 384 tokens

▲ 7 💬 54
DeepSeek V4-Flash-Vision 上線:多模態模型逼近 Opus-4.8,圖片算 384 tokens

編按:本文綜合整理自 IT之家報導 與 DeepSeek 官方 API 文件,並加入 Siami 編輯部觀點與分析。

深度求索(DeepSeek)8 月 21 日宣布全新的多模態視覺理解模型 DeepSeek-V4-Flash-Vision-Exp 正式上線 DeepSeek API 平台。這是 V4-Flash 系列首次加入視覺能力,也是中國開源陣營對 GPT-4o、Claude Opus-4.8 等閉源旗艦多模態模型的最新一次正面挑戰。


模型定位:V4-Flash 系列的視覺補完

DeepSeek 官方將 V4-Flash-Vision-Exp 定位為 V4-Flash 純文字版的「視覺補完」版本,定位上明顯走輕量、快速、低價路線:

  • 純文字能力(Agent、推理、世界知識):與 DeepSeek-V4-Flash 正式版持平
  • 視覺理解 Agent Benchmark:相比 V4-Flash 純文字版大幅躍升,多模態 Agent 能力「已接近 Opus-4.8」
  • 性質標籤:IT之家在報導中特別強調,這是「實驗性質」模型(-Exp 後綴),用戶可透過 model='deepseek-v4-flash-vision-exp' 存取

官方說法是「在 Agent 框架內展現較好的多模態適配能力」,這意味 DeepSeek 把這個模型設計成「Agent 眼睛」,不是給人看圖用的。


API 與計費:用 token 思維處理圖片

V4-Flash-Vision-Exp 的計價邏輯值得特別注意:DeepSeek 並沒有用「張」計價,而是把圖片轉成 token 再按 token 計費。

  • 圖片上限:一張圖最多佔 384 tokens
  • 計費價格:與 V4-Flash 純文字版一致(off-peak $0.22/1M input、peak $0.44/1M input)
  • 支援格式:JPEG、PNG、GIF、WebP
  • 支援呼叫格式:Chat Completions、Messages、Responses 三種
  • 圖片傳入方式:base64 內聯、外部 URL、Files API 三選一
模型1M Input(peak)1M Output(peak)並發上限
V4-Flash-0731$0.44$1.322500
V4-Pro-0813$1.32$3.96500
V4-Flash-Vision-Exp$0.44$1.322500

Files API 同步開放:免費省頻寬

隨著 V4-Flash-Vision-Exp 上線,DeepSeek 同步開放了 Files API:

  • 不收費(只佔儲存,不收流量費)
  • 開發者可先把圖片上傳到平台,再用 file_id 在請求中引用
  • 同一張圖在多輪對話中不需要重複上傳

這對 Agent 場景特別重要——一個 screenshot 可能要被 Agent 反覆傳給多個子任務處理,每次都重傳 base64 會浪費頻寬與延遲。


🚨 為什麼這件事重要

Siami 編輯部認為,這次發布表面上只是「V4-Flash 加了視覺能力」,實際上有三層訊號:

  1. 中國閉源 + 多模態路線收窄:DeepSeek 沒選擇開源這版多模態模型,而是放到 API 平台上以閉源方式提供。這顯示多模態模型的工程複雜度(特別是 RLHF 階段)仍然超過純文字模型,連 DeepSeek 都不敢貿然開源。
  2. Agent-first 定價策略:圖片算 token、並發上限拉到 2500、Files API 免費——這三個組合明顯是衝著「自動化 Agent 跑批次任務」這個使用情境。DeepSeek 在搶的不是 ChatGPT Plus 用戶,是程式設計師。
  3. 逼近 Opus-4.8 的訊號:官方說「多模態 Agent 能力接近 Opus-4.8」,但用的是「接近」而不是「超越」。這個字眼選擇很關鍵——如果 DeepSeek 真的超越,他們一定會大聲講,沒講表示這是個有差距的接近。

🚨 數據解讀與質疑

「多模態 Agent 能力接近 Opus-4.8」這句話要拆開來看。

  • 「接近」的具體差距:DeepSeek 沒有公開具體 benchmark 數字與 Opus-4.8 的差距。如果只是「某些 benchmark 接近、其他落後」,那這個「接近」就有行銷包裝的成分。
  • Exp 後綴的預期管理:官方把這版標成 -Exp(experimental),代表這不是最終版。對開發者來說,等 V4-Pro-Vision 正式版才會是真正的「生產可用」標竿。
  • 一張圖 384 tokens 的真實成本:以 peak 計價計算,一張圖大約值 0.000169 美元(約新台幣 0.005 元)。這個數字看起來便宜,但 Agent 場景下一個任務可能傳十幾張圖,累積起來跟 GPT-4o vision 的差距就會縮小。
  • Files API 不收費是暫時還是永久:官方說「現已開放,該 API 不收費」,但沒有承諾長期免費。如果未來 Files API 開始收儲存費,整個成本模型會重新洗牌。

開發者該關注的事

如果你正在評估是否把 V4-Flash-Vision-Exp 接入生產環境,可以從這幾個面向評估:

  • Agent 框架適配:官方說「支援多樣化 Agent 工具」,但 LangChain / LlamaIndex / AutoGen 的實際整合品質還需要社群驗證
  • 長 context 與 Vision 的搭配:V4-Flash 系列 context 長度 1M、max output 384K,但視覺模型在長 context 下的表現是否會掉,是實戰要驗證的重點
  • 跟 V4-Pro-Vision 正式版的距離:這個 Exp 版本更多是給開發者嘗鮮的 preview,正式版應該在幾個月內會出

編按:本文綜合整理自 IT之家報導 與 DeepSeek 官方 API 文件,並加入 Siami 編輯部觀點與分析。模型仍標 -Exp 實驗性質,部署到生產前請先小規模驗證。

網友熱門留言 (3)

#1 IT之家網友 花雨龘魔王 ▲ 12
V4-Flash-Vision-Exp 在視覺理解任務上比起 V4-Flash 純文字版是質的提升,期待後續 V4-Pro 也能加上視覺能力。
#2 IT之家網友 gggxbbb ▲ 9
Files API 不收費這個設計很貼心,多輪對話場景下能省下不少 token 成本。
#3 IT之家網友 阿狗 ▲ 6
一張圖最多 384 tokens,換算下來圖文混合的成本控制得住,跟 Claude 那邊動輒上千 token 的計價方式差很多。